Video from image, audio references
Grok Imagine Video 1.5 Reference to Video adalah model image-to-video dari xAI yang mengubah gambar referensi dan prompt tertulis Anda menjadi klip video animasi. Alih-alih memulai dari nol, Anda berikan model satu atau lebih gambar referensi dan deskripsikan adegan yang diinginkan, kemudian biarkan model menghasilkan gerakan yang membawa gaya dan konten dari referensi tersebut menjadi video jadi.
Yang membedakan model ini adalah cara penggunaan referensinya. Anda dapat menyediakan dari satu hingga tujuh gambar referensi, dan model memperlakukannya sebagai panduan untuk gaya maupun konten. Dalam prompt Anda, tunjuk gambar spesifik menggunakan tag sederhana seperti <IMAGE_0>, <IMAGE_1>, dan seterusnya. Ini memungkinkan Anda menulis arahan seperti "Orang dari <IMAGE_0> berjalan melalui jalan hujan berlampu neon," sehingga model tahu persis subjek atau elemen gaya mana yang diambil dari setiap gambar. Sistem tagging itu memberikan kontrol kreatif presisi atas bagaimana sumber visual bergabung dalam satu tembakan, yang sangat berguna saat ingin karakter dari satu gambar muncul di pengaturan atau gaya dari gambar lain.
Model ini dirancang untuk karya bergaya dan transformatif dengan kemampuan lip-sync, sehingga sangat cocok untuk menghidupkan karakter dan potret dengan gerakan ekspresif yang terkoordinasi. Karena menerima masukan gambar, audio, dan teks, Anda dapat lapiskan berbagai arahan sekaligus: gambar untuk menetapkan tampilan, teks untuk mendeskripsikan aksi, dan audio untuk memandu waktu serta gerakan mulut. Keluarannya selalu berupa file video, siap dimasukkan ke editan atau dibagikan langsung.
Profesional kreatif akan menemukan fleksibilitas besar dalam pembingkaian dan tempo klip akhir. Anda dapat pilih dari berbagai rasio aspek, termasuk widescreen 16:9 untuk tampilan sinematik dan desktop, vertikal 9:16 untuk format sosial vertikal seperti reels dan stories, persegi 1:1 untuk feed, serta opsi di antaranya seperti 4:3, 3:2, 2:3, dan 3:4. Ini berarti Anda dapat hasilkan video yang disesuaikan dengan platform atau tata letak yang diinginkan tanpa pemotongan atau reformatting setelahnya. Panjang video juga dapat disesuaikan, dari satu detik hingga lima belas detik, sehingga Anda bisa buat loop cepat, adegan pendek, atau urutan lebih panjang sesuai proyek.
Untuk kualitas keluaran, model menawarkan dua pilihan resolusi: 480p untuk klip lebih cepat dan ringan, serta 720p untuk hasil lebih tajam dan detail tinggi. Contoh keluaran berjalan pada 24 frames per second, memberikan gerakan yang halus seperti film. Klip widescreen 720p keluar pada 1280 by 720 pixels, yang cocok untuk sebagian besar konteks online dan pratinjau.
Siapa yang paling diuntungkan dari model ini? Seniman dan ilustrator dapat animasikan karya seni atau desain karakter yang ada, menyaksikan karya statis bergerak dan beraksi. Desainer dapat ubah papan referensi dan gambar mood menjadi potongan konsep bergerak. Pembuat film dan video dapat prototipe tembakan dengan menggabungkan subjek dan lingkungan yang dideskripsikan, menghasilkan klip pravisualisasi cepat sebelum produksi penuh. Pembuat konten di berbagai platform sosial dapat ubah gambar referensi menjadi video pendek bergaya yang diformat tepat untuk feed vertikal, persegi, atau widescreen. Karena mendukung lip-sync, siapa pun yang produksi karakter bicara, avatar animasi, atau short bercerita dapat padukan potret dengan audio untuk ciptakan klip performa tersinkronisasi.
Hasil terbaik didapat dari prompting yang teliti. Karena model membaca gambar referensi dan deskripsi teks Anda, deskripsikan aksi dengan jelas sambil tagging gambar yang tepat membantu model paham apa yang harus bergerak dan bagaimana. Saat gunakan beberapa referensi, tetapkan peran masing-masing dalam prompt, seperti satu gambar untuk karakter dan satu lagi untuk lingkungan atau gaya, agar komposisi tetap koheren. Ingat bahwa Anda dapat gabungkan hingga tujuh gambar, yang memberikan ruang untuk bangun adegan berlapis kaya, tapi set referensi terfokus dengan prompt jelas sering hasilkan output paling bersih dan terkendali.
Beberapa pertimbangan praktis patut diingat. Setidaknya satu gambar referensi dan prompt teks diperlukan untuk setiap generasi, karena model dibangun di sekitar panduan visual referensi daripada generasi dari teks saja. Resolusi maksimal 720p, sehingga model ini ditujukan untuk video bergaya, transformatif, dan siap sosial daripada finishing resolusi tinggi format besar. Panjang klip dibatasi lima belas detik, yang cocok untuk cerita pendek, loop, dan konten sosial. Dalam batas itu, kombinasi referensi multi-gambar, pembingkaian fleksibel, durasi dapat disesuaikan, dan lip-sync menjadikannya alat serbaguna untuk ubah gambar diam menjadi gerakan ekspresif.
Singkatnya, Grok Imagine Video 1.5 Reference to Video adalah alat animasi berbasis referensi yang memberikan kreator kontrol langsung atas bagaimana gambar mereka menjadi video. Dengan memungkinkan tagging referensi spesifik di dalam prompt, pilih dari set rasio aspek luas, sesuaikan panjang dan resolusi, bahkan sinkronkan gerakan mulut dengan audio, model ini menempatkan keputusan kreatif di tangan Anda sambil tangani generasi gerakan.
Add the image that you want change
Tambahkan gambar opsional untuk memandu tampilan, karakter, atau lingkungan
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Ketik prompt - Model memahami fisika, pencahayaan, dan maksud emosional dari adegan Anda
Klik untuk membuat hasil akhir Anda dan unduh video berkualitas produksi
Menunjukkan parallax referensi multi-gambar saat kamera meluncur melalui pintu dengan latar depan bergeser lebih cepat daripada latar belakang. Pameran arsitektur sinematik 16:9.
Menyoroti fisika kausal: hujan dimulai di tengah klip, tetesan membentuk riak genangan dan menggelapkan trotoar secara berurutan. Transformasi atmosfer lebar sinematik.
Cinemagraph ramah loop mulus di mana uap melingkar dan pantulan neon berkilau sementara segala sesuatu lain membeku. Sempurna untuk ambiance lanskap loop tak berujung.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Beralih ke sintesis berbasis penalaran hari ini

Animate image to 1080p video
2.8 kredit

Animate images into cinematic video
0.6 kredit

Multimodal references to video
10 kredit

Cinematic video from images fast
0.1 kredit
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 kredit

Animate images into 2K video
7.8 kredit

Animate images into video with audio
10 kredit

Cinematic video from images
10 kredit