Text to video with audio
Grok Imagine Video 1.5 (Text to Video), dikembangkan oleh xAI, mengubah prompt tertulis menjadi klip video pendek lengkap dengan audio. Alih-alih menggunakan alat terpisah untuk visual dan suara, Anda cukup mendeskripsikan adegan yang diinginkan dalam bahasa sehari-hari dan model ini akan menghasilkan klip jadi dengan gerakan dan trek audio sendiri. Cara ini sangat cepat dan mandiri bagi kreator untuk menguji ide, membangun konten sosial, dan memprototipe gambar bergerak tanpa kamera, aktor, atau studio editing.
Pada intinya, model ini membaca deskripsi teks dan menafsirkan baik subjek maupun cara geraknya. Prompt seperti "Seekor anak kucing putih mengejar kupu-kupu di taman yang diterangi matahari, pergerakan kamera lembut, gerakan alami, cahaya sore yang lembut menembus dedaunan" memberikan semua hal yang dibutuhkan model: subjek, aksi, perilaku kamera, dan suasana pencahayaan. Karena model ini merespon arahan sinematik detail seperti ini, Anda dapat membentuk tidak hanya apa yang muncul di layar tetapi juga bagaimana kamera bergerak dan bagaimana cahaya jatuh di adegan. Contoh prompt juga menunjukkan kemampuannya pada karya bergaya seperti anime dan estetika shojo dengan garis kecepatan, bunga sakura, warna mencolok, dan karakter ekspresif, sehingga mudah berpindah antara tampilan fotorealistik dan ilustrasi.
Anda mengendalikan durasi setiap klip, bisa memilih mulai dari 1 hingga 15 detik. Klip pendek cocok untuk loop cepat, momen reaksi, dan potongan sosial, sedangkan durasi lebih lama memberi ruang untuk beat penuh atau cerita singkat. Durasi default sekitar 6 detik, pas untuk ide satu adegan. Output diputar di 24 frame per detik, menciptakan gerakan halus seperti film.
Resolusi dapat diatur dalam tiga tingkat: 480p untuk draft cepat dan tes kasar, 720p sebagai standar sehari-hari yang solid, dan 1080p untuk hasil paling tajam dan detail. Anda bisa iterasi cepat di resolusi rendah sambil menyempurnakan prompt, lalu hasilkan versi final bersih dengan kualitas tinggi setelah yakin dengan arahannya.
Rasio aspek sepenuhnya fleksibel, dengan berbagai bentuk untuk disesuaikan di mana pun video Anda akan ditampilkan. Anda dapat membuat video widescreen klasik 16:9 untuk mode landscape, 9:16 vertikal untuk feed ponsel dan story, persegi 1:1 untuk posting grid, dan rasio lain seperti 4:3, 3:2, 2:3, dan 3:4. Karena Anda bisa membingkai vertikal atau horizontal dari prompt yang sama, model ini sangat cocok untuk alur kerja konten multiplatform di mana ide yang sama perlu hadir di berbagai format.
Salah satu fitur unggulan adalah audio bawaan. Alih-alih memberikan klip tanpa suara yang harus Anda tambahkan secara terpisah, Grok Imagine Video 1.5 menghasilkan video dengan trek audio langsung. Prompt teks diubah menjadi momen siap tayang dengan suara, sangat bermanfaat untuk konsep singkat, uji mood, dan konten sosial di mana audio menambah dampak tanpa langkah tambahan.
Kolom prompt sangat luas, menerima deskripsi panjang dan kaya detail hingga ribuan karakter. Ruang ini mendukung presisi: Anda dapat menambahkan subjek, aksi, gerakan kamera, pencahayaan, palet warna, gaya seni, dan suasana hanya dalam satu kalimat. Contoh prompt menunjukkan, menuliskan detail seperti "tracking kamera lembut", "cahaya sore yang lembut", "speed lines menandakan gerakan cepat," atau estetika tertentu akan membuat model merespons lebih dekat pada keinginan Anda.
Model ini sangat cocok untuk berbagai profesional kreatif. Kreator media sosial dan marketer bisa dengan cepat menghasilkan klip vertikal atau persegi yang menarik. Pembuat film dan animator bisa menggunakannya untuk previz shot, merencanakan gerakan kamera, dan mengeksplorasi tampilan sebelum produksi penuh. Ilustrator dan desainer bisa menghidupkan dunia bergaya dengan gerakan dan suara. Konsep artis dan storyteller dapat menguji mood, tempo, dan ide visual dengan cepat, menghasilkan beberapa variasi untuk dibandingkan. Karena sepenuhnya berbasis teks tanpa perlu footage sumber, hambatan bagi siapa pun yang ingin membuat gambar bergerak tanpa perlengkapan atau anggaran besar jadi sangat rendah.
Beberapa hal praktis perlu diingat. Model ini hanya bekerja dari teks, tanpa input gambar atau referensi, sehingga semua dihasilkan dari deskripsi tertulis Anda. Prosesnya tetap sederhana, namun itu berarti kejelasan dan detail prompt Anda sangat menentukan hasil; prompt yang samar akan menghasilkan hasil yang lebih generik daripada deskripsi yang terperinci. Durasi klip maksimal 15 detik, jadi model ini lebih cocok untuk momen singkat dan satu adegan, bukan urutan panjang, meski Anda bisa menggabungkan beberapa klip untuk rangkaian lebih panjang. Permintaan tunduk pada ketentuan penggunaan xAI.
Secara keseluruhan, Grok Imagine Video 1.5 (Text to Video) adalah cara serba guna dan mandiri untuk mengubah ide dalam bentuk kata menjadi video pendek dengan suara. Dengan durasi bisa diatur hingga 15 detik, tiga tingkat resolusi hingga 1080p, pilihan rasio aspek lengkap, gerakan mulus 24fps, serta audio bawaan, model ini memberikan titik awal fleksibel untuk segalanya dari eksperimen sosial cepat hingga konsep visual yang dipoles.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Jelaskan adegan video Anda beserta gerakan, sudut kamera, dan suasana
Model menciptakan gerakan sinematik dengan fisika dan pencahayaan alami
Unduh dan bagikan video siap produksi Anda
Menampilkan kontrol kamera agresif dengan satu shot FPV drone yang mustahil, membuktikan kemampuan model dalam mengendalikan gerakan kontinu dan skala dinamis pada tampilan widescreen.
Memanfaatkan realisme model untuk komedi absurd fake-bodycam dengan dialog sinkron, format yang dirancang viral lewat autentikasi deadpan.
Menampilkan kontrol kamera presisi dan gerak temporal dengan hyperlapse yang dipercepat serta dinamika light-trail kontinu, sempurna untuk klip heroik sinematik 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Beralih ke sintesis berbasis penalaran hari ini

Cinematic video with native audio
1.4 kredit
Text to video with audio
0.7 kredit

Fast cinematic video with audio
0.1 kredit

Film-grade video with audio
0.1 kredit

Frontier 2K text-to-video generation
7.3 kredit
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 kredit

Cinematic video from references
0.4 kredit

Cinematic video from references
10 kredit

Fast balanced text-to-video generation
1.6 kredit