Text to video with audio
Grok Imagine Video 1.5 (Text to Video), yang dibangunkan oleh xAI, menukar prompt bertulis kepada klip video pendek lengkap dengan audio. Daripada menggabungkan alat berasingan untuk visual dan bunyi, anda huraikan adegan yang diingini dalam bahasa mudah dan model menghasilkan klip siap dengan gerakan serta jejak audio sendiri. Ini menjadikannya cara pantas dan lengkap untuk pencipta menguji idea, membina kandungan sosial, dan prototaip imej bergerak tanpa kamera, pelakon, atau perisian penyuntingan.
Intinya, model membaca huraian teks dan mentafsir subjek serta cara ia bergerak. Prompt seperti "Seekor anak kucing putih mengejar rama-rama merentasi taman yang diterangi matahari, pengesanan kamera lembut, gerakan semula jadi, cahaya petang lembut menembusi daun" memberi model segalanya yang diperlukan: subjek, aksi, tingkah laku kamera, dan mood pencahayaan. Oleh kerana ia bertindak balas kepada arahan sinematik terperinci seperti ini, anda boleh membentuk bukan sahaja apa yang muncul di skrin tetapi juga cara kamera bergerak dan cahaya jatuh merentasi adegan. Contoh prompt juga menunjukkan ia mengendalikan kerja bergaya seperti estetika anime dan shojo dengan garis kelajuan, bunga sakura, warna terang, dan watak ekspresif, jadi ia selesa beralih antara rupa fotorealistik dan bergambar.
Anda kawal panjang setiap klip, pilih mana-mana dari 1 hingga 15 saat. Klip pendek sesuai untuk gelung pantas, saat reaksi, dan petikan sosial, manakala tempoh lebih panjang memberi ruang untuk irama penuh atau saat naratif kecil. Panjang lalai sekitar 6 saat, yang sesuai untuk kebanyakan idea satu tembakan. Output dimainkan pada 24 frames per second, memberi gerakan cadence lancar seperti filem.
Resolusi boleh diselaraskan merentasi tiga peringkat: 480p untuk draf pantas dan ujian kasar, 720p sebagai standard harian yang kukuh, dan 1080p apabila anda mahu hasil paling tajam dan terperinci untuk karya siap. Ini membolehkan anda mengulang dengan cepat pada resolusi rendah sambil menyempurnakan prompt, kemudian hasilkan versi akhir bersih pada kualiti lebih tinggi setelah puas dengan arahannya.
Nisbah aspek sepenuhnya fleksibel, dengan pelbagai bentuk untuk sepadan dengan mana sahaja video anda akan berada. Anda boleh hasilkan widescreen klasik 16:9 untuk playback landskap, tinggi 9:16 untuk format menegak seperti suapan telefon dahulu dan cerita, persegi 1:1 untuk siaran grid, dan nisbah sederhana termasuk 4:3, 3:2, 2:3, dan 3:4. Oleh kerana anda boleh membingkai menegak atau mendatar dari prompt yang sama, model sesuai secara semula jadi ke dalam aliran kerja kandungan pelbagai platform di mana idea sama perlu muncul dalam beberapa format.
Salah satu ciri menonjol adalah audio asli. Daripada menghantar klip senyap yang kemudian anda perlu skor atau foley secara berasingan, Grok Imagine Video 1.5 menjana video dengan jejak audio penyerta pada masa yang sama. Ini menukar prompt teks kepada sesuatu yang lebih dekat dengan saat siap, yang amat berguna untuk kepingan konsep pantas, ujian mood, dan kandungan sosial di mana bunyi menambah kesan besar tanpa langkah tambahan.
Ruang prompt murah hati, menerima huraian panjang dan terperinci sehingga beberapa ribu aksara. Ruang itu membalas spesifisiti: anda boleh lapis subjek, aksi, gerakan kamera, pencahayaan, palet warna, gaya seni, dan mood dalam satu laluan. Seperti yang ditunjukkan oleh contoh prompt, menyeru butiran seperti "pengesanan kamera lembut," "cahaya petang lembut," "garis kelajuan menunjukkan tergesa-gesa," atau estetika bernama memberi model arahan jelas dan cenderung menghasilkan hasil lebih dekat dengan niat anda.
Model ini sesuai kuat untuk pelbagai profesional kreatif. Pencipta media sosial dan pemasar boleh hasilkan klip menegak atau persegi yang menarik perhatian dengan cepat. Pembuat filem dan animator boleh gunakannya untuk previsualisasi tembakan, blok gerakan kamera, dan meneroka rupa sebelum komited kepada pengeluaran penuh. Penggambar dan pereka boleh hidupkan dunia bergaya dengan gerakan dan bunyi. Seniman konsep dan pencerita boleh uji mood, irama, dan idea visual dengan cepat, menjana beberapa variasi untuk perbandingan. Oleh kerana ia didorong teks dan tidak memerlukan footage sumber, ia merendahkan halangan untuk sesiapa yang mahu imej bergerak tetapi tidak mempunyai gear atau bajet untuk tembakan tradisional.
Beberapa pertimbangan praktikal patut diingat. Model berfungsi sepenuhnya dari teks, tanpa input imej atau rujukan, jadi segalanya dijana dari huraian bertulis anda sahaja. Ini mengekalkan proses mudah, tetapi juga bermakna kejelasan dan butiran prompt anda lakukan kebanyakan kerja berat; prompt samar akan beri hasil lebih generik daripada yang dihuraikan dengan teliti. Panjang klip had 15 saat, jadi ini alat untuk saat pendek dan tembakan tunggal berbanding urutan berterusan panjang, walaupun anda boleh jana klip berganda untuk susun sesuatu yang lebih panjang. Permintaan tertakluk kepada terma penggunaan xAI.
Secara keseluruhan, Grok Imagine Video 1.5 (Text to Video) adalah cara serba boleh dan lengkap untuk pergi dari idea dalam kata-kata kepada video pendek pembawa bunyi. Dengan tempoh boleh laras sehingga 15 saat, tiga peringkat resolusi sehingga 1080p, julat penuh nisbah aspek, gerakan lancar 24fps, dan audio terbina, ia beri pencipta titik permulaan fleksibel untuk segalanya dari eksperimen sosial pantas kepada kepingan konsep yang dipoles.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Terangkan babak video anda dengan pergerakan, sudut kamera dan mood
Model mencipta pergerakan sinematik dengan fizik dan pencahayaan semula jadi
Muat turun dan kongsi video sedia-produksi anda
Pamer kawalan kamera agresif dengan gerakan drone FPV satu tembakan mustahil, membuktikan kawalan model ke atas gerakan berterusan dan skala dinamik dalam widescreen.
Manfaatkan realisme model untuk komedi absurdist bodycam palsu dengan dialog disinkron, format direka untuk viral melalui keaslian deadpan.
Tunjuk kawalan kamera tepat dan gerakan temporal dengan hiperlapce percepatan dan dinamik jejak cahaya berterusan, ideal untuk klip hero sinematik 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Beralih ke sintesis dipandu penaakulan hari ini

Cinematic video with native audio
1.4 kredit

Fast balanced text-to-video generation
1.6 kredit

Fast cinematic video with audio
0.1 kredit

Film-grade video with audio
0.1 kredit

Cinematic video from references
0.4 kredit

Frontier 2K text-to-video generation
7.3 kredit

Cinematic video from references
10 kredit
Text to video with audio
0.7 kredit
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 kredit