Video from image, audio references
Grok Imagine Video 1.5 Reference to Video, yang dibangunkan oleh xAI, menukar imej rujukan anda dan jejak audio pilihan menjadi video animasi penuh. Daripada bermula dari satu bingkai tunggal, model ini membolehkan anda memberinya satu set imej yang membimbing rupa dan kandungan klip akhir, kemudian menggabungkannya dengan prompt teks yang menerangkan pergerakan, suasana, dan tindakan yang anda mahu lihat. Hasilnya ialah video pendek yang diambil secara langsung daripada dunia visual yang anda berikan, menjadikannya sesuai untuk pencipta yang sudah mempunyai karya seni, foto, gambar produk, atau papan suasana dan mahu menghidupkannya.
Keupayaan utama di sini ialah rujukan imej berganda. Anda boleh menyediakan dari satu hingga tujuh imej rujukan, dan model menggunakan semuanya sebagai panduan gaya dan kandungan. Dalam prompt anda, anda tunjuk setiap imej secara individu, memberitahu model tepat bagaimana anda mahu elemen-elemen itu berhubung, bercampur, atau beralih. Ini memungkinkan anda menerangkan adegan seperti "terokai tempat dan grafik pergerakan keren menggunakan tiga imej ini" dan model akan menenunnya menjadi urutan yang koheren. Sama ada anda memasukkan watak, latar belakang, tekstur, dan palet warna, atau tiga variasi subjek yang sama, model menganggap setiap rujukan sebagai blok binaan.
Audio juga merupakan input utama. Anda boleh melampirkan satu klip audio rujukan, dan merujuknya dalam prompt anda bersama imej anda. Ini membuka pintu kepada prompt seperti mempunyai seseorang dari salah satu imej anda bercakap dengan suara dari jejak audio anda, membolehkan anda menyegerakkan persembahan lisan atau bunyi dengan visual yang anda sediakan. Oleh kerana imej dan audio boleh ditandakan secara langsung dalam prompt, anda mengekalkan kawalan halus ke atas sumbangan setiap elemen kepada video akhir.
Video output dihasilkan pada 24 frames per second dalam pilihan dua resolusi: pilihan 480p yang lebih ringan untuk ujian dan draf pantas, dan pilihan 720p yang lebih tajam untuk hasil yang lebih licin. Tempoh adalah fleksibel, dari serendah satu saat hingga lima belas saat, jadi anda boleh mencipta apa sahaja dari gelung pantas hingga adegan yang lebih panjang. Contoh output menunjukkan klip penuh 1280x720 yang berjalan sedikit lebih sepuluh saat pada 24fps, memberikan gambaran tentang panjang dan kelembutan yang boleh dihasilkan model dalam satu penjanaan.
Sokongan nisbah aspek adalah luas, meliputi widescreen 16:9 untuk kerja sinematik dan landskap, tinggi 9:16 untuk format sosial menegak, segi empat sama 1:1 untuk suapan, dan beberapa nisbah klasik di antaranya termasuk 4:3, 3:2, 2:3, dan 3:4. Julat ini bermakna anda boleh menyasar pembingkaian tepat yang diperlukan platform atau projek anda tanpa pemotongan selepas itu, sama ada anda membina pendek menegak, iklan segi empat sama, atau adegan widescreen.
Kawalan kreatif adalah mudah. Prompt teks anda melakukan kerja berat, menerangkan pergerakan dan cerita sambil menunjuk kepada imej rujukan dan audio anda. Anda pilih bilangan imej rujukan untuk dimasukkan dan susunan apa, tetapkan tempoh yang diingini, pilih resolusi anda, dan pilih nisbah aspek. Prompt boleh sangat terperinci, menyokong jumlah teks yang murah hati supaya anda boleh spesifik tentang bagaimana imej sepatutnya bergabung, apa yang patut bergerak, dan bagaimana adegan berkembang dari masa ke masa.
Siapa yang paling untung? Pembuat filem dan pencipta video boleh prototaip adegan dengan cepat dengan memasukkan seni konsep atau foto lokasi dan menerangkan tindakan. Pereka dan artis grafik pergerakan boleh menganimasikan komposisi statik dan campur pelbagai aset visual menjadi satu keping bergerak. Pencipta kandungan yang membuat video pendek menegak boleh tukar segenggam imej menjadi klip sedia diposkan dalam nisbah aspek yang betul. Pemasar dan pasukan produk boleh hidupkan gambar produk statik dengan prompt pergerakan deskriptif. Sesiapa yang bekerja dari perpustakaan visual sedia ada, daripada bermula dari kosong, akan dapati aliran kerja berasaskan rujukan ini sangat cekap kerana ia mengekalkan video akhir terikat kepada rupa yang sudah ada.
Beberapa pertimbangan praktikal patut diingat. Model memerlukan sekurang-kurangnya satu imej rujukan dan prompt teks untuk berjalan, dan menerima maksimum tujuh imej dan satu klip audio setiap penjanaan. Oleh kerana imej bertindak sebagai panduan gaya dan kandungan, memilih rujukan yang bersih, komposisi baik yang jelas mewakili apa yang anda mahu di skrin akan hasilkan keputusan paling boleh diramal. Menandakan setiap imej secara eksplisit dalam prompt anda memberikan kawalan paling jelas ke atas bagaimana ia bergabung. Model ini diluluskan untuk kegunaan komersial, menjadikannya sesuai untuk kerja klien dan projek diterbitkan. Seperti mana-mana perkhidmatan penjanaan, permintaan mesti mematuhi terma penggunaan xAI.
Secara ringkas, Grok Imagine Video 1.5 Reference to Video direka untuk pencipta yang mahu video mereka kekal setia kepada imej sumber spesifik sambil menambah pergerakan, dan secara pilihan suara atau bunyi. Dengan menggabungkan rujukan imej berganda, input audio, tempoh fleksibel sehingga lima belas saat, dua resolusi, dan julat penuh nisbah aspek, ia memberi anda cara fokus, terkawal untuk menganimasikan visual yang sudah anda peduli.
Add the image that you want change
Tambah imej pilihan untuk memandu rupa, watak atau persekitaran
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Taip gesaan - Model memahami fizik, pencahayaan dan niat emosi babak anda
Klik untuk menjana output akhir anda dan muat turun video bertaraf produksi
Menunjukkan rujukan imej berganda parallax apabila kamera meluncur melalui pintu dengan latar depan beralih lebih cepat daripada latar belakang. Pameran arkitektur sinematik 16:9.
Menyeriaikan fizik kausal: hujan bermula pertengahan klip, titisan membentuk riak lopuh dan gelapkan jalan raya secara berurutan. Transformasi atmosfera luas sinematik.
Cinemagraph mesra gelung lancar di mana wap melingkar dan pantulan neon berkilauan sambil segalanya lain beku. Sempurna untuk ambiance landskap gelung tanpa henti.
“Animate with subtle natural movements. Add gentle breathing motion to shoulders. Create natural eye blinks every 2-3 seconds. Introduce slight head micro-movements. Hair moves softly as if in gentle breeze. Maintain the warm smile with subtle lip movements. Eyes should have natural catchlight movement. Keep animation subtle and lifelike, not exaggerated. 5 seconds, smooth looping.”
Beralih ke sintesis dipandu penaakulan hari ini

Animate images into 2K video
7.8 kredit
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 kredit

Animate image to 1080p video
2.8 kredit

Animate images into video with audio
10 kredit

Multimodal references to video
10 kredit

Cinematic video from images
10 kredit

Animate images into cinematic video
0.6 kredit

Cinematic video from images fast
0.1 kredit