Multimodal references to video
Gemini Omni Flash adalah penjana video pelbagai mod yang menukar bahan rujukan anda menjadi video pendek lengkap dengan audio yang diselaraskan. Ciri uniknya ialah pelbagai jenis input yang boleh digabungkan serentak: anda boleh berikan teks yang menerangkan apa yang anda mahu, imej rujukan untuk mengunci subjek dan rupa, serta petunjuk audio dan video untuk mengawal pergerakan, gaya, dan bunyi. Daripada rujukan gabungan ini, model menghasilkan klip video siap dengan bunyi yang tertanam — bukan animasi senyap yang perlu anda tambah muzik selepasnya.
Inti Gemini Omni Flash ialah mengambil prompt bertulis bersama satu atau lebih imej rujukan dan menjana video yang menghormati kedua-duanya. Teks memberitahu model cerita, aksi, dan mood yang anda inginkan — seperti seekor kucing yang bermain-main memukul gulungan benang di ruang tamu yang diterangi cahaya matahari — manakala imej rujukan anda mengikat subjek, watak, atau estetika sebenar yang anda mahu lihat di skrin. Oleh kerana model menerima sehingga sepuluh imej rujukan, anda boleh sediakan pelbagai pengikat visual dan bahkan tetapkan peranan khusus untuk setiap satu menggunakan tag sebaris dalam prompt anda, supaya imej tertentu menjadi watak atau elemen tertentu dalam klip siap. Ini memberi anda kawalan bermakna ke atas siapa dan apa yang muncul, bukannya meninggalkannya kepada nasib.
Model ini direka untuk pencipta yang mahu lebih daripada gambar bergerak. Oleh kerana ia menjana audio bersama video, ia sesuai untuk kerja yang memerlukan bunyi dan pergerakan terhubung — transformasi bergaya dan lip-sync adalah kekuatannya. Ini menjadikannya sesuai untuk klip berasaskan watak, adegan bercakap ekspresif, tafsiran bergaya semula imej sumber anda, dan saat naratif pendek di mana bunyi perlu selaras dengan apa yang berlaku di skrin.
Siapa yang untung? Pencipta media sosial boleh ubah foto rujukan menjadi klip pendek menarik yang sudah ada audio, sedia untuk dipos. Pembuat filem dan animator boleh prototaip adegan dan uji bagaimana watak atau latar bergerak dan berbunyi sebelum komit kepada pengeluaran penuh. Pereka dan pemasar boleh ubah gambar produk atau imej jenama menjadi kepingan gerakan bergaya. Sesiapa yang bekerja dengan kandungan lip-sync — dari watak animasi hingga avatar ekspresif — boleh bergantung pada keupayaan model untuk selaraskan pergerakan mulut dan ucapan. Dan kerana anda pandu output dengan prompt bahasa biasa ditambah imej anda sendiri, anda tidak perlukan latihan teknikal untuk dapat hasil yang mencerminkan niat kreatif anda.
Mengenai format dan output, Gemini Omni Flash beri anda pilihan dua orientasi: bingkai landskap 16:9 lebar skrin yang sesuai untuk tontonan sinematik dan desktop, dan bingkai menegak 9:16 tinggi yang direka untuk telefon dan platform sosial pendek. Video lalai lapan saat dan boleh ditetapkan dari tiga hingga sepuluh saat, supaya anda boleh laras gelung cepat atau irama lebih panjang bergantung keperluan projek anda. Video dihasilkan pada 720p, beri anda resolusi bersih dan boleh dikongsi untuk kebanyakan kegunaan dalam talian. Setiap penjanaan kembali sebagai fail video boleh dimuat turun dengan bunyi disertakan.
Mengenai kawalan kreatif, anda ada beberapa tuas. Prompt teks anda adalah roda pemandu utama — ia menerangkan subjek, aksi, latar, mood, dan bunyi yang anda mahu. Ruang prompt murah hati, beri anda ruang melimpah untuk tulis arahan terperinci dan deskriptif bukannya beberapa kata kunci. Imej rujukan anda kawal identiti visual adegan, dan keupayaan ikat imej khusus kepada peranan khusus bermakna anda boleh tepat mengenai rujukan mana menjadi elemen mana. Tetapan nisbah aspek benarkan anda padan output dengan destinasi, dan tetapan tempoh benarkan anda kawal irama dan panjang. Bersama-sama ini beri anda aliran kerja yang bermula dari aset anda sendiri dan berakhir dengan video yang kelihatan dan berbunyi seperti yang anda rancang.
Fakta model menerima audio dan video sebagai input — bukan hanya teks dan gambar tetap — adalah pusat kepada apa yang menjadikannya fleksibel. Anda boleh bawa bunyi dan rakaman sedia ada ke dalam campuran untuk pandu bagaimana klip akhir bergerak dan apa bunyinya, yang membuka pintu kepada kerja gaya transformasi: bayangkan semula bahan sedia ada dalam gaya baru sambil kekalkan elemen yang anda peduli. Pendekatan pelbagai mod ini adalah ciri definisi model dan sebab ia dikelompokkan dengan aliran kerja transformasi bergaya dan lip-sync.
Beberapa pertimbangan praktikal. Klip pendek secara reka bentuk — tingkap tiga hingga sepuluh saat menjadikan model ideal untuk pos sosial, gelung, pengenalan, saat reaksi, dan ujian adegan cepat bukannya urutan panjang. Anda akan dapat hasil terbaik dengan tulis prompt jelas dan spesifik serta pilih imej rujukan yang jelas mewakili subjek dan gaya yang anda mahu, kerana imej itu buat kerja berat pada identiti visual. Bila bekerja dengan pelbagai rujukan, gunakan tag pengikatan peranan bantu model faham tepat bagaimana setiap imej digunakan. Dan kerana sekurang-kurangnya satu imej rujukan diperlukan bersama prompt teks anda, ini adalah alat berasaskan rujukan — ia bersinar bila anda sudah ada bahan visual untuk dibina daripadanya bukannya bermula dari halaman kosong.
Secara ringkas, Gemini Omni Flash adalah model rujukan-ke-video yang gabung teks, imej, audio, dan video menjadi klip pendek dengan bunyi diselaraskan, tawarkan kawalan ke atas subjek, pergerakan, gaya, dan audio, sokong pembingkaian lebar skrin dan menegak, dan benarkan tetapkan panjang klip dari tiga hingga sepuluh saat. Ia pilihan kuat untuk pencipta yang mahu ubah imej mereka sendiri menjadi video bergaya dengan bunyi, dan sesiapa yang bekerja pada lip-sync dan kandungan pendek berasaskan watak.
Add the image that you want change
Tambah imej pilihan untuk memandu rupa, watak atau persekitaran
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Taip gesaan - Model memahami fizik, pencahayaan dan niat emosi babak anda
Klik untuk menjana output akhir anda dan muat turun video bertaraf produksi
Menunjukkan animasi landskap sinematik dengan pergerakan atmosfera dan bunyi alam suasana yang dijana untuk penceritaan format lebar.
Pamer animasi produk premium gabung imej rujukan dengan pencahayaan dinamik dan bunyi untuk ril komersial mewah.
“Animate as a smooth 360-degree rotation on an invisible turntable. Rotate slowly and continuously, taking 6 seconds for full rotation. Light reflections should shift naturally across the metal case and crystal. Maintain consistent dramatic lighting throughout rotation. Add subtle sparkle on diamond indices as they catch light. Keep the background static and dark. Professional product video quality.”
Beralih ke sintesis dipandu penaakulan hari ini
![Kling Video v3 Image to Video [Standard]](https://v3b.fal.media/files/b/0a8cfcdb/TywpxxNj5_vDG8AUw3Yum_e2172b5c00e64a91a434ab5a38e496f0.jpg)
Cinematic image-to-video with audio
4.2 kredit

Animate image to 1080p video
2.8 kredit

Cinematic video from images
10 kredit

Cinematic video from images fast
0.1 kredit

Animate images into 2K video
7.8 kredit

Animate images into video with audio
10 kredit

Animate images into cinematic video
0.6 kredit

Video from image, audio references
0.4 kredit