Text to video with audio
Grok Imagine Video 1.5 Text to Video, desenvolupat per xAI, converteix descripcions escrites en clips de vídeo curts complets amb àudio, tot a partir d'un únic prompt de text. Descriu l'escena que vols, i el model genera un clip en moviment amb so que coincideix amb les teves paraules. No cal proporcionar imatges o metratges de referència prèviament. Només has d'escriure, i el model s'encarrega de la resta, fent-lo un dels mètodes més directes per passar d'una idea al teu cap a un clip acabat a la pantalla.
Al cor d'aquest model hi ha la narració impulsada per prompts. La teva descripció de text pot tenir una longitud generosa, donant-te espai per detallar personatges, escenaris, il·luminació, ambient, moviment i estil amb tants detalls com vulguis. Un exemple de prompt mostra el tipus de rang expressiu al qual respon el model: "Anime schoolgirl bursting out of house door, cherry blossoms blowing, morning light, speed lines indicating rush, chibi-ready expressions, classic shojo aesthetic, vibrant colors." Aquesta única frase inclou personatge, acció, entorn, il·luminació i un estil visual molt específic, i el model treballa per unir tots aquests elements en un clip animat cohesionat.
Una de les característiques destacades del model és que genera àudio acompanyant les visuals. En lloc de produir un clip silenciós que hagis de musicalitzar o dissenyar de so per separat, lliura un vídeo amb so integrat des del principi. El model està orientat a sortides estilitzades, transformacions i sincronització labial, cosa que indica la seva comoditat amb escenes expressives i guiades per personatges on les boques, expressions i moviments han de sentir-se connectats amb el que passa a la pantalla.
Tens un control real sobre la forma i la longitud de la teva sortida. La durada és ajustable, permetent-te produir des d'un ritme ràpid d'un segon fins a un clip de quinze segons, perquè puguis adaptar la longitud al que estiguis creant, sigui un bucle social ràpid o un moment narratiu més llarg. El predeterminat són sis segons, una longitud còmoda per a la majoria d'idees de format curt. La resolució es pot establir a 480p, 720p o 1080p, donant-te l'opció entre esborranys més ràpids i lleugers o renderitzacions finals més nítides i amb més detalls. El 720p per defecte assoleix un equilibri pràctic entre claredat i eficiència.
El suport d'aspectes és inusualment ampli. Pots triar entre 16:9 de pantalla ampla per a enquadrament cinematogràfic i paisatge, 9:16 vertical per a formats mòbils i socials, 1:1 quadrat per a publicacions aptes per a feeds, i una gamma d'opcions intermèdies com 4:3, 3:2, 2:3 i 3:4. Aquesta flexibilitat significa que pots generar un clip ja enquadrat correctament per al seu destí, sigui un tràiler horitzontal, una història vertical o un tauler social quadrat, sense retallar ni reformatejar després.
El model genera vídeo MP4 estàndard, que es reprodueix i comparteix fàcilment a través d'eines d'edició, plataformes socials i programari de presentacions. Els clips es renderitzen a 24 fotogrames per segon, una velocitat d'imatges llargament associada a un aspecte fílmico i cinematogràfic, i el model produeix la seqüència completa de fotogrames necessària per omplir la durada escollida.
Aquest model s'adapta naturalment a una àmplia gamma de professionals creatius. Animadors i il·lustradors poden aprofitar les seves fortaleses estilitzades per donar vida a moviments en estètiques anime, chibi, shojo i altres il·lustrades. Creadors de continguts socials i màrqueters poden generar clips verticals i quadrats adaptats a les seves plataformes sense reformatejos addicionals. Cineastes i artistes de storyboards poden visualitzar escenes, ambients i energia de càmera ràpidament abans de comprometre's amb una producció més completa. Dissenyadors i equips de continguts poden produir moments curts de marca, conceptes animats i clips de personatges expressius directament a partir d'un brief escrit. Com que només necessita un prompt, també baixa la barrera per a qualsevol que tingui una visió forta però no el metratge o el flux de dibuix per realitzar-la.
Treballar amb el model recompensa els prompts descriptius i multicapa. Com més clarament nomenis el subjecte, l'acció, l'escenari, l'il·luminació i l'estil visual, més fidelment reflectirà el resultat la teva intenció, com demostra l'exemple d'anime. Apilar indicacions estilístiques específiques, paraules d'ambient i descripcions de moviment dona al model un objectiu més ric cap al qual apuntar. Si vols un aspecte estilitzat o transformador, dir-ho explícitament, juntament amb l'estètica que busques, ajuda a dirigir la sortida en aquesta direcció.
Algunes consideracions pràctiques valen la pena tenir en compte. Els clips són curts per disseny, limitats a quinze segons, per la qual cosa aquest model brilla en moments impactants i autònoms en lloc d'escenes contínues llargues. Les resolucions més altes produeixen més detalls però impliquen naturalment més feina per renderitzar, així que una configuració més lleugera pot ser útil per a iteracions ràpides i esborranys abans de comprometre't amb una versió polida a 1080p. Com que la sortida es genera íntegrament a partir del teu text, el resultat exacte pot variar entre execucions, cosa que fa que l'iteració sigui una part normal del procés: refina la teva redacció, ajusta l'enquadrament i la longitud, i regenera fins que el clip encaixi com t'imaginaves. Amb la seva combinació de generació inclusiva d'àudio, enquadrament flexible, longitud ajustable i una clara afinitat per continguts estilitzats i expressius, Grok Imagine Video 1.5 Text to Video és un punt de partida versàtil per convertir idees escrites en clips curts amb so.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descriu l'escena del teu vídeo amb moviment, angles de càmera i ambient
El model crea moviment cinematogràfic amb física i il·luminació naturals
Descarrega i comparteix el teu vídeo a punt per publicar
Mostra control agressiu de càmera amb un moviment impossible de dron FPV en un sol pla, demostrant el domini del model del moviment continu i l'escala dinàmica en pantalla ampla.
Aproveita el realisme del model per a comèdia absurdista de bodycam falsa amb diàlegs sincronitzats, un format enginyeritzat per viralitzar-se a través d'autenticitat impassible.
Demostra control precís de càmera i moviment temporal amb un hiperlap se accelerant i dinàmiques contínues de rastre de llum, ideal per a un clip hero cinematogràfic 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa't avui a la síntesi guiada per raonament

Film-grade video with audio
0.1 crèdits

Cinematic video from references
0.4 crèdits

Cinematic video from references
10 crèdits

Cinematic video with native audio
1.4 crèdits

Frontier 2K text-to-video generation
7.3 crèdits

Fast cinematic video with audio
0.1 crèdits

Fast balanced text-to-video generation
1.6 crèdits
Text to video with audio
0.7 crèdits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crèdits