Text to video with audio
Grok Imagine Video 1.5 (Text to Video), desenvolupat per xAI, converteix textos en clips de vídeo curts amb àudio incorporat. En comptes d’utilitzar eines separades per visuals i so, només has de descriure l’escena que vols en llenguatge natural i el model produeix un clip acabat amb moviment i pista d’àudio pròpia. Això el converteix en una solució ràpida i autònoma per a creadors que volen provar idees, crear continguts per xarxes socials o prototipar imatges en moviment sense càmera, actors ni equip d'edició.
Al seu nucli, el model llegeix una descripció de text i interpreta tant el subjecte com la manera de moure’s. Una indicació com "Un gatet blanc persegueix una papallona per un jardí il·luminat pel sol, seguiment suau de càmera, moviment natural, llum d’una tarda dolça filtrada entre les fulles" dóna al model tot el necessari: subjecte, acció, moviment de càmera i ambient de llum. Com que respon a aquest tipus de direcció cinematogràfica detallada, pots modelar no només què apareix en pantalla sinó també com es mou la càmera i com cau la llum sobre l’escena. Els exemples de promts també mostren el seu maneig d’estils com l’anime i l’estètica shojo amb línies de velocitat, flors de cirerer, colors vius i personatges expressius, així que es mou còmodament entre l’aspecte fotorrealista i l’il·lustrat.
Tu controles la durada de cada clip, podent triar entre 1 i 15 segons. Els clips curts són ideals per a bucles ràpids, moments de reacció i fragments socials, mentre que les durades més llargues donen espai a una acció més completa o a un petit moment narratiu. La durada predeterminada és d’uns 6 segons, adient per a la majoria d’idees d’una sola presa. L’exportació és a 24 fotogrames per segon, donant un moviment suau i d’estil cinematogràfic.
La resolució és ajustable en tres nivells: 480p per a proves ràpides, 720p com a estàndard fiable i 1080p per al resultat més definit i detallat. Això et permet iterar ràpidament en baixa resolució afinant el prompt i, un cop satisfet, generar una versió final neta en alta qualitat.
La relació d’aspecte és totalment flexible, amb una àmplia varietat de formats per adaptar-se a qualsevol plataforma. Pots fer vídeo panoràmic clàssic 16:9 per a reproducció apaisada, vertical 9:16 per a històries o feeds de mòbil, quadrat 1:1 per a publicacions de grid, i formats intermedis com 4:3, 3:2, 2:3 i 3:4. Pots emmarcar verticalment o horitzontalment des del mateix prompt, el model s’adapta naturalment a fluxos multi-plataforma on la mateixa idea ha d'aparèixer en diversos formats.
Una de les seves funcions estrella és l’àudio natiu. En lloc de lliurar un clip silenciós que després has de sonoritzar, Grok Imagine Video 1.5 genera vídeo amb pista d’àudio en el mateix procés. Això converteix un prompt de text en un moment gairebé acabat, molt útil per a conceptes ràpids, proves d’ambient i contingut social, on el so afegeix molt d’impacte sense cap pas addicional.
El camp de prompt admet descripcions llargues i detallades de fins a diversos milers de caràcters. Aquesta capacitat premia l’especificitat: pots afegir subjecte, acció, moviment de càmera, il·luminació, paleta cromàtica, estil artístic i ambient en una mateixa instrucció. Com mostren els exemples, remarcar detalls com "seguiment de càmera suau", "llum de tarda filtrada", "línies de velocitat per indicar pressa" o una estètica concreta dóna al model una guia clara i produeix resultats més propers a la teva intenció.
Aquest model encaixa perfectament amb molts perfils creatius. Creadors de xarxes socials i especialistes en màrqueting poden produir clips verticals o quadrats atractius en qüestió de segons. Cineastes i animadors el poden utilitzar per previsualitzar plans, planificar moviments de càmera o explorar estils abans d’una producció real. Il·lustradors i dissenyadors poden donar vida a mons estilitzats amb moviment i so. Artistes conceptuals i narradors poden provar ràpidament estats d’ànim, ritmes i idees visuals, generant variacions per comparar. Com que és basat en text i no requereix metratge font, redueix les barreres per a qualsevol que vulgui imatges en moviment sense equip ni pressupost d’un rodatge tradicional.
Algunes consideracions pràctiques cal tenir-les en compte. El model funciona només amb text, sense imatges ni referències, així que ho genera tot a partir de la teva descripció. Això fa que el procés sigui senzill, però també significa que la claredat i detall del prompt són essencials; una descripció vaga donarà un resultat més genèric que una de precisa. La durada màxima per clip és de 15 segons, de manera que és una eina per a moments curts o preses individuals, no per seqüències llargues, tot i que pots generar diversos clips per muntar alguna cosa més extensa. Les sol·licituds estan subjectes als termes d’ús de xAI.
En resum, Grok Imagine Video 1.5 (Text to Video) és una manera versàtil i autònoma de passar d’una idea en paraules a un vídeo curt amb so. Amb durada ajustable fins a 15 segons, tres nivells de resolució fins a 1080p, una àmplia gamma de formats, moviment suau a 24fps i àudio integrat, ofereix als creadors un punt de partida flexible per a tot, des d’experiments socials ràpids fins a peces conceptuals sofisticades.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Descriu l'escena del teu vídeo amb moviment, angles de càmera i ambient
El model crea moviment cinematogràfic amb física i il·luminació naturals
Descarrega i comparteix el teu vídeo a punt per publicar
Destaquen els moviments de càmera intensos amb una presa impossible d’estil dron FPV, demostrant el control de moviment continu i escala dinàmica en format panoràmic.
Fa servir el realisme del model per a sketches d’humor absurd tipus bodycam amb diàleg sincronitzat, un format pensat per fer-se viral amb autenticitat irònica.
Demostra control de càmera precís i moviment accelerat amb un hyperlapse urbà amb rastres de llum continus, ideal per a un clip cinematogràfic 16:9.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Passa't avui a la síntesi guiada per raonament

Film-grade video with audio
0.1 crèdits

Fast balanced text-to-video generation
1.6 crèdits

Cinematic video with native audio
1.4 crèdits

Frontier 2K text-to-video generation
7.3 crèdits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 crèdits
Text to video with audio
0.7 crèdits

Fast cinematic video with audio
0.1 crèdits

Cinematic video from references
0.4 crèdits

Cinematic video from references
10 crèdits