Text to video with audio
Grok Imagine Video 1.5 Text to Video, entwickelt von xAI, verwandelt schriftliche Beschreibungen in kurze Videoclips mit Audio – alles aus einem einzigen Text-Prompt. Sie beschreiben die gewünschte Szene, und das Modell erzeugt einen beweglichen Clip mit Ton, der zu Ihren Worten passt. Keine Referenzbilder oder -videos sind erforderlich. Sie schreiben einfach, und das Modell übernimmt den Rest, was es zu einer der direktesten Möglichkeiten macht, von einer Idee im Kopf zu einem fertigen Clip auf dem Bildschirm zu kommen.
Im Kern dieses Modells steht promptgesteuerte Erzählkunst. Ihre Textbeschreibung kann eine großzügige Länge haben und gibt Ihnen Raum, Charaktere, Schauplätze, Beleuchtung, Stimmung, Bewegungen und Stil in beliebiger Detailtiefe zu beschreiben. Ein Beispiel-Prompt zeigt den expressiven Bereich, auf den das Modell reagiert: "Anime schoolgirl bursting out of house door, cherry blossoms blowing, morning light, speed lines indicating rush, chibi-ready expressions, classic shojo aesthetic, vibrant colors." Dieser eine Satz packt Charakter, Aktion, Umgebung, Beleuchtung und einen spezifischen visuellen Stil zusammen – und das Modell verbindet all diese Elemente zu einem kohärenten animierten Clip.
Eine der herausragenden Funktionen des Modells ist die Erzeugung von Audio neben den Visuals. Statt eines stillen Clips, den Sie separat mit Sound unterlegen oder gestalten müssen, liefert es Videos mit integriertem Ton von Anfang an. Das Modell ist auf stilisiertes Output, Transformationen und Lipsync ausgelegt, was seine Stärke bei expressiven, charaktergetriebenen Szenen unterstreicht, in denen Münder, Mimik und Bewegungen zum Geschehen auf dem Bildschirm passen müssen.
Sie haben volle Kontrolle über Form und Länge des Outputs. Die Dauer ist einstellbar – von einem schnellen 1-Sekunden-Moment bis zu einem 15-Sekunden-Clip –, sodass Sie die Länge an Ihr Projekt anpassen können, sei es ein knackiger Social-Loop oder ein längerer narrativer Abschnitt. Der Standardwert liegt bei 6 Sekunden, ideal für die meisten Short-Form-Ideen. Die Auflösung kann auf 480p, 720p oder 1080p eingestellt werden und bietet die Wahl zwischen schnellen, leichten Entwürfen und scharfen, detailreichen Finalversionen. 720p als Standard schafft ein gutes Gleichgewicht zwischen Klarheit und Effizienz.
Die Unterstützung für Aspect Ratios ist außergewöhnlich breit. Wählen Sie 16:9 für widescreen-kinematische und Landschafts-Formate, 9:16 für vertikale Mobile- und Social-Formate, 1:1 für quadratische Feed-Posts oder Zwischensizes wie 4:3, 3:2, 2:3 und 3:4. Diese Flexibilität erzeugt Clips, die direkt für ihr Zielformat passen – horizontaler Trailer, vertikale Story oder quadratisches Social-Tile –, ohne nachträgliches Croppen oder Umformatieren.
Das Modell liefert standardmäßige MP4-Videos, die sich mühelos in Editing-Tools, Social-Plattformen und Präsentationssoftware abspielen und teilen lassen. Clips werden mit 24 Frames pro Sekunde gerendert – einer Framerate für einen filmischen Look – und enthalten die vollständige Frame-Sequenz für die gewählte Dauer.
Dieses Modell ist ideal für vielfältige Kreative. Animatoren und Illustratoren nutzen seine Stärken für Anime, Chibi, Shojo und andere illustrierte Ästhetiken in Bewegung. Social-Media-Creator und Marketer erzeugen vertikale und quadratische Clips, perfekt für ihre Plattformen, ohne Nachbearbeitung. Filmemacher und Storyboarder visualisieren rasch Szenen, Stimmungen und Kameradynamik vor der Produktion. Designer und Content-Teams produzieren markante kurze Momente, animierte Konzepte und expressive Charakterclips direkt aus Text. Da nur ein Prompt nötig ist, senkt es die Einstiegshürde für alle mit Vision, aber ohne Footage oder Zeichentools.
Beschreibende, detaillierte Prompts liefern die besten Ergebnisse. Je präziser Sie Subjekt, Aktion, Schauplatz, Beleuchtung und Stil nennen, desto genauer wird das Ergebnis – wie das Anime-Beispiel zeigt. Stapeln Sie Stilhinweise, Stimmungs- und Bewegungsbeschreibungen für präzise Steuerung. Für stilisiertes oder transformatives Output nennen Sie es explizit mit der gewünschten Ästhetik.
Praktische Hinweise: Clips sind auf 15 Sekunden begrenzt und eignen sich für knackige Momente, nicht lange Szenen. Höhere Auflösungen brauchen mehr Rechenzeit – nutzen Sie niedrigere für Iterationen vor dem 1080p-Finale. Ergebnisse variieren je nach Run, daher iterieren: Prompt verfeinern, Format und Länge anpassen, neu generieren. Mit Audio-Integration, flexiblen Formaten, variabler Länge und Affinität zu stilisiertem Content ist Grok Imagine Video 1.5 Text to Video ein vielseitiger Einstieg, um Textideen in klangvolle kurze Clips zu verwandeln.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beschreibe deine Videoszene mit Bewegung, Kamerawinkeln und Stimmung
Das Modell erzeugt filmische Bewegung mit natürlicher Physik und Beleuchtung
Lade dein produktionsfertiges Video herunter und teile es
Aggressive Kamerakontrolle mit unmöglicher FPV-Drohnen-One-Shot – beweist Kontinuität und dynamische Skalierung in 16:9.
Realistische Bodycam für absurden Comedy mit sync-Dialog – Format für Virales durch trockene Authentizität.
Präzise Kamerasteuerung und Zeitbewegung mit beschleunigter Hyperlapse und Lichtspur-Dynamik – ideal für kinematisches 16:9-Hero-Video.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Wechsle noch heute zur reasoning-gesteuerten Synthese

Cinematic video with native audio
1.4 Credits
Text to video with audio
0.7 Credits

Fast balanced text-to-video generation
1.6 Credits

Cinematic video from references
10 Credits

Film-grade video with audio
0.1 Credits

Fast cinematic video with audio
0.1 Credits

Frontier 2K text-to-video generation
7.3 Credits

Cinematic video from references
0.4 Credits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 Credits