Frontier 2K text-to-video generation
MiniMax H3 (Text to Video) ist ein fortschrittliches Videomodell, das aus einem geschriebenen Prompt fertige, bewegte Aufnahmen erzeugt. Entwickelt von MiniMax als Teil der Hailuo-Familie verwandelt dieses Text-zu-Video-Modell eine einzige Beschreibung in einen kompletten Clip – ohne Referenzbild, Storyboard oder vorhandenes Filmmaterial. Alles, was das Modell produziert, entsteht allein aus deinen Worten, was einen schnellen und direkten Weg von einer Idee im Kopf zu einem Video bietet, das du ansehen, teilen oder in ein größeres Projekt einbauen kannst.
Im Mittelpunkt von H3 steht die Ausgabegüte. Jedes Video wird in 2K-Auflösung gerendert und liefert gestochen scharfe, detailreiche Bilder, die auch auf großen Bildschirmen und in professionellen Umgebungen überzeugen. Ob üppige Gartenszene, Produktaufnahme oder stimmungsvolles Atmosphärenstück – durch die hohe Auflösung bleiben feine Details wie Blätter, Licht, Textur und Bewegung klar und wirken nie unscharf oder verwaschen.
H3 gibt dir gezielte Kontrolle über Länge und Gestaltung deines Videos. Du kannst eine Dauer zwischen 5 und 15 Sekunden festlegen – von einer kurzen, eindrucksvollen Schleife bis zu einer längeren Szene mit Platz für Entwicklung. Zusätzlich unterstützt das Modell sieben Seitenverhältnisse: von ultrabreitem Kinoformat (21:9) über Standard-Breitbild (16:9), klassisches 4:3, quadratisch (1:1) bis zu vertikalen Formaten wie 3:4 und 9:16. Damit kannst du Videomaterial exakt passend für einen Spielfilmschnitt, einen Social Media-Feed, eine Handy-Story oder einen quadratischen Post erstellen – ganz ohne späteres Zuschneiden oder Umformatieren.
Das Modell reagiert besonders gut auf bildhafte, filmische Prompts. Ein gutes Beispiel: „Ein weißes Kätzchen jagt einem Schmetterling über einen sonnendurchfluteten Garten nach. Sanfte Kamerafahrten, natürliche Bewegung, weiches Nachmittagslicht, das durch die Blätter fällt.“ Das zeigt, welche Art von Regie H3 versteht: Informationen zu Motiv, Handlung, Kameraführung, Bewegungsstil oder Licht werden als kohärente Aufnahme umgesetzt. Du kannst gezielt sanfte Tracking-Shots, natürliche Bewegungen, spezielle Lichtstimmungen und die Atmosphäre einer Szene anfordern – das Modell berücksichtigt diese Vorgaben über die gesamte Clipdauer hinweg. Prompts dürfen bis zu 2.000 Zeichen umfassen, sodass du viele Details einbringen kannst: von der Atmosphäre und Tageszeit bis hin zur gewünschten Kameraführung und dem Verhalten der Motive.
H3 eignet sich für eine breite Palette kreativer Profis. Filmschaffende und Cutter können establishing shots, Moodpieces oder Zwischenaufnahmen generieren – ganz ohne Dreh. Social-Media-Creators und Marketers erstellen vertikale und quadratische Clips perfekt zugeschnitten auf jede Plattform. Designerinnen und Motion Artists können Szenen prototypen und Konzepte visualisieren, bevor sie in eine Vollproduktion gehen. Unabhängige Storyteller und Content Creator erschaffen kurze Narrativ-Momente oder animierte Vignetten allein aus einer schriftlichen Beschreibung. Da das Modell nur Text benötigt, senkt es die Einstiegshürde für hochwertige, professionell aussehende Videoaufnahmen – für jeden, der beschreiben kann, was er oder sie sehen möchte.
Die Bedienungsführung ist bewusst schlank gehalten: Prompt eingeben, Dauer zwischen 5 und 15 Sekunden wählen, Seitenverhältnis festlegen. Die Auflösung ist immer 2K – du musst dich also nie mit Qualitätsabstufungen beschäftigen. Das Ergebnis wird als MP4-Videodatei ausgeliefert, die du herunterladen, prüfen und direkt in deinen Schnitt- oder Veröffentlichungs-Workflow übernehmen kannst.
Wichtiges zum Schluss: H3 generiert ausschließlich aus Text. Es werden keine Bilder oder vorhandenen Clips als Input akzeptiert – dies ist ein reines Prompt-to-Video-Tool. Clips sind auf 15 Sekunden begrenzt; das Modell eignet sich daher perfekt für Shots, Loops und kurze Szenen statt langer, ununterbrochener Sequenzen – aber du kannst mehrere Clips erstellen und im Schnitt zusammenfügen. Die Auflösung ist derzeit auf 2K limitiert. Wie bei allen Text-zu-Video-Modellen gilt: Je detaillierter und bildhafter dein Prompt, desto vorhersehbarer und passgenauer das Resultat. Es lohnt sich, Mühe in präzise Beschreibungen von Motiv, Aktion, Kamera und Licht zu stecken, damit die Qualität deiner Ergebnisse überzeugt.
Kurz gesagt: MiniMax H3 ist für Kreative gebaut, die direkt von einer schriftlichen Idee zu gestochen scharfem, hochwertig komponiertem 2K-Filmmaterial gelangen wollen – mit voller Kontrolle über Länge und Bildformat, passend für jeden Screen und jede Plattform.
A woman kneeling in darkness, illuminated by a warm, radiant beam of light emerging from her raised hand.
Beschreibe deine Videoszene mit Bewegung, Kamerawinkeln und Stimmung
Das Modell erzeugt filmische Bewegung mit natürlicher Physik und Beleuchtung
Lade dein produktionsfertiges Video herunter und teile es
Eine cineastische One-Shot-Drohnenfahrt zeigt die Steuerungspräzision des Modells mit einer gezielten Dive-and-Pull-up-Sequenz im breiten Cinemascope.
Ein City-Hyperlapse mit fließenden Lichtspuren zeigt, wie das Modell gleichmäßige Bildkonsistenz und gezielte Kameraführung über eine lange, fließende Panorama-Sequenz hält.
“Cinematic reveal of a sleek black luxury sports car in a dark studio. Camera starts close on the chrome badge, slowly pulling back while orbiting 180 degrees around the vehicle. Dramatic rim lighting gradually intensifies, highlighting the car's sculptural curves and glossy finish. Reflections dance across the body as the camera moves. Dust particles float in volumetric light beams. Final wide shot reveals the full silhouette against a gradient backdrop. 8 seconds, smooth motion, 24fps cinematic quality.”
Wechsle noch heute zur reasoning-gesteuerten Synthese

Film-grade video with audio
0.1 Credits
![Kling Video v3 Text to Video [Standard]](https://v3b.fal.media/files/b/0a8cfc9f/dei5OqFRB9HK8AgSHwk8f_9a5eea197b3045d1be55aedb0213f6f9.jpg)
Cinematic text-to-video with audio
4.2 Credits

Fast cinematic video with audio
0.1 Credits

Fast balanced text-to-video generation
1.6 Credits

Cinematic video from references
0.4 Credits

Cinematic video with native audio
1.4 Credits
Text to video with audio
0.7 Credits

Cinematic video from references
10 Credits