Erstelle filmische Clips mit Audio, nahtlosen Szenen und präziser Steuerung
MiniMax H3 ist die multimodale Modellfamilie von MiniMax zur Generierung und Bearbeitung von Bildern, Video und Audio mithilfe natürlichsprachlicher Anweisungen. Auf dieser Seite steht MiniMax H3 Text-to-Video bereit: Ein einzelner schriftlicher Prompt wird zu einem 5–15 Sekunden langen 2K-Video mit 24 FPS und nativem Stereo-Ton, der gemeinsam mit dem Bild entsteht. Das Tool akzeptiert ausschließlich Text; wenn Sie Bild-, Video- oder Audioreferenzen benötigen, verwenden Sie die verlinkten H3-Workflows.
| Vorteil von MiniMax H3 | Ihr Nutzen |
|---|---|
| Gemeinsam erzeugtes 2K-Video und natives Stereo-Audio | Erzeugen Sie detailreiche Bilder, Dialoge, Effekte, Atmosphäre und Musik in einem Durchgang und reduzieren Sie getrennte Schritte für Upscaling, Sounddesign und Synchronisierung. |
| Sprachgesteuerte Omni-Reference-Funktion | Weisen Sie Bildern, Video und Audio in den MiniMax H3-Workflows unterschiedliche Rollen zu – etwa Identität, Produktdarstellung, Bewegung, Kamerastil, Stimme oder Musik –, sodass mehrere Quellen ein zusammenhängendes Ergebnis steuern. |
| V2V-Übertragung und gezielte Bearbeitung | MiniMax H3 kann Bewegungen oder Kamerasprache übernehmen und ausgewählte visuelle oder akustische Elemente verändern, während der Rest erhalten bleibt. Produktionsteams müssen eine Einstellung dadurch nicht vollständig neu generieren. |
| Ausgabefertige Dauer und Bildformate | Erzeugen Sie 5–15 Sekunden bei 24 FPS in sechs Seitenverhältnissen, damit Hooks, Produktenthüllungen und mehrteilige Szenen mit weniger Neuschnitt und Beschnitt in Kino-, Web-, Feed-, Hochformat- oder vertikale Platzierungen passen. |
9:16 oder Feed-Inhalte in 1:1 – mit einem klaren Einstieg und plattformgerechtem Bildformat.Die erste Tabelle enthält die Bedienelemente, die das Tool MiniMax H3 Text-to-Video auf dieser Seite bereitstellt.
| Parameter | Erforderlich | Typ | Standard | Bereich / Optionen | Auswahlhilfe |
|---|---|---|---|---|---|
prompt* | Ja (*) | String | Beispiel-Prompt | 1–4,000 Zeichen | Geben Sie MiniMax H3 ein strukturiertes Briefing mit Motiv, einer Haupthandlung, Kamera, Umgebung und Beleuchtung, visuellem Stil, Audio und gewünschtem Schluss. Eine klare Struktur ist wichtiger als die vollständige Nutzung des Limits. |
aspect_ratio | Nein | String | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Stimmen Sie die Ausgabe von MiniMax H3 auf das Ziel ab: 21:9 für ultraweite Kinoeinstellungen, 16:9 für allgemeine Videos und Werbung, 4:3 für redaktionelle oder Retro-Bildgestaltung, 1:1 für Feeds, 3:4 für Produkte im Hochformat und 9:16 für vertikale Social Videos. |
resolution | Nein | String | 2k | 2k | Für dieses Tool fest vorgegeben und der unten beschriebenen 1440p-Stufe zugeordnet. Wählen Sie MiniMax H3, wenn Sie hochauflösende Details ohne Auswahl einer weiteren Qualitätsstufe benötigen. |
duration | Nein | Integer | 5 | 5–15 Sekunden, in Schritten von 1 Sekunde | Verwenden Sie 5–7 Sekunden lange MiniMax H3-Clips für eine einzelne Handlung oder schnelle Iterationen, 8–10 Sekunden für eine einfache Veränderung und 11–15 Sekunden nur, wenn der Prompt einen klaren Anfang, eine Entwicklung und einen Schluss vorgibt. |
\* Pflichtfeld.
Die folgende Tabelle fasst die breitere MiniMax H3-Modellfamilie zusammen. Eingaben für Erst-/Letztbild- und Omni-Reference-Modi sind über separate Workflows verfügbar und gehören nicht zu den Bedienelementen dieser Text-to-Video-Seite.
| Kerndimension | MiniMax H3 |
|---|---|
| Modell | MiniMax-H3 |
| Ausgabedauer | MiniMax H3 erzeugt 5–15 Sekunden. |
| Ausgabe-Seitenverhältnis | Erst-/Letztbild-Modus: übernimmt das ursprüngliche Seitenverhältnis des Eingabebildes.<br>Text-to-Video-Modus: verwendet das vom Nutzer gewählte Verhältnis 21:9, 16:9, 4:3, 1:1, 3:4 oder 9:16.<br>Omni-Reference-Modus: verwendet eines dieser sechs Verhältnisse oder Auto, wodurch MiniMax H3 das Ausgabeformat auswählt. |
| Auflösung | MiniMax H3 unterstützt zwei dokumentierte Stufen. 768p-Modus (später verfügbar): Bei Seitenverhältnissen von 16:9 bis 9:16 beträgt die kurze Seite 768 Pixel; bei breiteren Ausgaben liegt die Gesamtauflösung bei etwa 1 MP – 21:9 entspricht beispielsweise 1536×672. Ein 768p-Ergebnis kann auf 1440p hochgestuft werden.<br>1440p-/2K-Modus: Bei Seitenverhältnissen von 16:9 bis 9:16 beträgt die kurze Seite 1440 Pixel; bei breiteren Ausgaben liegt die Gesamtauflösung bei etwa 3.7 MP – 21:9 entspricht beispielsweise 2976×1248. |
| Ausgabe-Bildrate | MiniMax H3 gibt mit 24 FPS aus. |
| Ausgabe-Audio | Jedes Ergebnis von MiniMax H3 enthält nativen Stereo-Ton. |
| Erst-/Letztbild-Eingabe | Bilder: 0, 1 oder 2; Breite und Höhe jeweils 256–5760 Pixel; Seitenverhältnis von 5:2 bis 2:5 (0.4–2.5). Ohne Bildeingabe läuft MiniMax H3 im Text-to-Video-Modus – dem auf dieser Seite angebotenen Tool. |
| Omni-Reference-Eingabe | Bilder: bis zu 9; Breite und Höhe jeweils 256–5760 Pixel.<br>Videos: bis zu 3; jeweils 2–15 Sekunden; kombinierte Videodauer bis zu 15 Sekunden; Breite und Höhe jeweils 256–5760 Pixel; Seitenverhältnis von 5:2 bis 2:5 (0.4–2.5).<br>Audio: bis zu 3 Clips; jeweils 2–15 Sekunden; kombinierte Audiodauer bis zu 15 Sekunden. Audio muss zusammen mit einem Bild oder Video verwendet werden und darf nicht die einzige Referenz sein.<br>Gemischte Eingabe: insgesamt bis zu 12 Dateien. Ohne Bild-, Video- oder Audioeingabe wird der Workflow zu Text-to-Video. |
| Unterstützte Eingabeformate | MiniMax H3 akzeptiert Video: H.264/AVC oder H.265/HEVC; eingebettetes Audio: AAC oder MP3.<br>Bild: JPG, JPEG, PNG, WEBP, HEIC oder HEIF.<br>Audio: WAV oder MP3. |
| Größenlimits für Eingaben | Je Video: 50 MB; je Bild: 30 MB; je Audiodatei: 15 MB. Über die Limits pro Datei hinaus gibt es kein separates kombiniertes Medienlimit, der API-Anfragekörper ist jedoch auf 64 MB begrenzt; URL-basierte Medieneingaben werden empfohlen. |
| Prompt-Limit | Das MiniMax H3-Produkthandbuch erlaubt bis zu 7,000 Zeichen. Diese Text-to-Video-Bereitstellung akzeptiert derzeit 1–4,000 Zeichen, wie in der Tabelle mit den Seitenbedienelementen oben angegeben. |
MiniMax H3 kostet auf dieser Seite in 2K $0.13 USD pro generierter Sekunde.
| Dauer | Preis pro Video |
|---|---|
| 5 Sekunden | $0.65 |
| 10 Sekunden | $1.30 |
| 15 Sekunden | $1.95 |
Berechnen Sie den Gesamtpreis für Batches mit 1–4 Ausgaben als duration × $0.13 × output count.
Verwenden Sie diese wiederverwendbare Prompt-Struktur für MiniMax H3:
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
Schwacher Prompt
> Ein Werbespot für eine Luxusuhr, filmisch und dynamisch, mit Musik.
Verbesserter MiniMax H3-Prompt
> Eine Automatikuhr aus gebürstetem Stahl liegt auf schwarzem Vulkangestein. Ein schmaler Streifen Studiolicht wandert über das Saphirglas, während sich der Sekundenzeiger bewegt und sich Kondenswassertropfen auf dem Gehäuse bilden. Beginne mit einer extremen Makroaufnahme, führe dann eine langsame 30-Grad-Kreisfahrt aus und ende auf dem Zifferblatt. Kontrastreicher Luxuswerbestil, tiefschwarzer Hintergrund. Audio: leises mechanisches Ticken und ein einzelner tiefer filmischer Impuls; kein Dialog.
Die verbesserte Version gibt MiniMax H3 ein eindeutig erkennbares Motiv, eine zeitlich definierte Handlung, eine separate Kameraregie, Beleuchtung, visuelle Ausarbeitung, Tonquellen und ein überprüfbares Schlussbild vor.
Nutzen Sie diesen MiniMax H3-Vergleich als Orientierung für die Modellfamilie. Maximale Auflösung und Dauer stehen möglicherweise nicht gleichzeitig zur Verfügung, und RunComfy-Workflows können unterschiedliche Eingaben, Auflösungsstufen und Audiooptionen bereitstellen.
| Modell | Auflösung | Maximale Dauer | Audio | Besonderheit |
|---|---|---|---|---|
| MiniMax H3 | Bis zu 2K | 15s | Natives Stereo-Audio (Stimme, SFX, Musik) | Verknüpft Text-, Bild-, Video- und Audioreferenzen per Sprache für V2V-Bewegungsübertragung und produktionsorientierte Bearbeitung; öffentliche Gewichte sind geplant, wurden aber noch nicht veröffentlicht. |
| Hailuo 02 | 1080p | ~10s | Kein Audio | Starke Prompt-Treue und physikorientierte Bewegung eignen sich für Gymnastik, Tanz, Produktbewegungen und andere stumme Actionszenen, die später in der Produktion vertont werden. |
| Kling 3.0 | Bis zu 4K | 15s | Natives Audio mit Lippensynchronisation | Koordiniert Kamerwechsel über mehrere Einstellungen mit mehrsprachigen, bestimmten Sprechern zugewiesenen Dialogen und Lippensynchronität – nützlich für geskriptete Werbung, Storyboards und charaktergeführte Szenen. |
| Seedance 2.0 | 1080p | 15s | Gemeinsam erzeugtes Audio und Video | Verbindet umfangreiche Bild-, Video- und Audioreferenzen mit gemeinsamer audiovisueller Generierung und präziser Lippensynchronität für identitätssensible Werbung, Markengeschichten und referenzintensive Bearbeitungen. |
| Veo 3.1 | 4K | 8s | Native Dialoge und Effekte | Kombiniert vorgegebene Dialoge und Effekte mit Erst-/Letztbild-, Referenzbild- und Szenenverlängerungs-Steuerung – geeignet für filmische Übergänge und zusammengesetzte Sequenzen. |
Für Hailuo 02 gelten die angegebenen Maximalwerte je nach Modus: 1080p-Ausgabe ist auf 6 Sekunden begrenzt, während 10 Sekunden Ausgabe bei 512p oder 768p verfügbar sind.
Bei MiniMax H3 gehören Omni-Reference- und V2V-Funktionen zu Schwester-Workflows; das Text-to-Video-Tool auf dieser Seite bleibt ausschließlich promptbasiert.
Das Besondere an MiniMax H3 ist die Kombination: eine universelle Modellfamilie, die Text, Bild, Video und Audio miteinander in Beziehung setzt, nativen Stereo-Ton erzeugt und auf dieser Seite 2K für $0.13 pro generierter Sekunde erreicht. Wählen Sie MiniMax H3, wenn Sie mit einem Textbriefing beginnen und den Weg zu referenzgesteuerter Erstellung oder Bearbeitung in Schwester-Workflows offenhalten möchten. Führen Sie auf Grundlage öffentlich verfügbarer Informationen dasselbe Briefing mit jedem Modell aus, bevor Sie sich auf eine Pipeline festlegen.
Wenn MiniMax H3 nicht der richtige Ausgangspunkt für ein Projekt ist, vergleichen Sie diese spezialisierten Workflows auf RunComfy:
Erstelle filmische Clips mit Audio, nahtlosen Szenen und präziser Steuerung
Cineastische 2K-Clips mit präziser Lippensynchronität und kontrollierter Kameraführung erstellen.
Erzeugen Sie aus einem Ausgangsbild und einem Prompt ein 16:9-Video mit wählbarer Dauer, Auflösung, Bildrate und optional erzeugtem Ton.
Filmische Szenen gestalten mit Textbefehlen und Lichtsteuerung
Erstellen Sie Filme mit mehreren Szenen, synchronisierten Dialogen und konsistenten Charakteren. Use Kling 3.0 on RunComfy.
Erstelle fotorealistische, sprechende Videos mit natürlicher Bewegung
Ja. MiniMax H3 Text-to-Video ist im Browser und über die RunComfy API verfügbar und verwendet die Credits Ihres Kontos.
MiniMax H3 ist die allgemeine multimodale Modellfamilie von MiniMax für Generierung und Bearbeitung. Ihr breiter Aufgabenansatz umfasst Text, Bild, Video und Audio, während einzelne Workflows unterschiedliche Eingaben bereitstellen. Diese Seite bietet den ausschließlich promptbasierten Text-to-Video-Workflow.
MiniMax positioniert H3 für Werbung, Branding, E-Commerce, Film, Titeldesign, animierte Poster, kurze Geschichten, Produkt- und UI-Konzepte, Games, virtuelle Figuren und stilisierte Animation. Der aktuelle Text-to-Video-Workflow eignet sich am besten für kurze Konzepte, die sich über einen schriftlichen Prompt steuern lassen.
Auf dieser Seite erzeugt MiniMax H3 ausschließlich 2K-Video. Wählen Sie eine beliebige ganzzahlige Dauer von 5 bis 15 Sekunden; der Standardwert beträgt 5 Sekunden. Dieser Workflow bietet keine 768p-Option.
Ja. Dieser Text-to-Video-Workflow erzeugt nativen Stereo-Ton zusammen mit dem Video. Beschreiben Sie Dialoge, Atmosphäre, Soundeffekte oder Musik im Prompt; es gibt keinen separaten Audio-Schalter. Die Ergebnisse können variieren. Prüfen Sie daher Lippensynchronisation und Audio-Timing.
Nein. Diese Seite ist der ausschließlich promptbasierte MiniMax H3 Text-to-Video-Workflow. Seine API akzeptiert nur prompt, aspect_ratio, resolution und duration. Verwenden Sie für Ausgangsmedien einen separaten H3 Image-to-Video- oder Reference-to-Video-Workflow.
In H3-Workflows mit Referenzunterstützung kann natürliche Sprache Text, Bildern, Video und Audio unterschiedliche Rollen zuweisen. Eine Quelle kann beispielsweise die Kamerabewegung, eine andere die Figur und eine weitere die Stimme definieren. Dies ist eine Funktion der Modellfamilie und keine Medien-Upload-Funktion der aktuellen Seite.
Nein. RunComfy stellt MiniMax H3 im Browser und über eine HTTP API bereit, sodass Sie das Modell nicht selbst hosten oder skalieren müssen. Im Launch-Beitrag vom 31. Juli beschrieb MiniMax einen bedingten Plan zur Veröffentlichung der Modellgewichte; prüfen Sie die aktuelle Verfügbarkeit und die Lizenzbedingungen, bevor Sie Self-Hosting planen.
MiniMax H3 Text-to-Video kostet in 2K $0.13 pro generierter Sekunde. Ein 5-Sekunden-Video kostet $0.65, ein 10-Sekunden-Video $1.30 und ein 15-Sekunden-Video $1.95. Bei Batch-Generierung werden die dauerabhängigen Kosten mit der Anzahl der Ausgaben multipliziert.
MiniMax beschreibt Hailuo 02 als auf Architektur, Daten und Skalierung ausgerichtet, während MiniMax H3 die Verallgemeinerung von Aufgaben und Modalitäten in den Mittelpunkt stellt. H3 ergänzt seinen Text-to-Video-Workflow außerdem um nativen Stereo-Ton und 2K-Ausgabe.
Testen Sie Prompt, Seitenverhältnis und Dauer in RunComfy. Rufen Sie anschließend dieselbe MiniMax H3 Text-to-Video-Vorlage über die API mit prompt (erforderlich), aspect_ratio, resolution (nur 2k) und duration (5–15) auf. Dieser Workflow besitzt keine Felder für Medien-Uploads.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.














