Prolongez une vidéo existante de 7 secondes en 720p, avec guidage par prompt et génération audio facultative.
MiniMax H3 est la famille de modèles multimodaux de MiniMax conçue pour générer et modifier des images, de la vidéo et de l'audio à partir d'instructions en langage naturel. Cette page propose MiniMax H3 Text-to-Video : un seul prompt écrit produit une vidéo 2K de 5–15 secondes à 24 FPS, accompagnée d'un son stéréo natif généré avec l'image. L'outil accepte uniquement du texte ; utilisez les flux de travail H3 associés si vous avez besoin de références image, vidéo ou audio.
| Atout de MiniMax H3 | Ce que cela vous apporte |
|---|---|
| Vidéo 2K et son stéréo natif générés conjointement | Générez des images détaillées, des dialogues, des effets, une ambiance et de la musique en une seule opération, avec moins d'étapes distinctes d'upscaling, de conception sonore et de synchronisation. |
| Omni-Reference dirigé par le langage | Dans les flux de travail MiniMax H3, attribuez des rôles différents aux images, à la vidéo et à l'audio — identité, apparence du produit, mouvement, style de caméra, voix ou musique — afin que plusieurs sources guident un résultat cohérent. |
| Transfert V2V et montage ciblé | MiniMax H3 peut reprendre un mouvement ou un langage de caméra et modifier certains éléments visuels ou sonores tout en préservant le reste, offrant aux équipes une alternative à la régénération complète d'un plan. |
| Durée et cadrage prêts pour la diffusion | Générez 5–15 secondes à 24 FPS dans six formats afin que hooks, révélations produit et scènes en plusieurs temps s'adaptent aux supports cinéma, web, feed, portrait ou verticaux, avec moins de remontage et de recadrage. |
9:16 ou des contenus de feed en 1:1, avec un hook d'ouverture clair et un cadrage adapté à la plateforme.Le premier tableau présente les réglages exposés par l'outil MiniMax H3 Text-to-Video sur cette page.
| Paramètre | Obligatoire | Type | Valeur par défaut | Plage / Options | Comment choisir |
|---|---|---|---|---|---|
prompt* | Oui (*) | String | Exemple de prompt | 1–4,000 caractères | Donnez à MiniMax H3 un brief structuré couvrant le sujet, une action principale, la caméra, le décor et l'éclairage, le style visuel, l'audio et la fin souhaitée. Une structure claire compte davantage que l'utilisation de toute la limite. |
aspect_ratio | Non | String | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Adaptez la sortie MiniMax H3 à la destination : 21:9 pour les plans cinéma ultra-larges, 16:9 pour la vidéo générale et la publicité, 4:3 pour un cadrage éditorial ou rétro, 1:1 pour les feeds, 3:4 pour les produits en portrait et 9:16 pour les vidéos sociales verticales. |
resolution | Non | String | 2k | 2k | Valeur fixe pour cet outil, correspondant au niveau 1440p ci-dessous. Choisissez MiniMax H3 lorsque la sortie exige des détails haute résolution sans sélectionner un autre niveau de qualité. |
duration | Non | Integer | 5 | 5–15 secondes, par incréments de 1 seconde | Utilisez des clips MiniMax H3 de 5–7 secondes pour une action ou une itération rapide, 8–10 secondes pour une évolution simple, et 11–15 secondes uniquement lorsque le prompt définit clairement un début, un développement et une fin. |
\* Champ obligatoire.
Le tableau suivant résume l'ensemble de la famille MiniMax H3. Les entrées décrites pour les modes première/dernière image et Omni-Reference sont accessibles dans des flux de travail distincts ; elles ne constituent pas des réglages de cette page Text-to-Video.
| Dimension principale | MiniMax H3 |
|---|---|
| Modèle | MiniMax-H3 |
| Durée de sortie | MiniMax H3 génère 5–15 secondes. |
| Format de sortie | Mode première/dernière image : reprend le format d'origine de l'image d'entrée.<br>Mode Text-to-Video : utilise le format choisi par l'utilisateur : 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.<br>Mode Omni-Reference : utilise l'un de ces six formats ou Auto, qui laisse MiniMax H3 choisir le format de sortie. |
| Résolution | MiniMax H3 prend en charge deux niveaux documentés. Mode 768p (disponible ultérieurement) : pour les formats de 16:9 à 9:16, le petit côté mesure 768 pixels ; pour une sortie plus large, la résolution totale est d'environ 1 MP — par exemple, 21:9 correspond à 1536×672. Un résultat 768p peut être converti en 1440p.<br>Mode 1440p / 2K : pour les formats de 16:9 à 9:16, le petit côté mesure 1440 pixels ; pour une sortie plus large, la résolution totale est d'environ 3.7 MP — par exemple, 21:9 correspond à 2976×1248. |
| Fréquence d'images de sortie | MiniMax H3 génère à 24 FPS. |
| Audio de sortie | Chaque résultat MiniMax H3 comprend un son stéréo natif. |
| Entrée première/dernière image | Images : 0, 1 ou 2 ; largeur et hauteur de 256–5760 pixels chacune ; rapport de 5:2 à 2:5 (0.4–2.5). Sans image en entrée, MiniMax H3 fonctionne en mode Text-to-Video — l'outil proposé sur cette page. |
| Entrée Omni-Reference | Images : jusqu'à 9 ; largeur et hauteur de 256–5760 pixels chacune.<br>Vidéos : jusqu'à 3 ; 2–15 secondes chacune ; durée vidéo cumulée de 15 secondes maximum ; largeur et hauteur de 256–5760 pixels chacune ; rapport de 5:2 à 2:5 (0.4–2.5).<br>Audio : jusqu'à 3 clips ; 2–15 secondes chacun ; durée audio cumulée de 15 secondes maximum. L'audio doit accompagner une image ou une vidéo et ne peut pas constituer l'unique référence.<br>Entrée mixte : jusqu'à 12 fichiers au total. Sans entrée image, vidéo ou audio, le flux de travail devient Text-to-Video. |
| Formats d'entrée acceptés | MiniMax H3 accepte vidéo : H.264/AVC ou H.265/HEVC ; audio intégré : AAC ou MP3.<br>Image : JPG, JPEG, PNG, WEBP, HEIC ou HEIF.<br>Audio : WAV ou MP3. |
| Limites de taille des entrées | Chaque vidéo : 50 MB ; chaque image : 30 MB ; chaque fichier audio : 15 MB. Il n'existe aucune limite multimédia cumulée distincte des limites par fichier, mais le corps de la requête API est limité à 64 MB ; l'utilisation de médias fournis par URL est recommandée. |
| Limite du prompt | Le guide produit MiniMax H3 autorise jusqu'à 7,000 caractères. Ce déploiement Text-to-Video accepte actuellement 1–4,000 caractères, comme indiqué dans le tableau des réglages de la page ci-dessus. |
MiniMax H3 coûte $0.13 USD par seconde générée en 2K sur cette page.
| Durée | Prix par vidéo |
|---|---|
| 5 secondes | $0.65 |
| 10 secondes | $1.30 |
| 15 secondes | $1.95 |
Pour les lots de 1–4 sorties, calculez le total avec la formule duration × $0.13 × output count.
Utilisez cette structure de prompt réutilisable pour MiniMax H3 :
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
Prompt faible
> Une publicité pour une montre de luxe, cinématographique et dynamique, avec de la musique.
Prompt MiniMax H3 amélioré
> Une montre automatique en acier brossé repose sur une pierre volcanique noire. Un étroit faisceau de lumière de studio balaie le verre saphir tandis que la trotteuse avance et que des gouttes de condensation perlent sur le boîtier. Commencez par un macro extrême, effectuez ensuite une lente orbite de 30 degrés et terminez sur le cadran. Publicité de luxe très contrastée, fond noir profond. Audio : léger tic-tac mécanique et une unique pulsation cinématographique grave ; aucun dialogue.
La version améliorée fournit à MiniMax H3 un sujet identifiable, une action temporisée, une direction de caméra distincte, un éclairage, une finition visuelle, des sources sonores et une image finale vérifiable.
Utilisez ce comparatif MiniMax H3 comme guide des familles de modèles ; la résolution et la durée maximales peuvent ne pas être disponibles simultanément, et les flux de travail RunComfy peuvent proposer des entrées, des niveaux de résolution et des réglages audio différents.
| Modèle | Résolution | Durée maximale | Audio | Particularité |
|---|---|---|---|---|
| MiniMax H3 | Jusqu’à 2K | 15s | Son stéréo natif (voix, SFX, musique) | Relie par le langage des références texte, image, vidéo et audio afin de transférer le mouvement en V2V et d'effectuer un montage orienté production ; les poids publics sont prévus, mais ne sont pas encore disponibles. |
| Hailuo 02 | 1080p | ~10s | Aucun son | Le respect précis du prompt et les mouvements axés sur la physique conviennent à la gymnastique, la danse, la mise en mouvement de produits et d'autres plans d'action muets qui seront sonorisés ultérieurement. |
| Kling 3.0 | Jusqu’à 4K | 15s | Son natif avec synchronisation labiale | Coordonne les changements de caméra entre plusieurs plans avec des dialogues multilingues attribués aux différents locuteurs et une synchronisation labiale — utile pour les publicités scénarisées, les storyboards et les scènes centrées sur les personnages. |
| Seedance 2.0 | 1080p | 15s | Audio et vidéo générés conjointement | Associe de nombreuses références image, vidéo et audio à une génération audiovisuelle conjointe et une synchronisation labiale précise pour les publicités sensibles à l'identité, les récits de marque et les montages riches en références. |
| Veo 3.1 | 4K | 8s | Dialogues et effets natifs | Associe dialogues et effets décrits dans le prompt à des réglages de première/dernière image, d'image de référence et d'extension de scène — adapté aux transitions cinématographiques et aux séquences assemblées. |
Pour Hailuo 02, les valeurs maximales indiquées dépendent du mode : la sortie 1080p est limitée à 6 secondes, tandis qu'une sortie de 10 secondes est disponible en 512p ou 768p.
Pour MiniMax H3, les fonctions Omni-Reference et V2V appartiennent à des flux de travail associés ; l'outil Text-to-Video de cette page reste réservé aux prompts.
La force de MiniMax H3 réside dans cette combinaison : une famille de modèles polyvalente qui relie texte, image, vidéo et audio, génère un son stéréo natif et atteint 2K à $0.13 par seconde générée sur cette page. Choisissez MiniMax H3 si vous souhaitez partir d'un brief textuel tout en conservant la possibilité d'une création ou d'un montage guidé par des références dans des flux de travail associés. D'après les informations publiques disponibles, testez le même brief avec chaque modèle avant d'adopter une chaîne de production.
Si MiniMax H3 n'est pas le bon point de départ pour votre projet, comparez ces flux de travail spécialisés sur RunComfy :
Prolongez une vidéo existante de 7 secondes en 720p, avec guidage par prompt et génération audio facultative.
Transforme des références visuelles ou audio en clips HD avec un contrôle précis du mouvement.
Créez un nouveau plan à partir d’une vidéo de référence et guidez-le avec un prompt, des éléments, des images, le format, la durée et la bande-son d’origine.
Transformez vos images en vidéos 2K fluides et réalistes avec Dreamina 3.0.
Créez une vidéo avec Kling 2.5 Turbo à partir d’un prompt et choisissez la durée, le rapport largeur/hauteur et le prompt négatif.
Générez une vidéo avec un audio synchronisé à partir d'une invite de texte requise. Choisissez `1280x720` ou `720x1280` et une durée de `4`, `8` ou `12` secondes.
Oui. MiniMax H3 Text-to-Video est disponible dans le navigateur et via la RunComfy API en utilisant les crédits de votre compte.
MiniMax H3 est la famille de modèles multimodaux polyvalents de génération et de montage de MiniMax. Sa conception étendue couvre le texte, l'image, la vidéo et l'audio, tandis que chaque flux de travail propose des entrées différentes. Cette page fournit le flux de travail Text-to-Video reposant uniquement sur un prompt.
MiniMax positionne H3 pour la publicité, le branding, l'e-commerce, le cinéma, la création de titres, les affiches animées, les récits courts, les concepts de produits et d'UI, les jeux vidéo, les personnages virtuels et l'animation stylisée. Le flux de travail Text-to-Video actuel convient particulièrement aux concepts courts pouvant être dirigés par un prompt écrit.
Sur cette page, MiniMax H3 génère uniquement de la vidéo 2K. Choisissez une durée en secondes entières de 5 à 15 secondes ; la valeur par défaut est de 5 secondes. Ce flux de travail ne propose pas d'option 768p.
Oui. Ce flux de travail Text-to-Video génère un son stéréo natif avec la vidéo. Décrivez les dialogues, l'ambiance, les effets sonores ou la musique dans le prompt ; il n'existe pas de réglage audio distinct. Les résultats peuvent varier : vérifiez donc la synchronisation labiale et le calage de l'audio.
Non. Cette page correspond au flux de travail MiniMax H3 Text-to-Video reposant uniquement sur un prompt, et son API accepte seulement prompt, aspect_ratio, resolution et duration. Pour utiliser des médias sources, choisissez un flux de travail H3 Image-to-Video ou Reference-to-Video distinct.
Dans les flux de travail H3 acceptant des références, le langage naturel peut attribuer des rôles différents au texte, aux images, à la vidéo et à l'audio. Par exemple, une source peut définir le mouvement de caméra, une autre le personnage et une autre encore la voix. Il s'agit d'une capacité de la famille de modèles, et non d'une fonction de chargement de médias sur la page actuelle.
Non. RunComfy fournit MiniMax H3 dans le navigateur et via une API HTTP ; vous n'avez donc pas besoin d'héberger ni de mettre le modèle à l'échelle vous-même. Dans sa publication de lancement du 31 juillet, MiniMax décrivait un projet conditionnel de publication des poids du modèle ; vérifiez la disponibilité actuelle et les conditions de licence avant d'envisager un auto-hébergement.
MiniMax H3 Text-to-Video coûte $0.13 par seconde générée en 2K. Une vidéo de 5 secondes coûte $0.65, une vidéo de 10 secondes coûte $1.30 et une vidéo de 15 secondes coûte $1.95. La génération par lots multiplie le coût fondé sur la durée par le nombre de résultats.
MiniMax décrit Hailuo 02 comme étant axé sur l'architecture, les données et l'échelle, tandis que MiniMax H3 se concentre sur la généralisation des tâches et des modalités. H3 ajoute également l'audio stéréo natif et la sortie 2K à son flux de travail Text-to-Video.
Testez le prompt, le format d'image et la durée dans RunComfy. Appelez ensuite le même template MiniMax H3 Text-to-Video via l'API avec prompt (obligatoire), aspect_ratio, resolution (2k uniquement) et duration (5–15). Ce flux de travail ne comporte aucun champ de chargement de médias.
RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.














