logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

MiniMax H3 : Text-to-Video 2K avec audio stéréo | RunComfy

minimax/minimax-h3/text-to-video

MiniMax H3 Text-to-Video transforme un prompt écrit en une vidéo 2K de 5–15 secondes avec un son stéréo natif. Utilisez un autre flux de travail H3 pour les références d'image, de vidéo ou d'audio.

Le rapport d'aspect de la vidéo générée.
La résolution de la vidéo générée.
La longueur de la vidéo générée en secondes.
Idle
MiniMax H3 generates 2K video. The rate is $0.13 per second.

Introduction à la création vidéo avec MiniMax H3

MiniMax H3 est la famille de modèles multimodaux polyvalents de MiniMax. Cette page Text-to-Video transforme un prompt écrit en une vidéo 2K de 5–15 secondes à 24 FPS, avec un son stéréo généré en même temps que l'image. Dans l'ensemble de la famille, des flux de travail H3 distincts utilisent les images, la vidéo et l'audio comme références pour l'identité, le mouvement, la caméra, la voix, le son ou le montage ; ces entrées multimédias ne sont pas disponibles sur cette page. MiniMax positionne le modèle pour la publicité, le branding, l'e-commerce, le design de produit, l'UI/UX, les jeux vidéo et les concepts audiovisuels courts. Pour les développeurs, MiniMax H3 sur RunComfy est disponible à la fois dans le navigateur et via une API HTTP ; vous n'avez donc pas besoin d'héberger ni de mettre le modèle à l'échelle vous-même.
Idéal pour : publicités et vidéos produit en 2K | narration de marque dirigée par prompt | concepts audiovisuels courts

Pourquoi choisir MiniMax H3#


MiniMax H3 est la famille de modèles multimodaux de MiniMax conçue pour générer et modifier des images, de la vidéo et de l'audio à partir d'instructions en langage naturel. Cette page propose MiniMax H3 Text-to-Video : un seul prompt écrit produit une vidéo 2K de 5–15 secondes à 24 FPS, accompagnée d'un son stéréo natif généré avec l'image. L'outil accepte uniquement du texte ; utilisez les flux de travail H3 associés si vous avez besoin de références image, vidéo ou audio.


Atout de MiniMax H3Ce que cela vous apporte
Vidéo 2K et son stéréo natif générés conjointementGénérez des images détaillées, des dialogues, des effets, une ambiance et de la musique en une seule opération, avec moins d'étapes distinctes d'upscaling, de conception sonore et de synchronisation.
Omni-Reference dirigé par le langageDans les flux de travail MiniMax H3, attribuez des rôles différents aux images, à la vidéo et à l'audio — identité, apparence du produit, mouvement, style de caméra, voix ou musique — afin que plusieurs sources guident un résultat cohérent.
Transfert V2V et montage cibléMiniMax H3 peut reprendre un mouvement ou un langage de caméra et modifier certains éléments visuels ou sonores tout en préservant le reste, offrant aux équipes une alternative à la régénération complète d'un plan.
Durée et cadrage prêts pour la diffusionGénérez 5–15 secondes à 24 FPS dans six formats afin que hooks, révélations produit et scènes en plusieurs temps s'adaptent aux supports cinéma, web, feed, portrait ou verticaux, avec moins de remontage et de recadrage.

Meilleurs cas d'utilisation#


  • Publicité et lancements de produits : Utilisez MiniMax H3 pour des hero shots, des révélations produit, des concepts de campagne et de courtes publicités où la caméra et le son doivent être conçus ensemble.
  • Contenu pour les réseaux sociaux : Utilisez MiniMax H3 pour créer des Shorts, Reels et Stories en 9:16 ou des contenus de feed en 1:1, avec un hook d'ouverture clair et un cadrage adapté à la plateforme.
  • Prévisualisation cinéma et publicitaire : Utilisez MiniMax H3 pour tester un mouvement de caméra, un plan d'éclairage, une action, une transition ou une bande-son temporaire avant de lancer la production.
  • Narration de marque et stylisée : Utilisez MiniMax H3 pour explorer des génériques, des affiches animées, des moments de personnage et des partis pris graphiques lorsqu'une idée écrite demande un traitement audiovisuel abouti.

Fonctionnement#


  1. Décrivez le plan : Indiquez à MiniMax H3 ce qui apparaît, ce qui évolue dans le temps, comment la caméra se déplace, l'aspect attendu de la scène et ce qui doit être entendu.
  2. Choisissez le format de diffusion : Sélectionnez un format et une durée de 5–15 secondes. MiniMax H3 conserve une résolution fixe de 2K ; aucun niveau de qualité n'est donc à configurer.
  3. Générez et affinez : Le modèle crée simultanément la vidéo et le son stéréo. Vérifiez les mouvements, le texte, les visages, la synchronisation labiale et le calage sonore, puis modifiez une seule instruction à la fois.

Paramètres#


Le premier tableau présente les réglages exposés par l'outil MiniMax H3 Text-to-Video sur cette page.


ParamètreObligatoireTypeValeur par défautPlage / OptionsComment choisir
prompt*Oui (*)StringExemple de prompt1–4,000 caractèresDonnez à MiniMax H3 un brief structuré couvrant le sujet, une action principale, la caméra, le décor et l'éclairage, le style visuel, l'audio et la fin souhaitée. Une structure claire compte davantage que l'utilisation de toute la limite.
aspect_ratioNonString16:921:9, 16:9, 4:3, 1:1, 3:4, 9:16Adaptez la sortie MiniMax H3 à la destination : 21:9 pour les plans cinéma ultra-larges, 16:9 pour la vidéo générale et la publicité, 4:3 pour un cadrage éditorial ou rétro, 1:1 pour les feeds, 3:4 pour les produits en portrait et 9:16 pour les vidéos sociales verticales.
resolutionNonString2k2kValeur fixe pour cet outil, correspondant au niveau 1440p ci-dessous. Choisissez MiniMax H3 lorsque la sortie exige des détails haute résolution sans sélectionner un autre niveau de qualité.
durationNonInteger55–15 secondes, par incréments de 1 secondeUtilisez des clips MiniMax H3 de 5–7 secondes pour une action ou une itération rapide, 8–10 secondes pour une évolution simple, et 11–15 secondes uniquement lorsque le prompt définit clairement un début, un développement et une fin.

\* Champ obligatoire.


Le tableau suivant résume l'ensemble de la famille MiniMax H3. Les entrées décrites pour les modes première/dernière image et Omni-Reference sont accessibles dans des flux de travail distincts ; elles ne constituent pas des réglages de cette page Text-to-Video.


Dimension principaleMiniMax H3
ModèleMiniMax-H3
Durée de sortieMiniMax H3 génère 5–15 secondes.
Format de sortieMode première/dernière image : reprend le format d'origine de l'image d'entrée.<br>Mode Text-to-Video : utilise le format choisi par l'utilisateur : 21:9, 16:9, 4:3, 1:1, 3:4 ou 9:16.<br>Mode Omni-Reference : utilise l'un de ces six formats ou Auto, qui laisse MiniMax H3 choisir le format de sortie.
RésolutionMiniMax H3 prend en charge deux niveaux documentés. Mode 768p (disponible ultérieurement) : pour les formats de 16:9 à 9:16, le petit côté mesure 768 pixels ; pour une sortie plus large, la résolution totale est d'environ 1 MP — par exemple, 21:9 correspond à 1536×672. Un résultat 768p peut être converti en 1440p.<br>Mode 1440p / 2K : pour les formats de 16:9 à 9:16, le petit côté mesure 1440 pixels ; pour une sortie plus large, la résolution totale est d'environ 3.7 MP — par exemple, 21:9 correspond à 2976×1248.
Fréquence d'images de sortieMiniMax H3 génère à 24 FPS.
Audio de sortieChaque résultat MiniMax H3 comprend un son stéréo natif.
Entrée première/dernière imageImages : 0, 1 ou 2 ; largeur et hauteur de 256–5760 pixels chacune ; rapport de 5:2 à 2:5 (0.4–2.5). Sans image en entrée, MiniMax H3 fonctionne en mode Text-to-Video — l'outil proposé sur cette page.
Entrée Omni-ReferenceImages : jusqu'à 9 ; largeur et hauteur de 256–5760 pixels chacune.<br>Vidéos : jusqu'à 3 ; 2–15 secondes chacune ; durée vidéo cumulée de 15 secondes maximum ; largeur et hauteur de 256–5760 pixels chacune ; rapport de 5:2 à 2:5 (0.4–2.5).<br>Audio : jusqu'à 3 clips ; 2–15 secondes chacun ; durée audio cumulée de 15 secondes maximum. L'audio doit accompagner une image ou une vidéo et ne peut pas constituer l'unique référence.<br>Entrée mixte : jusqu'à 12 fichiers au total. Sans entrée image, vidéo ou audio, le flux de travail devient Text-to-Video.
Formats d'entrée acceptésMiniMax H3 accepte vidéo : H.264/AVC ou H.265/HEVC ; audio intégré : AAC ou MP3.<br>Image : JPG, JPEG, PNG, WEBP, HEIC ou HEIF.<br>Audio : WAV ou MP3.
Limites de taille des entréesChaque vidéo : 50 MB ; chaque image : 30 MB ; chaque fichier audio : 15 MB. Il n'existe aucune limite multimédia cumulée distincte des limites par fichier, mais le corps de la requête API est limité à 64 MB ; l'utilisation de médias fournis par URL est recommandée.
Limite du promptLe guide produit MiniMax H3 autorise jusqu'à 7,000 caractères. Ce déploiement Text-to-Video accepte actuellement 1–4,000 caractères, comme indiqué dans le tableau des réglages de la page ci-dessus.

Tarifs#


MiniMax H3 coûte $0.13 USD par seconde générée en 2K sur cette page.


DuréePrix par vidéo
5 secondes$0.65
10 secondes$1.30
15 secondes$1.95

Pour les lots de 1–4 sorties, calculez le total avec la formule duration × $0.13 × output count.


Conseils et exemples de prompts#


Utilisez cette structure de prompt réutilisable pour MiniMax H3 :


[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]


  • Séparez les mouvements : Décrivez indépendamment le mouvement du sujet et celui de la caméra.
  • Montrez la séquence : Utilisez « commence par », « puis » et « se termine sur » lorsque le clip comporte plusieurs temps.
  • Nommez les sources sonores : Indiquez à MiniMax H3 qui parle, ce qui produit chaque son, l'ambiance souhaitée et si la musique doit dominer ou rester discrète.
  • Limitez les idées concurrentes : Un sujet principal, une action centrale et un style cohérent sont plus faciles à suivre pour MiniMax H3.

Prompt faible


> Une publicité pour une montre de luxe, cinématographique et dynamique, avec de la musique.


Prompt MiniMax H3 amélioré


> Une montre automatique en acier brossé repose sur une pierre volcanique noire. Un étroit faisceau de lumière de studio balaie le verre saphir tandis que la trotteuse avance et que des gouttes de condensation perlent sur le boîtier. Commencez par un macro extrême, effectuez ensuite une lente orbite de 30 degrés et terminez sur le cadran. Publicité de luxe très contrastée, fond noir profond. Audio : léger tic-tac mécanique et une unique pulsation cinématographique grave ; aucun dialogue.


La version améliorée fournit à MiniMax H3 un sujet identifiable, une action temporisée, une direction de caméra distincte, un éclairage, une finition visuelle, des sources sonores et une image finale vérifiable.


Comparatif MiniMax H3#


Utilisez ce comparatif MiniMax H3 comme guide des familles de modèles ; la résolution et la durée maximales peuvent ne pas être disponibles simultanément, et les flux de travail RunComfy peuvent proposer des entrées, des niveaux de résolution et des réglages audio différents.


ModèleRésolutionDurée maximaleAudioParticularité
MiniMax H3Jusqu’à 2K15sSon stéréo natif (voix, SFX, musique)Relie par le langage des références texte, image, vidéo et audio afin de transférer le mouvement en V2V et d'effectuer un montage orienté production ; les poids publics sont prévus, mais ne sont pas encore disponibles.
Hailuo 021080p~10sAucun sonLe respect précis du prompt et les mouvements axés sur la physique conviennent à la gymnastique, la danse, la mise en mouvement de produits et d'autres plans d'action muets qui seront sonorisés ultérieurement.
Kling 3.0Jusqu’à 4K15sSon natif avec synchronisation labialeCoordonne les changements de caméra entre plusieurs plans avec des dialogues multilingues attribués aux différents locuteurs et une synchronisation labiale — utile pour les publicités scénarisées, les storyboards et les scènes centrées sur les personnages.
Seedance 2.01080p15sAudio et vidéo générés conjointementAssocie de nombreuses références image, vidéo et audio à une génération audiovisuelle conjointe et une synchronisation labiale précise pour les publicités sensibles à l'identité, les récits de marque et les montages riches en références.
Veo 3.14K8sDialogues et effets natifsAssocie dialogues et effets décrits dans le prompt à des réglages de première/dernière image, d'image de référence et d'extension de scène — adapté aux transitions cinématographiques et aux séquences assemblées.

Pour Hailuo 02, les valeurs maximales indiquées dépendent du mode : la sortie 1080p est limitée à 6 secondes, tandis qu'une sortie de 10 secondes est disponible en 512p ou 768p.


Pour MiniMax H3, les fonctions Omni-Reference et V2V appartiennent à des flux de travail associés ; l'outil Text-to-Video de cette page reste réservé aux prompts.


La force de MiniMax H3 réside dans cette combinaison : une famille de modèles polyvalente qui relie texte, image, vidéo et audio, génère un son stéréo natif et atteint 2K à $0.13 par seconde générée sur cette page. Choisissez MiniMax H3 si vous souhaitez partir d'un brief textuel tout en conservant la possibilité d'une création ou d'un montage guidé par des références dans des flux de travail associés. D'après les informations publiques disponibles, testez le même brief avec chaque modèle avant d'adopter une chaîne de production.


Autres modèles à essayer#


Si MiniMax H3 n'est pas le bon point de départ pour votre projet, comparez ces flux de travail spécialisés sur RunComfy :


  • MiniMax H3 Image-to-Video : Partez d'une image et guidez éventuellement la dernière image lorsque la composition, l'identité ou l'apparence du produit doivent rester ancrées.
  • MiniMax H3 Reference-to-Video : Combinez des images avec de la vidéo et de l'audio facultatifs lorsque le mouvement, le style de caméra, la voix, la musique ou d'autres détails de la source doivent être conservés.
  • Hailuo 02 Image-to-Video : Essayez une génération MiniMax antérieure si vous recherchez un flux de travail ciblé pour l'animation d'images.
  • Hailuo 2.3 Pro : Animez une image fixe en 1080p avec des mouvements stables et sensibles à la physique, des expressions faciales nuancées et un éclairage naturel — idéal pour des plans soignés de produits, de portraits et de personnages.
  • Kling 3.0 : Animez une image de départ avec une image finale facultative, des références d'éléments, des prompts de plans minutés et un son synchronisé pour des séquences de marque et de personnages maîtrisées.
  • Seedance 2.0 Pro : Combinez jusqu'à neuf images, trois vidéos et trois clips audio afin d'aligner l'identité, le langage de caméra, la parole, les effets et la musique synchronisés dans des clips de 4–15 secondes.

Ressources officielles#


  • Publication de lancement de MiniMax H3
  • Site officiel de MiniMax

Modèles associés

veo-3-1/fast/extend-video

Prolongez une vidéo existante de 7 secondes en 720p, avec guidage par prompt et génération audio facultative.

wan-2.7/reference-to-video

Transforme des références visuelles ou audio en clips HD avec un contrôle précis du mouvement.

kling-video-o1/video-to-video/reference

Créez un nouveau plan à partir d’une vidéo de référence et guidez-le avec un prompt, des éléments, des images, le format, la durée et la bande-son d’origine.

dreamina-3-0/image-to-video

Transformez vos images en vidéos 2K fluides et réalistes avec Dreamina 3.0.

kling-2-5/turbo/text-to-video

Créez une vidéo avec Kling 2.5 Turbo à partir d’un prompt et choisissez la durée, le rapport largeur/hauteur et le prompt négatif.

sora-2/text-to-video

Générez une vidéo avec un audio synchronisé à partir d'une invite de texte requise. Choisissez `1280x720` ou `720x1280` et une durée de `4`, `8` ou `12` secondes.

Questions Fréquemment Posées

MiniMax H3 est-il disponible dès maintenant sur RunComfy ?

Oui. MiniMax H3 Text-to-Video est disponible dans le navigateur et via la RunComfy API en utilisant les crédits de votre compte.

Qu'est-ce que MiniMax H3 ?

MiniMax H3 est la famille de modèles multimodaux polyvalents de génération et de montage de MiniMax. Sa conception étendue couvre le texte, l'image, la vidéo et l'audio, tandis que chaque flux de travail propose des entrées différentes. Cette page fournit le flux de travail Text-to-Video reposant uniquement sur un prompt.

À quoi peut servir MiniMax H3 ?

MiniMax positionne H3 pour la publicité, le branding, l'e-commerce, le cinéma, la création de titres, les affiches animées, les récits courts, les concepts de produits et d'UI, les jeux vidéo, les personnages virtuels et l'animation stylisée. Le flux de travail Text-to-Video actuel convient particulièrement aux concepts courts pouvant être dirigés par un prompt écrit.

Quelle résolution et quelle durée de clip MiniMax H3 Text-to-Video prend-il en charge ?

Sur cette page, MiniMax H3 génère uniquement de la vidéo 2K. Choisissez une durée en secondes entières de 5 à 15 secondes ; la valeur par défaut est de 5 secondes. Ce flux de travail ne propose pas d'option 768p.

MiniMax H3 génère-t-il de l'audio ?

Oui. Ce flux de travail Text-to-Video génère un son stéréo natif avec la vidéo. Décrivez les dialogues, l'ambiance, les effets sonores ou la musique dans le prompt ; il n'existe pas de réglage audio distinct. Les résultats peuvent varier : vérifiez donc la synchronisation labiale et le calage de l'audio.

Puis-je utiliser des références d'image, de vidéo ou d'audio sur cette page MiniMax H3 ?

Non. Cette page correspond au flux de travail MiniMax H3 Text-to-Video reposant uniquement sur un prompt, et son API accepte seulement prompt, aspect_ratio, resolution et duration. Pour utiliser des médias sources, choisissez un flux de travail H3 Image-to-Video ou Reference-to-Video distinct.

Que signifie le contexte multimodal pour la famille de modèles MiniMax H3 ?

Dans les flux de travail H3 acceptant des références, le langage naturel peut attribuer des rôles différents au texte, aux images, à la vidéo et à l'audio. Par exemple, une source peut définir le mouvement de caméra, une autre le personnage et une autre encore la voix. Il s'agit d'une capacité de la famille de modèles, et non d'une fonction de chargement de médias sur la page actuelle.

Dois-je héberger MiniMax H3 moi-même ?

Non. RunComfy fournit MiniMax H3 dans le navigateur et via une API HTTP ; vous n'avez donc pas besoin d'héberger ni de mettre le modèle à l'échelle vous-même. Dans sa publication de lancement du 31 juillet, MiniMax décrivait un projet conditionnel de publication des poids du modèle ; vérifiez la disponibilité actuelle et les conditions de licence avant d'envisager un auto-hébergement.

Combien coûte MiniMax H3 Text-to-Video ?

MiniMax H3 Text-to-Video coûte $0.13 par seconde générée en 2K. Une vidéo de 5 secondes coûte $0.65, une vidéo de 10 secondes coûte $1.30 et une vidéo de 15 secondes coûte $1.95. La génération par lots multiplie le coût fondé sur la durée par le nombre de résultats.

En quoi MiniMax H3 diffère-t-il de Hailuo 02 ?

MiniMax décrit Hailuo 02 comme étant axé sur l'architecture, les données et l'échelle, tandis que MiniMax H3 se concentre sur la généralisation des tâches et des modalités. H3 ajoute également l'audio stéréo natif et la sortie 2K à son flux de travail Text-to-Video.

Comment passer du test de MiniMax H3 dans le navigateur à l'intégration API ?

Testez le prompt, le format d'image et la durée dans RunComfy. Appelez ensuite le même template MiniMax H3 Text-to-Video via l'API avec prompt (obligatoire), aspect_ratio, resolution (2k uniquement) et duration (5–15). Ce flux de travail ne comporte aucun champ de chargement de médias.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.

Exemples de MiniMax H3

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...