Trasforma un prompt in un breve video, scegliendo durata, formato e generazione dell’audio.
MiniMax H3 è la famiglia di modelli multimodali di MiniMax per generare e modificare immagini, video e audio tramite istruzioni in linguaggio naturale. Questa pagina offre MiniMax H3 Text-to-Video: trasforma un unico prompt scritto in un video 2K di 5–15 secondi a 24 FPS, con audio stereo nativo generato insieme alle immagini. Accetta solo testo; usa i workflow H3 collegati quando servono riferimenti di immagini, video o audio.
| Vantaggio di MiniMax H3 | Cosa significa per l'utente |
|---|---|
| Video 2K e audio stereo nativo generati insieme | Genera immagini dettagliate, dialoghi, effetti, atmosfera e musica in un unico processo, riducendo le fasi separate di upscaling, sound design e sincronizzazione. |
| Omni-Reference diretto dal linguaggio | Nei workflow MiniMax H3, assegna a immagini, video e audio ruoli diversi — come identità, aspetto del prodotto, movimento, stile della camera, voce o musica — affinché più sorgenti guidino un risultato coerente. |
| Trasferimento V2V e modifica mirata | MiniMax H3 può trasferire movimento o linguaggio di camera e modificare elementi visivi o sonori selezionati preservando il resto, offrendo ai team un'alternativa alla rigenerazione completa dell'inquadratura. |
| Durata e formato pronti per la pubblicazione | Genera 5–15 secondi a 24 FPS in sei rapporti d'aspetto, così hook, product reveal e scene in più momenti si adattano a destinazioni cinematografiche, web, feed, ritratto o verticali con meno rimontaggio e ritaglio. |
9:16 oppure contenuti per il feed in 1:1, con un hook iniziale chiaro e un'inquadratura già adatta alla piattaforma.La prima tabella elenca i controlli disponibili nello strumento MiniMax H3 Text-to-Video di questa pagina.
| Parametro | Obbligatorio | Tipo | Predefinito | Intervallo / Opzioni | Come scegliere |
|---|---|---|---|---|---|
prompt* | Sì (*) | String | Prompt di esempio | 1–4,000 caratteri | Fornisci a MiniMax H3 un brief strutturato che includa soggetto, un'azione principale, camera, ambientazione e illuminazione, stile visivo, audio e finale desiderato. Una struttura chiara conta più dell'uso dell'intero limite. |
aspect_ratio | No | String | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Adatta l'output di MiniMax H3 alla destinazione: 21:9 per inquadrature cinematografiche ultra-wide, 16:9 per video generici e pubblicità, 4:3 per un taglio editoriale o rétro, 1:1 per i feed, 3:4 per prodotti in verticale e 9:16 per i video social verticali. |
resolution | No | String | 2k | 2k | Valore fisso per questo strumento e associato al livello 1440p descritto più sotto. Scegli MiniMax H3 quando serve un output ad alta risoluzione senza selezionare un altro livello di qualità. |
duration | No | Integer | 5 | 5–15 secondi, a incrementi di 1 secondo | Usa clip MiniMax H3 di 5–7 secondi per un'azione o un'iterazione rapida, 8–10 secondi per un cambiamento semplice e 11–15 secondi solo quando il prompt definisce chiaramente inizio, sviluppo e conclusione. |
\* Campo obbligatorio.
La tabella seguente riassume l'intera famiglia di modelli MiniMax H3. Gli input descritti per le modalità primo/ultimo fotogramma e Omni-Reference sono disponibili tramite workflow separati e non come controlli di questa pagina Text-to-Video.
| Dimensione principale | MiniMax H3 |
|---|---|
| Modello | MiniMax-H3 |
| Durata dell'output | MiniMax H3 genera 5–15 secondi. |
| Rapporto d'aspetto dell'output | Modalità primo/ultimo fotogramma: mantiene il rapporto d'aspetto originale dell'immagine di input.<br>Modalità Text-to-Video: usa il rapporto selezionato dall'utente: 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16.<br>Modalità Omni-Reference: usa uno di questi sei rapporti oppure Auto, che consente a MiniMax H3 di scegliere il rapporto di output. |
| Risoluzione | MiniMax H3 supporta due livelli documentati. Modalità 768p (disponibile in seguito): per i rapporti d'aspetto da 16:9 a 9:16, il lato corto è di 768 pixel; per output più ampi, la risoluzione totale è di circa 1 MP — per esempio, 21:9 corrisponde a 1536×672. Un risultato 768p può essere convertito a 1440p.<br>Modalità 1440p / 2K: per i rapporti d'aspetto da 16:9 a 9:16, il lato corto è di 1440 pixel; per output più ampi, la risoluzione totale è di circa 3.7 MP — per esempio, 21:9 corrisponde a 2976×1248. |
| Frame rate dell'output | MiniMax H3 genera a 24 FPS. |
| Audio dell'output | Ogni risultato MiniMax H3 include audio stereo nativo. |
| Input primo/ultimo fotogramma | Immagini: 0, 1 o 2; larghezza e altezza di 256–5760 pixel ciascuna; rapporto d'aspetto da 5:2 a 2:5 (0.4–2.5). Senza immagini di input, MiniMax H3 funziona in modalità Text-to-Video, ovvero lo strumento disponibile in questa pagina. |
| Input Omni-Reference | Immagini: fino a 9; larghezza e altezza di 256–5760 pixel ciascuna.<br>Video: fino a 3; 2–15 secondi ciascuno; durata combinata dei video fino a 15 secondi; larghezza e altezza di 256–5760 pixel ciascuna; rapporto d'aspetto da 5:2 a 2:5 (0.4–2.5).<br>Audio: fino a 3 clip; 2–15 secondi ciascuna; durata combinata dell'audio fino a 15 secondi. L'audio deve accompagnare un'immagine o un video e non può essere l'unico riferimento.<br>Input misto: fino a 12 file totali. Senza input di immagini, video o audio, il workflow diventa Text-to-Video. |
| Formati di input supportati | MiniMax H3 accetta video: H.264/AVC o H.265/HEVC; audio incorporato: AAC o MP3.<br>Immagine: JPG, JPEG, PNG, WEBP, HEIC o HEIF.<br>Audio: WAV o MP3. |
| Limiti di dimensione degli input | Ogni video: 50 MB; ogni immagine: 30 MB; ogni file audio: 15 MB. Non esiste un limite complessivo separato oltre ai limiti per file, ma il corpo della richiesta API è limitato a 64 MB; si consiglia di fornire i media tramite URL. |
| Limite del prompt | La guida prodotto di MiniMax H3 consente fino a 7,000 caratteri. Questa implementazione Text-to-Video accetta attualmente 1–4,000 caratteri, come indicato nella tabella dei controlli della pagina. |
MiniMax H3 costa $0.13 USD per secondo generato in 2K su questa pagina.
| Durata | Prezzo per video |
|---|---|
| 5 secondi | $0.65 |
| 10 secondi | $1.30 |
| 15 secondi | $1.95 |
Per batch da 1–4 output, calcola il totale come duration × $0.13 × output count.
Usa questa struttura riutilizzabile per i prompt MiniMax H3:
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
Prompt debole
> Uno spot per un orologio di lusso, cinematografico e dinamico, con musica.
Prompt MiniMax H3 migliorato
> Un orologio automatico in acciaio spazzolato poggia su una pietra vulcanica nera. Una sottile luce da studio scorre sul vetro zaffiro mentre la lancetta dei secondi si muove e gocce di condensa si formano sulla cassa. Inizia con un'inquadratura macro estrema, quindi esegui un lento movimento orbitale di 30 gradi e termina sul quadrante. Spot di lusso ad alto contrasto, sfondo nero profondo. Audio: un lieve ticchettio meccanico e un singolo impulso cinematografico grave; nessun dialogo.
La versione migliorata fornisce a MiniMax H3 un soggetto riconoscibile, un'azione temporizzata, una direzione separata per la camera, illuminazione, resa finale, sorgenti sonore e un fotogramma conclusivo verificabile.
Usa questo confronto di MiniMax H3 come guida alle famiglie di modelli; risoluzione e durata massime potrebbero non essere disponibili contemporaneamente e i workflow RunComfy possono offrire input, livelli di risoluzione e controlli audio diversi.
| Modello | Risoluzione | Durata massima | Audio | Caratteristica distintiva |
|---|---|---|---|---|
| MiniMax H3 | Fino a 2K | 15s | Audio stereo nativo (voce, SFX, musica) | Mette in relazione riferimenti di testo, immagini, video e audio tramite il linguaggio per il trasferimento del movimento V2V e la modifica orientata alla produzione; i pesi pubblici sono previsti, ma non sono ancora stati rilasciati. |
| Hailuo 02 | 1080p | ~10s | Nessun audio | L'elevata aderenza al prompt e il movimento basato sulla fisica sono adatti a ginnastica, danza, prodotti in movimento e altre scene d'azione senza audio che verranno sonorizzate in seguito. |
| Kling 3.0 | Fino a 4K | 15s | Audio nativo con sincronizzazione labiale | Coordina cambi di camera su più inquadrature con dialoghi multilingue assegnati ai singoli parlanti e sincronizzazione labiale, risultando utile per spot con copione, storyboard e scene incentrate sui personaggi. |
| Seedance 2.0 | 1080p | 15s | Audio e video generati insieme | Combina numerosi riferimenti di immagini, video e audio con generazione audiovisiva congiunta e sincronizzazione labiale precisa per annunci sensibili all'identità, storie di brand e modifiche basate su molti riferimenti. |
| Veo 3.1 | 4K | 8s | Dialoghi ed effetti nativi | Abbina dialoghi ed effetti indicati nel prompt a controlli di primo/ultimo fotogramma, immagine di riferimento ed estensione della scena, adatti a transizioni cinematografiche e sequenze assemblate. |
Per Hailuo 02, i valori massimi indicati dipendono dalla modalità: l'output 1080p è limitato a 6 secondi, mentre l'output di 10 secondi è disponibile a 512p o 768p.
Per MiniMax H3, le funzionalità Omni-Reference e V2V appartengono a workflow collegati; lo strumento Text-to-Video di questa pagina rimane basato solo sul prompt.
Ciò che distingue MiniMax H3 è la combinazione: un'unica famiglia di modelli generici che mette in relazione testo, immagini, video e audio, genera suono stereo nativo e raggiunge il 2K a $0.13 per secondo generato su questa pagina. Scegli MiniMax H3 quando vuoi partire da un brief testuale e mantenere aperta la possibilità di creazione o modifica guidata da riferimenti nei workflow collegati. In base alle informazioni pubblicamente disponibili, prova lo stesso brief su ogni modello prima di adottare una pipeline.
Se MiniMax H3 non è il punto di partenza adatto per un progetto, confronta questi workflow specializzati su RunComfy:
Trasforma un prompt in un breve video, scegliendo durata, formato e generazione dell’audio.
Crea un video di sei o dieci secondi da un prompt testuale richiesto con Hailuo 02 ed espansione del prompt opzionale.
Crea un video da un prompt e controlla LoRA, risoluzione, proporzioni, fotogrammi, FPS, passaggi e seed.
Video realistici da testo o immagine con controllo creativo totale.
Anima un'immagine richiesta con un prompt richiesto utilizzando Kling 2.1 Standard, con controlli di durata, proporzioni, prompt negativo e intensità del prompt.
Aggiungi con Pikadditions una persona o un oggetto di un’immagine a un video esistente.
Sì. MiniMax H3 Text-to-Video è disponibile nel browser e tramite la RunComfy API usando i crediti del tuo account.
MiniMax H3 è la famiglia di modelli generici di generazione e modifica multimodale di MiniMax. La sua progettazione più ampia copre testo, immagini, video e audio, mentre i singoli workflow espongono input diversi. Questa pagina offre il workflow Text-to-Video basato solo sul prompt.
MiniMax posiziona H3 per pubblicità, branding, e-commerce, cinema, progettazione di titoli, poster animati, storytelling in formato breve, concept di prodotto e UI, giochi, personaggi virtuali e animazione stilizzata. L'attuale workflow Text-to-Video è ideale per brevi concept che possono essere diretti con un prompt scritto.
In questa pagina, MiniMax H3 genera solo video 2K. Scegli una durata in secondi interi da 5 a 15; il valore predefinito è 5 secondi. Questo workflow non offre un'opzione 768p.
Sì. Questo workflow Text-to-Video genera audio stereo nativo insieme al video. Descrivi nel prompt dialoghi, suoni ambientali, effetti sonori o musica; non è presente un controllo separato per l'audio. I risultati possono variare, quindi controlla la sincronizzazione labiale e la temporizzazione dell'audio.
No. Questa pagina è il workflow MiniMax H3 Text-to-Video basato solo sul prompt e la sua API accetta esclusivamente prompt, aspect_ratio, resolution e duration. Per i contenuti sorgente, usa un workflow H3 Image-to-Video o Reference-to-Video separato.
Nei workflow H3 che supportano i riferimenti, il linguaggio naturale può assegnare ruoli diversi a testo, immagini, video e audio. Ad esempio, una sorgente può definire il movimento della camera, un'altra il personaggio e un'altra ancora la voce. Questa è una funzionalità della famiglia di modelli, non una funzione di caricamento multimediale della pagina attuale.
No. RunComfy fornisce MiniMax H3 tramite il browser e una HTTP API, quindi non devi ospitare o scalare il modello in autonomia. Il post di lancio di MiniMax del 31 luglio descriveva un piano condizionato per il rilascio dei pesi del modello; verifica la disponibilità attuale e i termini della licenza prima di pianificare il self-hosting.
MiniMax H3 Text-to-Video costa $0.13 per secondo generato in 2K. Un video di 5 secondi costa $0.65, uno di 10 secondi costa $1.30 e uno di 15 secondi costa $1.95. La generazione in batch moltiplica il costo basato sulla durata per il numero di output.
MiniMax descrive Hailuo 02 come modello concentrato su architettura, dati e scala, mentre MiniMax H3 si concentra sulla generalizzazione di attività e modalità. H3 aggiunge inoltre audio stereo nativo e output 2K al proprio workflow Text-to-Video.
Prova il prompt, il rapporto d'aspetto e la durata in RunComfy. Poi richiama lo stesso template MiniMax H3 Text-to-Video tramite l'API con prompt (obbligatorio), aspect_ratio, resolution (solo 2k) e duration (5–15). Questo workflow non include campi per il caricamento di contenuti multimediali.
RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.














