Genera da tag testuali brani con voce e testi lunghi fino a 4 minuti.
Minimax H3 Reference to Video generates a 768p, 2K clip from a text prompt and the reference media you attach. Supply at least one reference image or video, describe the scene you want, and the model works out how your references should behave on screen.
The split is simple. Images pin what things look like; videos pin how things move. Minimax H3 Reference to Video reads both against your prompt rather than treating either as a fixed template.
768p for cheaper drafts or 2k when detail needs to hold up in large placements.The live Minimax H3 Reference to Video fields on this page.
| Parameter | Required | Type | Default | Range / Options | Description |
|---|---|---|---|---|---|
| prompt * | Yes (*) | string | Sample brief | 1-4000 characters | Scene, motion, camera work, visual style. |
| reference_images * | Yes (*) | array (URLs) | Sample reference | Up to 9 | Images guiding subject, style, composition. |
| reference_videos | No | array (URLs) | None | Up to 3 | Clips guiding movement, pacing, or interaction. |
| reference_audios | No | array (URLs) | None | Up to 3 | Audio guidance; needs an image or video too. |
| aspect_ratio * | Yes (*) | string | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Output framing. |
| duration * | Yes (*) | integer | 5 | 4-15 | Clip length in whole seconds. |
| resolution * | Yes (*) | string | 768p | 768p, 2k | Output resolution tier. |
At least one reference image or video is required.
Minimax H3 Reference to Video bills by resolution on counted seconds: the finished clip plus the combined length of any reference videos attached. Reference images and audio are not billed by duration.
| Resolution | Price per counted second |
|---|---|
| 768p | $0.10 |
| 2K | $0.16 |
| Output | Reference video | Counted seconds | Cost at 768p | Cost at 2K | Cost at |
|---|---|---|---|---|---|
| 5s | none | 5 | $0.50 | $0.80 | $0.88 |
| 10s | none | 10 | $1.00 | $1.60 | $1.76 |
| 15s | none | 15 | $1.50 | $2.40 | $2.64 |
| 10s | 5s | 15 | $1.50 | $2.40 | $2.64 |
Reference clips are measured after the job runs, so the figure shown before you submit is an estimate and the final charge reflects the real counted seconds.
1) Attach your references — Add images that define the subject and, if movement matters, clips that define it. Minimax H3 Reference to Video needs at least one of the two.
2) Write the brief — Describe the action, camera work, lighting, and mood.
3) Say how the references relate — Name which one supplies the subject and which supplies the motion. Minimax H3 Reference to Video follows an explicit relationship far better than an implied one.
4) Add reference audio (optional) — Only alongside an image or video reference in Minimax H3 Reference to Video.
5) Pick the aspect ratio — 16:9 widescreen, 9:16 vertical, 1:1 square, 21:9 wide cinematic.
6) Choose resolution and length — Start at 768p and a short duration while testing, then switch to 2k and extend toward 15 seconds once Minimax H3 Reference to Video is behaving.
7) Generate and refine — Change one reference or clause at a time so you can attribute the difference in the Minimax H3 Reference to Video output.
Genera da tag testuali brani con voce e testi lunghi fino a 4 minuti.
Image-to-video premium con la massima fedeltà visiva e il movimento più realistico della famiglia Kling V3.0.
Trasforma un ritratto e un video di riferimento in un'animazione espressiva guidata da un prompt di testo richiesto.
Crea un video di sei secondi da un prompt testuale richiesto con Hailuo 02 Pro ed espansione del prompt opzionale.
Crea un video da un prompt e controlla LoRA, risoluzione, proporzioni, fotogrammi, FPS, passaggi e seed.
Editing video guidato dal prompt a $0.126 per secondo di output.
Minimax H3 Reference to Video genera un video 768p o 2K da una richiesta scritta più il supporto di riferimento fornito. È progettato per i lavori in cui un soggetto deve rimanere riconoscibile in tutte le inquadrature, ad esempio un personaggio ricorrente, un prodotto o l'aspetto di un marchio. Alleghi almeno un'immagine o un video di riferimento, descrivi la scena e il modello decide come dovrebbero comportarsi tali riferimenti sullo schermo.
Puoi allegare fino a 9 immagini di riferimento, fino a 3 video di riferimento e fino a 3 file audio di riferimento. Le immagini guidano l'identità, lo stile e la composizione, mentre i video guidano il movimento, il ritmo e il comportamento della fotocamera in Minimax H3 Reference to Video. L'audio non può essere inviato da solo; deve accompagnare un'immagine o un video di riferimento.
L'immagine sul video blocca il primo fotogramma letterale della clip, quindi la composizione di apertura è fissa. Minimax H3 Reference to Video tratta invece i tuoi contenuti multimediali come una guida, lasciando l'inquadratura e il movimento della fotocamera più liberi pur mantenendo coerente il soggetto. Sceglilo quando ti interessa chi o cosa appare più che l'esatto fotogramma di apertura.
La risoluzione di uscita è selezionabile come "768p", "2k" , con durata selezionabile da 4 a 15 secondi in secondi interi. Minimax H3 Reference to Video supporta sei proporzioni: 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16, quindi i risultati widescreen, quadrati e verticali provengono tutti dallo stesso modello. Controllare il pannello dei parametri in questa pagina per i valori attualmente esposti.
La richiesta accetta da 1 a 7000 caratteri e affinché la richiesta possa essere eseguita è necessario che sia presente almeno un'immagine o un video di riferimento. Il numero massimo di riferimenti è di 9 immagini, 3 video e 3 file audio. I limiti possono variare in base alla modalità o alle impostazioni del provider, quindi verificali sul pannello live prima di aggirarli.
Dichiara esplicitamente la relazione tra i tuoi riferimenti: quale è il soggetto e quale fornisce il movimento. Minimax H3 Reference to Video segue una relazione denominata molto meglio di una implicita e i riferimenti contrastanti tendono a mediarsi a vicenda. Descrivi l'azione visibile e il comportamento della telecamera piuttosto che parole astratte sull'umore.
SÌ. Crea il prototipo nell'interfaccia utente Web RunComfy AI Playground finché i riferimenti, il prompt, la risoluzione e la durata non sono corretti, quindi chiama lo stesso modello tramite l'API RunComfy con parametri identici. Ciò fa sì che Minimax H3 Reference to Video si comporti allo stesso modo tra l'esplorazione manuale e i lavori automatizzati nella tua pipeline.
Le generazioni consumano usd o crediti dal tuo saldo RunComfy a $ 0,10 per secondo conteggiato per 768p e $ 0,16 per secondo conteggiato per 2K . I secondi conteggiati corrispondono alla clip finita più la durata combinata di tutti i video di riferimento allegati, quindi un output 768p di 10 secondi con una clip di riferimento di 5 secondi fattura 15 secondi o $ 1,50. Poiché le clip di riferimento vengono misurate dopo la corsa, la cifra mostrata prima dell'invio è una stima; per domande sulla fatturazione, contattare hi@runcomfy.com.
RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.





