以 Veo 3.1 將文字轉化為電影級影片,結合精準控制與真實音效,激發創意靈感。
MiniMax H3 是 MiniMax 的多模態模型家族,可透過自然語言指令生成及編輯圖像、影片與音訊。本頁面提供 MiniMax H3 Text-to-Video:將一則文字提示詞轉換為 5–15 秒、2K、24 FPS 的影片,並在生成畫面的同時產生原生立體聲音訊。此工具僅接受文字;如需圖像、影片或音訊參考,請使用下方連結中的 H3 工作流程。
| MiniMax H3 優勢 | 對你的意義 |
|---|---|
| 聯合生成 2K 影片與原生立體聲音訊 | 一次生成細節豐富的畫面、對白、音效、環境聲與音樂,減少分別執行放大、聲音設計與同步的環節。 |
| 由語言指揮的 Omni-Reference | 在 MiniMax H3 的不同工作流程中,可為圖像、影片和音訊分配不同作用,例如身分、產品外觀、動作、鏡頭風格、聲音或音樂,讓多個來源共同引導一個連貫的結果。 |
| V2V 轉移與定向編輯 | MiniMax H3 可沿用動作或鏡頭語言,並在保留其餘內容的同時修改指定的視覺或音訊元素,讓製作團隊不必只能從頭重新生成整個鏡頭。 |
| 可直接交付的時長與畫幅 | 以 24 FPS 生成 5–15 秒影片,並支援六種畫面比例,讓開場鉤子、產品亮相和多節拍場景更能配合電影、網頁、動態消息、直幅或垂直版位,減少重新剪輯和裁切。 |
9:16 的 Shorts、Reels 和 Stories,或 1:1 的動態消息素材,以清楚的開場鉤子和適合平台的畫幅吸引觀眾。第一張表列出本頁面 MiniMax H3 Text-to-Video 工具提供的控制項。
| 參數 | 必填 | 類型 | 預設值 | 範圍 / 選項 | 如何選擇 |
|---|---|---|---|---|---|
prompt* | 是 (*) | String | 範例提示詞 | 1–4,000 個字元 | 向 MiniMax H3 提供結構清楚的創作簡報,涵蓋主體、一個主要動作、鏡頭、環境與光線、視覺風格、音訊和預期結尾。清楚的結構比用滿字元限制更重要。 |
aspect_ratio | 否 | String | 16:9 | 21:9、16:9、4:3、1:1、3:4、9:16 | 根據投放管道配合 MiniMax H3 的輸出:21:9 適合超寬銀幕鏡頭,16:9 適合一般影片與廣告,4:3 適合編輯或復古畫幅,1:1 適合動態消息,3:4 適合直幅產品內容,9:16 適合社群平台垂直影片。 |
resolution | 否 | String | 2k | 2k | 此工具固定使用該值,並對應下方的 1440p 級別。當輸出需要高解析度細節且無需選擇其他畫質級別時,可選擇 MiniMax H3。 |
duration | 否 | Integer | 5 | 5–15 秒,以 1 秒為間隔 | MiniMax H3 的 5–7 秒片段適合單一動作或快速迭代,8–10 秒適合簡單變化;只有當提示詞清楚說明開端、發展和結尾時,才使用 11–15 秒。 |
\* 必填欄位。
下表概述更完整的 MiniMax H3 模型家族。首幀/尾幀模式和 Omni-Reference 模式所述的輸入透過獨立工作流程提供,並非本 Text-to-Video 頁面上的控制項。
| 核心面向 | MiniMax H3 |
|---|---|
| 模型 | MiniMax-H3 |
| 輸出時長 | MiniMax H3 輸出 5–15 秒的影片。 |
| 輸出畫面比例 | 首幀/尾幀模式: 沿用輸入圖像的原始畫面比例。<br>Text-to-Video 模式: 沿用使用者所選的 21:9、16:9、4:3、1:1、3:4 或 9:16。<br>Omni-Reference 模式: 使用上述六種畫面比例之一,或使用 Auto 讓 MiniMax H3 決定輸出比例。 |
| 解析度 | MiniMax H3 支援兩個已公布的級別。768p 模式(稍後推出): 當畫面比例介於 16:9 和 9:16 之間時,短邊為 768 像素;對於更寬的輸出,總解析度約為 1 MP,例如 21:9 為 1536×672。768p 結果可升級至 1440p。<br>1440p / 2K 模式: 當畫面比例介於 16:9 和 9:16 之間時,短邊為 1440 像素;對於更寬的輸出,總解析度約為 3.7 MP,例如 21:9 為 2976×1248。 |
| 輸出幀率 | MiniMax H3 以 24 FPS 輸出。 |
| 輸出音訊 | 每個 MiniMax H3 結果都包含原生立體聲音訊。 |
| 首幀/尾幀輸入 | 圖像: 0、1 或 2 張;寬和高各為 256–5760 像素;畫面比例介於 5:2 和 2:5(0.4–2.5)之間。未輸入圖像時,MiniMax H3 將以 Text-to-Video 模式運作,也就是本頁面提供的工具。 |
| Omni-Reference 輸入 | 圖像: 最多 9 張;寬和高各為 256–5760 像素。<br>影片: 最多 3 段;每段 2–15 秒;影片總時長最多 15 秒;寬和高各為 256–5760 像素;畫面比例介於 5:2 和 2:5(0.4–2.5)之間。<br>音訊: 最多 3 段;每段 2–15 秒;音訊總時長最多 15 秒。音訊必須與圖像或影片同時提供,不能作為唯一參考。<br>混合輸入: 共計最多 12 個檔案。未輸入圖像、影片或音訊時,工作流程將變為 Text-to-Video。 |
| 支援的輸入格式 | MiniMax H3 接受以下格式:影片: H.264/AVC 或 H.265/HEVC;內嵌音訊為 AAC 或 MP3。<br>圖像: JPG、JPEG、PNG、WEBP、HEIC 或 HEIF。<br>音訊: WAV 或 MP3。 |
| 輸入大小限制 | 每段影片:50 MB;每張圖像:30 MB;每個音訊檔案:15 MB。除各檔案限制外,沒有單獨的媒體總量限制,但 API 請求本文上限為 64 MB;建議使用以 URL 為基礎的媒體輸入。 |
| 提示詞限制 | MiniMax H3 產品指南允許最多 7,000 個字元。此 Text-to-Video 部署目前接受 1–4,000 個字元,如上方頁面控制項表所示。 |
本頁面的 MiniMax H3 2K 影片價格為每個生成秒 $0.13 USD。
| 時長 | 每支影片的價格 |
|---|---|
| 5 秒 | $0.65 |
| 10 秒 | $1.30 |
| 15 秒 | $1.95 |
批次生成 1–4 個輸出時,總價按 duration × $0.13 × output count 計算。
使用以下可重複使用的 MiniMax H3 提示詞結構:
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
較弱的提示詞
> 一則奢華腕錶廣告,要有電影感和動感,並配有音樂。
改進後的 MiniMax H3 提示詞
> 一只拉絲鋼自動腕錶放在黑色火山岩上。隨著秒針移動、錶殼凝結水珠,一束狹窄的攝影棚燈光掃過藍寶石錶鏡。以極端微距開始,然後緩慢環繞 30 度,最後定格於錶盤。高對比度的奢華商業廣告,深黑背景。音訊:輕柔的機械滴答聲和一次低沉的電影感脈衝;無對白。
改進後的版本為 MiniMax H3 提供了可辨識的主體、具有時序的動作、獨立的鏡頭指示、光線、畫面質感、聲音來源,以及可供檢查的結束畫面。
將這份 MiniMax H3 比較作為模型家族指南;最高解析度和最長時長可能無法同時提供,不同 RunComfy 工作流程也可能開放不同的輸入、解析度級別和音訊控制項。
| 模型 | 解析度 | 最長時長 | 音訊 | 突出特點 |
|---|---|---|---|---|
| MiniMax H3 | 最高 2K | 15s | 原生立體聲(語音、SFX、音樂) | 透過語言關聯文字、圖像、影片和音訊參考,用於 V2V 動作轉移和製作編輯;公開權重已有規劃,但尚未發布。 |
| Hailuo 02 | 1080p | ~10s | 無 | 出色的提示詞遵循能力和注重物理規律的動作表現,適合體操、舞蹈、產品運動和其他將在後期製作中加入音訊的無聲動作鏡頭。 |
| Kling 3.0 | 最高 4K | 15s | 帶唇形同步的原生音訊 | 在多個鏡頭之間協調鏡頭變化,並支援多語言、指定說話者的對白和唇形同步,適合有腳本的廣告、故事板和角色驅動場景。 |
| Seedance 2.0 | 1080p | 15s | 音訊與影片聯合生成 | 將大量圖像、影片和音訊參考與聯合視聽生成、精確唇形同步相結合,適合強調身分一致性的廣告、品牌故事和參考素材密集的編輯。 |
| Veo 3.1 | 4K | 8s | 原生對白和音效 | 將提示詞指定的對白和音效與首幀/尾幀、參考圖像和場景延展控制項結合,適合電影化轉場和拼接式序列。 |
Hailuo 02 的上述最大值因模式而異:1080p 輸出最長為 6 秒,而 10 秒輸出可使用 512p 或 768p。
對於 MiniMax H3,Omni-Reference 和 V2V 功能屬於相關工作流程;本頁面的 Text-to-Video 工具仍然僅接受提示詞。
MiniMax H3 的獨特之處在於這套組合:一個通用模型家族透過語言關聯文字、圖像、影片和音訊,生成原生立體聲,並在本頁面以每個生成秒 $0.13 的價格達到 2K。如果希望從文字簡報開始,同時為後續在相關工作流程中進行參考引導的創作或編輯保留路徑,請選擇 MiniMax H3。根據公開資訊,建議先在每個模型中執行同一份簡報,再確定製作流程。
如果 MiniMax H3 不是專案的理想起點,可在 RunComfy 上比較以下專用工作流程:
以 Veo 3.1 將文字轉化為電影級影片,結合精準控制與真實音效,激發創意靈感。
調整風格光影、增減物件,靈活創作高品質影片畫面
使用 Seedance 1.0 依提示詞生成影片,並設定解析度、長寬比與時長。
將起始圖片製作成帶有原生音訊的電影感短片。
根據必填提示詞讓首格圖片動起來,並可透過可選的尾格圖片控制影片結尾。
透過文字指令重新詮釋現有影片,同時盡量保留來源影片的動作與整體構圖。
可以。MiniMax H3 Text-to-Video 已可透過瀏覽器和 RunComfy API 使用,並消耗帳戶點數。
MiniMax H3 是 MiniMax 推出的通用多模態生成與編輯模型家族。整體任務設計涵蓋文字、圖像、影片和音訊,但不同工作流程開放的輸入各不相同。目前頁面提供的是僅使用提示詞的 Text-to-Video 工作流程。
MiniMax 將 H3 定位於廣告、品牌、電子商務、影視、片頭設計、動態海報、短篇敘事、產品與 UI 概念、遊戲、虛擬角色和風格化動畫。目前 Text-to-Video 工作流程最適合能透過文字提示詞指導的短影片概念。
在目前頁面中,MiniMax H3 僅生成 2K 影片。你可以選擇 5–15 秒之間的任意整數秒長度,預設值為 5 秒。此工作流程不提供 768p 選項。
會。目前 Text-to-Video 工作流程會隨影片一起生成原生立體聲音訊。你可以在提示詞中描述台詞、環境聲、音效或音樂;頁面沒有獨立的音訊開關。結果可能有所差異,因此請檢查對嘴同步和音訊時序。
不可以。目前頁面是僅使用提示詞的 MiniMax H3 Text-to-Video 工作流程,其 API 只接受 prompt、aspect_ratio、resolution 和 duration。如需使用來源媒體,請選擇獨立的 H3 Image-to-Video 或 Reference-to-Video 工作流程。
在支援參考素材的 H3 工作流程中,自然語言可以為文字、圖像、影片和音訊指定不同作用。例如,一個來源可以定義鏡頭運動,另一個定義角色,第三個定義聲音。這屬於模型家族能力,並不是目前頁面的媒體上傳功能。
不需要。RunComfy 透過瀏覽器和 HTTP API 提供 MiniMax H3,因此你無需自行部署或擴充模型。MiniMax 在 7 月 31 日的發布內容中提到一項有條件的模型權重開放計畫;在規劃自行部署前,請確認目前可用狀態和授權條款。
MiniMax H3 Text-to-Video 的 2K 輸出按每生成 1 秒 $0.13 計費。5 秒影片為 $0.65,10 秒影片為 $1.30,15 秒影片為 $1.95。批次生成的費用等於依長度計算的價格乘以輸出數量。
MiniMax 將 Hailuo 02 描述為更著重架構、資料和規模的一代,而 MiniMax H3 更關注任務與模態的泛化。H3 的 Text-to-Video 工作流程也加入了原生立體聲音訊和 2K 輸出。
先在 RunComfy 中測試提示詞、長寬比和長度,再透過 API 呼叫同一個 MiniMax H3 Text-to-Video 範本,並使用 prompt(必填)、aspect_ratio、resolution(僅 2k)和 duration(5–15)欄位。此工作流程沒有媒體上傳欄位。
RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。














