在音轨开头、结尾或两端续写风格一致的新内容。
MiniMax H3 是 MiniMax 的多模态模型家族,可通过自然语言指令生成和编辑图像、视频与音频。本页面提供 MiniMax H3 Text-to-Video:将一条文字提示词转换为 5–15 秒、2K、24 FPS 的视频,并在生成画面的同时生成原生立体声音频。此工具仅接受文本;如需图像、视频或音频参考,请使用下方链接中的 H3 工作流。
| MiniMax H3 优势 | 对你的意义 |
|---|---|
| 联合生成 2K 视频与原生立体声音频 | 一次生成细节丰富的画面、对白、音效、环境声和音乐,减少单独进行放大、声音设计与同步的环节。 |
| 由语言指挥的 Omni-Reference | 在 MiniMax H3 的不同工作流中,可为图像、视频和音频分配不同作用,例如身份、产品外观、动作、镜头风格、声音或音乐,让多个来源共同引导一个连贯的结果。 |
| V2V 迁移与定向编辑 | MiniMax H3 可沿用动作或镜头语言,并在保留其余内容的同时修改指定的视觉或音频元素,让制作团队不必只能从头重新生成整个镜头。 |
| 可直接交付的时长与画幅 | 以 24 FPS 生成 5–15 秒视频,并支持六种宽高比,让开场钩子、产品亮相和多节拍场景更好地适配电影、网页、信息流、竖幅或垂直版位,减少重新剪辑和裁切。 |
9:16 的 Shorts、Reels 和 Stories,或 1:1 的信息流素材,以清晰的开场钩子和适合平台的画幅吸引受众。第一张表列出本页面 MiniMax H3 Text-to-Video 工具提供的控件。
| 参数 | 必填 | 类型 | 默认值 | 范围 / 选项 | 如何选择 |
|---|---|---|---|---|---|
prompt* | 是 (*) | String | 示例提示词 | 1–4,000 个字符 | 向 MiniMax H3 提供结构清晰的创作简报,涵盖主体、一个主要动作、镜头、环境与光线、视觉风格、音频和预期结尾。清晰的结构比用满字符限制更重要。 |
aspect_ratio | 否 | String | 16:9 | 21:9、16:9、4:3、1:1、3:4、9:16 | 根据投放渠道匹配 MiniMax H3 的输出:21:9 适合超宽银幕镜头,16:9 适合通用视频与广告,4:3 适合编辑或复古画幅,1:1 适合信息流,3:4 适合竖幅产品内容,9:16 适合社交平台垂直视频。 |
resolution | 否 | String | 2k | 2k | 此工具固定使用该值,并对应下方的 1440p 档位。当输出需要高分辨率细节且无需选择其他画质档位时,可选择 MiniMax H3。 |
duration | 否 | Integer | 5 | 5–15 秒,以 1 秒为步长 | MiniMax H3 的 5–7 秒片段适合单一动作或快速迭代,8–10 秒适合简单变化;只有当提示词明确说明开端、发展和结尾时,才使用 11–15 秒。 |
\* 必填字段。
下表概述更完整的 MiniMax H3 模型家族。首帧/尾帧模式和 Omni-Reference 模式所述的输入通过独立工作流提供,并非本 Text-to-Video 页面上的控件。
| 核心维度 | MiniMax H3 |
|---|---|
| 模型 | MiniMax-H3 |
| 输出时长 | MiniMax H3 输出 5–15 秒的视频。 |
| 输出宽高比 | 首帧/尾帧模式: 沿用输入图像的原始宽高比。<br>Text-to-Video 模式: 沿用用户所选的 21:9、16:9、4:3、1:1、3:4 或 9:16。<br>Omni-Reference 模式: 使用上述六种宽高比之一,或使用 Auto 让 MiniMax H3 决定输出宽高比。 |
| 分辨率 | MiniMax H3 支持两个已公布的档位。768p 模式(后续推出): 当宽高比介于 16:9 和 9:16 之间时,短边为 768 像素;对于更宽的输出,总分辨率约为 1 MP,例如 21:9 为 1536×672。768p 结果可升级至 1440p。<br>1440p / 2K 模式: 当宽高比介于 16:9 和 9:16 之间时,短边为 1440 像素;对于更宽的输出,总分辨率约为 3.7 MP,例如 21:9 为 2976×1248。 |
| 输出帧率 | MiniMax H3 以 24 FPS 输出。 |
| 输出音频 | 每个 MiniMax H3 结果都包含原生立体声音频。 |
| 首帧/尾帧输入 | 图像: 0、1 或 2 张;宽和高各为 256–5760 像素;宽高比介于 5:2 和 2:5(0.4–2.5)之间。未输入图像时,MiniMax H3 将以 Text-to-Video 模式运行,也就是本页面提供的工具。 |
| Omni-Reference 输入 | 图像: 最多 9 张;宽和高各为 256–5760 像素。<br>视频: 最多 3 段;每段 2–15 秒;视频总时长最多 15 秒;宽和高各为 256–5760 像素;宽高比介于 5:2 和 2:5(0.4–2.5)之间。<br>音频: 最多 3 段;每段 2–15 秒;音频总时长最多 15 秒。音频必须与图像或视频同时提供,不能作为唯一参考。<br>混合输入: 共计最多 12 个文件。未输入图像、视频或音频时,工作流将变为 Text-to-Video。 |
| 支持的输入格式 | MiniMax H3 接受以下格式:视频: H.264/AVC 或 H.265/HEVC;内嵌音频为 AAC 或 MP3。<br>图像: JPG、JPEG、PNG、WEBP、HEIC 或 HEIF。<br>音频: WAV 或 MP3。 |
| 输入大小限制 | 每段视频:50 MB;每张图像:30 MB;每个音频文件:15 MB。除各文件限制外,没有单独的媒体总量限制,但 API 请求正文上限为 64 MB;建议使用基于 URL 的媒体输入。 |
| 提示词限制 | MiniMax H3 产品指南允许最多 7,000 个字符。此 Text-to-Video 部署当前接受 1–4,000 个字符,如上方页面控件表所示。 |
本页面的 MiniMax H3 2K 视频价格为每个生成秒 $0.13 USD。
| 时长 | 每个视频的价格 |
|---|---|
| 5 秒 | $0.65 |
| 10 秒 | $1.30 |
| 15 秒 | $1.95 |
批量生成 1–4 个输出时,总价按 duration × $0.13 × output count 计算。
使用以下可复用的 MiniMax H3 提示词结构:
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
较弱的提示词
> 一则奢华腕表广告,要有电影感和动感,并配有音乐。
改进后的 MiniMax H3 提示词
> 一块拉丝钢自动腕表放在黑色火山岩上。随着秒针移动、表壳凝结水珠,一束狭窄的影棚灯光扫过蓝宝石表镜。以极端微距开始,然后缓慢环绕 30 度,最后定格于表盘。高对比度的奢华商业广告,深黑背景。音频:轻柔的机械滴答声和一次低沉的电影感脉冲;无对白。
改进后的版本为 MiniMax H3 提供了可识别的主体、具有时序的动作、独立的镜头指示、光线、画面质感、声音来源,以及可供检查的结束画面。
将这份 MiniMax H3 对比作为模型家族指南;最高分辨率和最长时长可能无法同时提供,不同 RunComfy 工作流也可能开放不同的输入、分辨率档位和音频控件。
| 模型 | 分辨率 | 最长时长 | 音频 | 突出特点 |
|---|---|---|---|---|
| MiniMax H3 | 最高 2K | 15s | 原生立体声(语音、SFX、音乐) | 通过语言关联文本、图像、视频和音频参考,用于 V2V 动作迁移和制作编辑;公开权重已有规划,但尚未发布。 |
| Hailuo 02 | 1080p | ~10s | 无 | 出色的提示词遵循能力和注重物理规律的动作表现,适合体操、舞蹈、产品运动和其他将在后期制作中加入音频的无声动作镜头。 |
| Kling 3.0 | 最高 4K | 15s | 带口型同步的原生音频 | 在多个镜头之间协调镜头变化,并支持多语言、指定说话者的对白和口型同步,适合有脚本的广告、故事板和角色驱动场景。 |
| Seedance 2.0 | 1080p | 15s | 音视频联合生成 | 将大量图像、视频和音频参考与联合视听生成、精确口型同步相结合,适合强调身份一致性的广告、品牌故事和参考素材密集的编辑。 |
| Veo 3.1 | 4K | 8s | 原生对白和音效 | 将提示词指定的对白和音效与首帧/尾帧、参考图像和场景延展控件结合,适合电影化转场和拼接式序列。 |
Hailuo 02 的上述最大值因模式而异:1080p 输出最长为 6 秒,而 10 秒输出可使用 512p 或 768p。
对于 MiniMax H3,Omni-Reference 和 V2V 功能属于相关工作流;本页面的 Text-to-Video 工具仍然仅接受提示词。
MiniMax H3 的独特之处在于这套组合:一个通用模型家族通过语言关联文本、图像、视频和音频,生成原生立体声,并在本页面以每个生成秒 $0.13 的价格达到 2K。如果希望从文字简报开始,同时为后续在相关工作流中进行参考引导的创作或编辑保留路径,请选择 MiniMax H3。根据公开信息,建议先在每个模型中运行同一份简报,再确定制作流程。
如果 MiniMax H3 不是项目的理想起点,可在 RunComfy 上比较以下专用工作流:
在音轨开头、结尾或两端续写风格一致的新内容。
使用 Kling 2.5 Turbo 根据提示词生成视频,并设置时长、宽高比和负面提示词。
根据文本生成语音并与视频同步,可选择音色、语言和语速。
用Dreamina 3.0将文字转化为高质量电影画面,让创意以视频形式精准呈现。
使用 Pika 2.2 根据文本提示词生成高质量视频。
电影感 4K 图生视频,输出每秒 $0.42。
可以。MiniMax H3 Text-to-Video 已可通过浏览器和 RunComfy API 使用,并消耗账户点数。
MiniMax H3 是 MiniMax 推出的通用多模态生成与编辑模型家族。整个任务体系涵盖文本、图像、视频和音频,但不同工作流开放的输入各不相同。当前页面提供的是仅使用提示词的 Text-to-Video 工作流。
MiniMax 将 H3 定位于广告、品牌、电商、影视、片头设计、动态海报、短篇叙事、产品与 UI 概念、游戏、虚拟角色和风格化动画。当前 Text-to-Video 工作流最适合能通过文字提示词指导的短视频概念。
在当前页面中,MiniMax H3 仅生成 2K 视频。你可以选择 5–15 秒之间的任意整数秒时长,默认值为 5 秒。此工作流不提供 768p 选项。
会。当前 Text-to-Video 工作流会随视频一起生成原生立体声音频。你可以在提示词中描述台词、环境声、音效或音乐;页面没有单独的音频开关。结果可能存在差异,因此请检查口型同步和音频时序。
不可以。当前页面是仅使用提示词的 MiniMax H3 Text-to-Video 工作流,其 API 只接受 prompt、aspect_ratio、resolution 和 duration。如需使用源媒体,请选择独立的 H3 Image-to-Video 或 Reference-to-Video 工作流。
在支持参考素材的 H3 工作流中,自然语言可以为文本、图像、视频和音频指定不同作用。例如,一个来源可以定义镜头运动,另一个定义角色,第三个定义声音。这属于模型家族能力,并不是当前页面的媒体上传功能。
不需要。RunComfy 通过浏览器和 HTTP API 提供 MiniMax H3,因此你无需自行托管或扩展模型。MiniMax 在 7 月 31 日的发布内容中提到了一项有条件的模型权重开放计划;在规划自托管前,请核实当前可用状态和许可证条款。
MiniMax H3 Text-to-Video 的 2K 输出按每生成 1 秒 $0.13 计费。5 秒视频为 $0.65,10 秒视频为 $1.30,15 秒视频为 $1.95。批量生成的费用等于按时长计算的价格乘以输出数量。
MiniMax 将 Hailuo 02 描述为更注重架构、数据和规模的一代,而 MiniMax H3 更关注任务和模态的泛化。H3 的 Text-to-Video 工作流还加入了原生立体声音频和 2K 输出。
先在 RunComfy 中测试提示词、宽高比和时长,再通过 API 调用同一个 MiniMax H3 Text-to-Video 模板,并使用 prompt(必填)、aspect_ratio、resolution(仅 2k)和 duration(5–15)字段。此工作流没有媒体上传字段。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。














