logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

MiniMax H3:2K 文生视频与立体声音频 | RunComfy

minimax/minimax-h3/text-to-video

MiniMax H3 Text-to-Video 可根据文字提示词生成 5–15 秒、2K、带原生立体声的视频。如需图像、视频或音频参考,请使用独立的 H3 工作流。

所生成视频的宽高比。
所生成视频的分辨率。
所生成视频的长度(以秒为单位)。
Idle
MiniMax H3 generates 2K video. The rate is $0.13 per second.

MiniMax H3 视频创作简介

MiniMax H3 是 MiniMax 的通用多模态模型家族。当前 Text-to-Video 页面可根据文字提示词生成 5–15 秒、2K、24 FPS 的视频,并同步生成立体声音频。在更广泛的模型家族中,独立的 H3 工作流可以使用图像、视频和音频作为身份、动作、镜头、声音、音效或编辑参考;当前页面不提供这些媒体输入。MiniMax 将该模型定位于广告、品牌、电商、产品设计、UI/UX、游戏和短篇音视频概念。对于开发者,RunComfy 上的 MiniMax H3 既可在浏览器中使用,也可通过 HTTP API 调用,因此无需自行托管或扩展模型。
适用于:2K 广告片与产品视频 | 提示词驱动的品牌叙事 | 短篇音视频概念

为什么选择 MiniMax H3#


MiniMax H3 是 MiniMax 的多模态模型家族,可通过自然语言指令生成和编辑图像、视频与音频。本页面提供 MiniMax H3 Text-to-Video:将一条文字提示词转换为 5–15 秒、2K、24 FPS 的视频,并在生成画面的同时生成原生立体声音频。此工具仅接受文本;如需图像、视频或音频参考,请使用下方链接中的 H3 工作流。


MiniMax H3 优势对你的意义
联合生成 2K 视频与原生立体声音频一次生成细节丰富的画面、对白、音效、环境声和音乐,减少单独进行放大、声音设计与同步的环节。
由语言指挥的 Omni-Reference在 MiniMax H3 的不同工作流中,可为图像、视频和音频分配不同作用,例如身份、产品外观、动作、镜头风格、声音或音乐,让多个来源共同引导一个连贯的结果。
V2V 迁移与定向编辑MiniMax H3 可沿用动作或镜头语言,并在保留其余内容的同时修改指定的视觉或音频元素,让制作团队不必只能从头重新生成整个镜头。
可直接交付的时长与画幅以 24 FPS 生成 5–15 秒视频,并支持六种宽高比,让开场钩子、产品亮相和多节拍场景更好地适配电影、网页、信息流、竖幅或垂直版位,减少重新剪辑和裁切。

最佳使用场景#


  • 广告与产品发布: 使用 MiniMax H3 制作主视觉镜头、产品亮相、广告概念和短片,在一个流程中统筹镜头调度与声音设计。
  • 社交媒体内容: 使用 MiniMax H3 制作 9:16 的 Shorts、Reels 和 Stories,或 1:1 的信息流素材,以清晰的开场钩子和适合平台的画幅吸引受众。
  • 影视与商业预演: 使用 MiniMax H3 测试镜头运动、灯光方案、动作节拍、场景转场或临时配乐,再决定是否投入正式制作。
  • 品牌与风格化叙事: 使用 MiniMax H3 探索片头、动态海报、角色片段和图形化风格,将文字构想转化为精致的视听内容。

工作原理#


  1. 描述镜头: 告诉 MiniMax H3 画面中出现什么、内容如何随时间变化、镜头怎样运动、场景应呈现何种视觉效果,以及应该听到什么。
  2. 选择交付格式: 选择宽高比和 5–15 秒时长。MiniMax H3 的分辨率固定为 2K,因此无需配置画质档位。
  3. 生成并优化: 模型同时生成视频和立体声音频。检查动作、文字、人脸、口型同步和声音时序,然后每次只修改一项指令。

参数#


第一张表列出本页面 MiniMax H3 Text-to-Video 工具提供的控件。


参数必填类型默认值范围 / 选项如何选择
prompt*是 (*)String示例提示词1–4,000 个字符向 MiniMax H3 提供结构清晰的创作简报,涵盖主体、一个主要动作、镜头、环境与光线、视觉风格、音频和预期结尾。清晰的结构比用满字符限制更重要。
aspect_ratio否String16:921:9、16:9、4:3、1:1、3:4、9:16根据投放渠道匹配 MiniMax H3 的输出:21:9 适合超宽银幕镜头,16:9 适合通用视频与广告,4:3 适合编辑或复古画幅,1:1 适合信息流,3:4 适合竖幅产品内容,9:16 适合社交平台垂直视频。
resolution否String2k2k此工具固定使用该值,并对应下方的 1440p 档位。当输出需要高分辨率细节且无需选择其他画质档位时,可选择 MiniMax H3。
duration否Integer55–15 秒,以 1 秒为步长MiniMax H3 的 5–7 秒片段适合单一动作或快速迭代,8–10 秒适合简单变化;只有当提示词明确说明开端、发展和结尾时,才使用 11–15 秒。

\* 必填字段。


下表概述更完整的 MiniMax H3 模型家族。首帧/尾帧模式和 Omni-Reference 模式所述的输入通过独立工作流提供,并非本 Text-to-Video 页面上的控件。


核心维度MiniMax H3
模型MiniMax-H3
输出时长MiniMax H3 输出 5–15 秒的视频。
输出宽高比首帧/尾帧模式: 沿用输入图像的原始宽高比。<br>Text-to-Video 模式: 沿用用户所选的 21:9、16:9、4:3、1:1、3:4 或 9:16。<br>Omni-Reference 模式: 使用上述六种宽高比之一,或使用 Auto 让 MiniMax H3 决定输出宽高比。
分辨率MiniMax H3 支持两个已公布的档位。768p 模式(后续推出): 当宽高比介于 16:9 和 9:16 之间时,短边为 768 像素;对于更宽的输出,总分辨率约为 1 MP,例如 21:9 为 1536×672。768p 结果可升级至 1440p。<br>1440p / 2K 模式: 当宽高比介于 16:9 和 9:16 之间时,短边为 1440 像素;对于更宽的输出,总分辨率约为 3.7 MP,例如 21:9 为 2976×1248。
输出帧率MiniMax H3 以 24 FPS 输出。
输出音频每个 MiniMax H3 结果都包含原生立体声音频。
首帧/尾帧输入图像: 0、1 或 2 张;宽和高各为 256–5760 像素;宽高比介于 5:2 和 2:5(0.4–2.5)之间。未输入图像时,MiniMax H3 将以 Text-to-Video 模式运行,也就是本页面提供的工具。
Omni-Reference 输入图像: 最多 9 张;宽和高各为 256–5760 像素。<br>视频: 最多 3 段;每段 2–15 秒;视频总时长最多 15 秒;宽和高各为 256–5760 像素;宽高比介于 5:2 和 2:5(0.4–2.5)之间。<br>音频: 最多 3 段;每段 2–15 秒;音频总时长最多 15 秒。音频必须与图像或视频同时提供,不能作为唯一参考。<br>混合输入: 共计最多 12 个文件。未输入图像、视频或音频时,工作流将变为 Text-to-Video。
支持的输入格式MiniMax H3 接受以下格式:视频: H.264/AVC 或 H.265/HEVC;内嵌音频为 AAC 或 MP3。<br>图像: JPG、JPEG、PNG、WEBP、HEIC 或 HEIF。<br>音频: WAV 或 MP3。
输入大小限制每段视频:50 MB;每张图像:30 MB;每个音频文件:15 MB。除各文件限制外,没有单独的媒体总量限制,但 API 请求正文上限为 64 MB;建议使用基于 URL 的媒体输入。
提示词限制MiniMax H3 产品指南允许最多 7,000 个字符。此 Text-to-Video 部署当前接受 1–4,000 个字符,如上方页面控件表所示。

定价#


本页面的 MiniMax H3 2K 视频价格为每个生成秒 $0.13 USD。


时长每个视频的价格
5 秒$0.65
10 秒$1.30
15 秒$1.95

批量生成 1–4 个输出时,总价按 duration × $0.13 × output count 计算。


提示词技巧与示例#


使用以下可复用的 MiniMax H3 提示词结构:


[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]


  • 分开描述运动: 分别描述主体运动和镜头运动。
  • 呈现顺序: 当片段包含多个节拍时,使用“开始时”“然后”和“结尾定格于”等表述。
  • 说明声音来源: 告诉 MiniMax H3 谁在说话、每种声音由什么产生、环境声是什么,以及音乐应占主导还是保持克制。
  • 减少互相竞争的想法: 一个主要主体、一个核心动作和一种连贯风格更便于 MiniMax H3 遵循。

较弱的提示词


> 一则奢华腕表广告,要有电影感和动感,并配有音乐。


改进后的 MiniMax H3 提示词


> 一块拉丝钢自动腕表放在黑色火山岩上。随着秒针移动、表壳凝结水珠,一束狭窄的影棚灯光扫过蓝宝石表镜。以极端微距开始,然后缓慢环绕 30 度,最后定格于表盘。高对比度的奢华商业广告,深黑背景。音频:轻柔的机械滴答声和一次低沉的电影感脉冲;无对白。


改进后的版本为 MiniMax H3 提供了可识别的主体、具有时序的动作、独立的镜头指示、光线、画面质感、声音来源,以及可供检查的结束画面。


MiniMax H3 横向对比#


将这份 MiniMax H3 对比作为模型家族指南;最高分辨率和最长时长可能无法同时提供,不同 RunComfy 工作流也可能开放不同的输入、分辨率档位和音频控件。


模型分辨率最长时长音频突出特点
MiniMax H3最高 2K15s原生立体声(语音、SFX、音乐)通过语言关联文本、图像、视频和音频参考,用于 V2V 动作迁移和制作编辑;公开权重已有规划,但尚未发布。
Hailuo 021080p~10s无出色的提示词遵循能力和注重物理规律的动作表现,适合体操、舞蹈、产品运动和其他将在后期制作中加入音频的无声动作镜头。
Kling 3.0最高 4K15s带口型同步的原生音频在多个镜头之间协调镜头变化,并支持多语言、指定说话者的对白和口型同步,适合有脚本的广告、故事板和角色驱动场景。
Seedance 2.01080p15s音视频联合生成将大量图像、视频和音频参考与联合视听生成、精确口型同步相结合,适合强调身份一致性的广告、品牌故事和参考素材密集的编辑。
Veo 3.14K8s原生对白和音效将提示词指定的对白和音效与首帧/尾帧、参考图像和场景延展控件结合,适合电影化转场和拼接式序列。

Hailuo 02 的上述最大值因模式而异:1080p 输出最长为 6 秒,而 10 秒输出可使用 512p 或 768p。


对于 MiniMax H3,Omni-Reference 和 V2V 功能属于相关工作流;本页面的 Text-to-Video 工具仍然仅接受提示词。


MiniMax H3 的独特之处在于这套组合:一个通用模型家族通过语言关联文本、图像、视频和音频,生成原生立体声,并在本页面以每个生成秒 $0.13 的价格达到 2K。如果希望从文字简报开始,同时为后续在相关工作流中进行参考引导的创作或编辑保留路径,请选择 MiniMax H3。根据公开信息,建议先在每个模型中运行同一份简报,再确定制作流程。


更多可尝试的模型#


如果 MiniMax H3 不是项目的理想起点,可在 RunComfy 上比较以下专用工作流:


  • MiniMax H3 Image-to-Video: 从一张图像开始,并可选择引导尾帧,适合需要固定构图、身份或产品外观的场景。
  • MiniMax H3 Reference-to-Video: 组合图像以及可选的视频和音频,在需要沿用动作、镜头风格、声音、音乐或其他源素材细节时使用。
  • Hailuo 02 Image-to-Video: 如果需要专注于图像动画的工作流,可尝试 MiniMax 的早期一代模型。
  • Hailuo 2.3 Pro: 以稳定、符合物理规律的动作、细腻的面部表情和自然光照将静态图像制作为 1080p 动画,适合精致的产品、肖像和角色镜头。
  • Kling 3.0: 通过可选尾帧、元素参考、定时镜头提示词和同步音频,让起始图像生成可控的品牌与角色序列。
  • Seedance 2.0 Pro: 混合最多九张图像、三段视频和三段音频,使身份、镜头语言以及同步的语音、音效和音乐在 4–15 秒片段中保持一致。

官方资源#


  • MiniMax H3 发布动态
  • MiniMax 官方网站

相关模型

ace-step/audio-outpaint

在音轨开头、结尾或两端续写风格一致的新内容。

kling-2-5/turbo/text-to-video

使用 Kling 2.5 Turbo 根据提示词生成视频,并设置时长、宽高比和负面提示词。

kling/lipsync/text-to-video

根据文本生成语音并与视频同步,可选择音色、语言和语速。

dreamina-3-0/pro/text-to-video

用Dreamina 3.0将文字转化为高质量电影画面,让创意以视频形式精准呈现。

pika-2-2/text-to-video

使用 Pika 2.2 根据文本提示词生成高质量视频。

kling-video-o3/4K/image-to-video

电影感 4K 图生视频,输出每秒 $0.42。

常见问题

MiniMax H3 现在可以在 RunComfy 上使用吗?

可以。MiniMax H3 Text-to-Video 已可通过浏览器和 RunComfy API 使用,并消耗账户点数。

MiniMax H3 是什么?

MiniMax H3 是 MiniMax 推出的通用多模态生成与编辑模型家族。整个任务体系涵盖文本、图像、视频和音频,但不同工作流开放的输入各不相同。当前页面提供的是仅使用提示词的 Text-to-Video 工作流。

MiniMax H3 可以用于哪些场景?

MiniMax 将 H3 定位于广告、品牌、电商、影视、片头设计、动态海报、短篇叙事、产品与 UI 概念、游戏、虚拟角色和风格化动画。当前 Text-to-Video 工作流最适合能通过文字提示词指导的短视频概念。

MiniMax H3 Text-to-Video 支持什么分辨率和时长?

在当前页面中,MiniMax H3 仅生成 2K 视频。你可以选择 5–15 秒之间的任意整数秒时长,默认值为 5 秒。此工作流不提供 768p 选项。

MiniMax H3 会生成音频吗?

会。当前 Text-to-Video 工作流会随视频一起生成原生立体声音频。你可以在提示词中描述台词、环境声、音效或音乐;页面没有单独的音频开关。结果可能存在差异,因此请检查口型同步和音频时序。

当前 MiniMax H3 页面可以使用图像、视频或音频参考吗?

不可以。当前页面是仅使用提示词的 MiniMax H3 Text-to-Video 工作流,其 API 只接受 prompt、aspect_ratio、resolution 和 duration。如需使用源媒体,请选择独立的 H3 Image-to-Video 或 Reference-to-Video 工作流。

多模态上下文对 MiniMax H3 模型家族意味着什么?

在支持参考素材的 H3 工作流中,自然语言可以为文本、图像、视频和音频指定不同作用。例如,一个来源可以定义镜头运动,另一个定义角色,第三个定义声音。这属于模型家族能力,并不是当前页面的媒体上传功能。

使用 MiniMax H3 需要自行托管吗?

不需要。RunComfy 通过浏览器和 HTTP API 提供 MiniMax H3,因此你无需自行托管或扩展模型。MiniMax 在 7 月 31 日的发布内容中提到了一项有条件的模型权重开放计划;在规划自托管前,请核实当前可用状态和许可证条款。

MiniMax H3 Text-to-Video 的价格是多少?

MiniMax H3 Text-to-Video 的 2K 输出按每生成 1 秒 $0.13 计费。5 秒视频为 $0.65,10 秒视频为 $1.30,15 秒视频为 $1.95。批量生成的费用等于按时长计算的价格乘以输出数量。

MiniMax H3 与 Hailuo 02 有什么不同?

MiniMax 将 Hailuo 02 描述为更注重架构、数据和规模的一代,而 MiniMax H3 更关注任务和模态的泛化。H3 的 Text-to-Video 工作流还加入了原生立体声音频和 2K 输出。

如何从浏览器测试 MiniMax H3 过渡到 API 集成?

先在 RunComfy 中测试提示词、宽高比和时长,再通过 API 调用同一个 MiniMax H3 Text-to-Video 模板,并使用 prompt(必填)、aspect_ratio、resolution(仅 2k)和 duration(5–15)字段。此工作流没有媒体上传字段。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

MiniMax H3 示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...