使用一张人像和一段音频生成口播数字人视频,并可通过提示词引导动作与表达方式。
Minimax H3 Reference to Video 可根据文本提示词和上传的参考素材生成2K视频。提供至少一张参考图片或一个参考视频,描述想要的场景,模型便会判断参考内容应如何出现在画面中并如何运动。
两类素材分工明确:图片决定事物的外观,视频决定事物的动作。Minimax H3 Reference to Video 会结合提示词理解这两类素材,而不是把任何一种素材当作不可变的固定模板。
以下是本页面中 Minimax H3 Reference to Video 可用的输入参数。
| 参数 | 必填 | 类型 | 默认值 | 范围 / 选项 | 说明 |
|---|---|---|---|---|---|
| prompt * | 是 (*) | string | 示例描述 | 1-4000个字符 | 场景、动作、运镜和视觉风格。 |
| reference_images * | 是 (*) | array(URL) | 示例参考图片 | 最多9张 | 用于引导主体、风格和构图的图片。 |
| reference_videos | 否 | array(URL) | 无 | 最多3个 | 用于引导动作、节奏或互动的视频。 |
| reference_audios | 否 | array(URL) | 无 | 最多3个 | 音频指引;还需提供图片或视频。 |
| aspect_ratio * | 是 (*) | string | 16:9 | 21:9、16:9、4:3、1:1、3:4、9:16 | 输出画面的宽高比。 |
| duration * | 是 (*) | integer | 5 | 5-15 | 视频长度,以整秒计。 |
| resolution * | 是 (*) | string | 2k | 2k | 输出分辨率规格。 |
必须至少提供一张参考图片或一个参考视频。
Minimax H3 Reference to Video 的价格为每秒$0.13。计费秒数等于输出视频的长度加上所有参考视频的合计长度。参考图片和参考音频不按时长收费。
| 输出视频 | 参考视频 | 计费秒数 | 价格 |
|---|---|---|---|
| 5秒 | 无 | 5 | $0.65 |
| 10秒 | 无 | 10 | $1.30 |
| 15秒 | 无 | 15 | $1.95 |
| 10秒 | 5秒 | 15 | $1.95 |
任务运行后才会测量参考视频的实际长度,因此提交前显示的金额仅为预估,最终费用以实际计费秒数为准。
1) 上传参考素材 — 添加用于确定主体外观的图片;如果动作很重要,再添加用于定义动作的视频。Minimax H3 Reference to Video 至少需要其中一种素材。
2) 撰写描述 — 说明动作、运镜、光线和氛围。
3) 说明参考素材之间的关系 — 明确哪份素材决定主体,哪份素材决定动作。相比需要自行推断的关系,Minimax H3 Reference to Video 更能准确遵循明确写出的对应关系。
4) 添加参考音频(选填) — 在 Minimax H3 Reference to Video 中,参考音频必须与图片或视频参考素材一同提供。
5) 选择宽高比 — 16:9适合宽屏,9:16适合竖屏,1:1适合方形画面,21:9适合电影感超宽画面。
6) 设置时长 — 测试时先生成较短的视频;确认 Minimax H3 Reference to Video 的表现符合预期后,再逐步延长至15秒。
7) 生成并调整 — 每次只修改一份参考素材或一处描述,便于判断 Minimax H3 Reference to Video 输出变化的原因。
使用一张人像和一段音频生成口播数字人视频,并可通过提示词引导动作与表达方式。
MiniMax H3:具备原生立体声的 2K 多模态 AI 视频
根据提示词生成图像,并设置 LoRA、图像尺寸、格式、推理步数、负面提示词和随机种子。
根据文字提示词生成 5 秒、10 秒或 15 秒视频,可添加源音频,并设置尺寸、镜头结构、反向提示词、随机种子、提示词扩写和生成音频。
使用 Kling 2.1 Pro 根据必填起始图片和提示词生成视频,并可设置选填结束图片、时长、宽高比、负面提示词和提示词强度。
根据文字提示词改造源视频,并支持原生音频。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。





