logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Minimax H3 Reference to Video:参考素材引导的2K视频生成模型与API | RunComfy

minimax/minimax-h3/reference-to-video

Minimax H3 Reference to Video 可结合参考图片、视频、音频与提示词,生成5-15秒的2K视频,并保持主体与动作的一致性。

描述场景、互动、动作和视觉风格,长度为1-4000个字符。
Image 1
用于引导主体、产品、风格或构图的参考图片。最多9张。必须至少提供一张参考图片或一个参考视频。
用于引导动作、节奏或互动的参考视频。最多3个。必须至少提供一张参考图片或一个参考视频。
选填的参考音频,最多3个。不能在没有图片或视频参考素材的情况下单独提供音频。
输出视频的宽高比。
生成视频的长度,以秒为单位。
输出视频的分辨率。
Idle
The rate per counted second (generated video duration plus the combined duration of reference videos) is $0.13.

Minimax H3 Reference to Video 简介

MiniMax 的 Minimax H3 Reference to Video 可根据文字描述和用户提供的参考素材,制作5-15秒的2K视频。无需另行寻找外形相似的演员、制作风格板或手动匹配动作,模型会直接理解参考素材,让品牌团队、广告公司、预演人员和游戏工作室能够在不同镜头中保持角色、产品或镜头语言的一致。开发者既可在 RunComfy 浏览器页面中使用 Minimax H3 Reference to Video,也可通过 HTTP API 调用,无需自行托管或扩展模型。
适合:保持角色与产品镜头一致 | 匹配参考视频的动作 | 广告活动概念片

MiniMax / MiniMax H3 Reference To Video#


Minimax H3 Reference to Video 可根据文本提示词和上传的参考素材生成2K视频。提供至少一张参考图片或一个参考视频,描述想要的场景,模型便会判断参考内容应如何出现在画面中并如何运动。


两类素材分工明确:图片决定事物的外观,视频决定事物的动作。Minimax H3 Reference to Video 会结合提示词理解这两类素材,而不是把任何一种素材当作不可变的固定模板。


核心亮点#


  • 参考素材引导生成: Minimax H3 Reference to Video 不只依赖提示词,还会以真实素材作为生成条件,因此在不同镜头中也能保持主体特征一致。

  • 最多9张参考图片: 可让面部、产品细节或视觉风格在 Minimax H3 Reference to Video 生成的一系列镜头中保持一致。

  • 最多3个参考视频: 当动作或运镜比外观更重要时,可向 Minimax H3 Reference to Video 提供现有视频作为指引。

  • 选填参考音频: 最多可提供3个音频文件,但不能单独使用音频生成。

  • 固定2K输出: 以2k规格渲染,在大尺寸画面中也能更好地保留细节。

  • 六种宽高比: 支持21:9、16:9、4:3、1:1、3:4和9:16,覆盖宽屏、方形和竖屏成片。

  • 时长可调: 视频时长可在5-15秒之间按整秒设置。

参数#


以下是本页面中 Minimax H3 Reference to Video 可用的输入参数。


参数必填类型默认值范围 / 选项说明
prompt *是 (*)string示例描述1-4000个字符场景、动作、运镜和视觉风格。
reference_images *是 (*)array(URL)示例参考图片最多9张用于引导主体、风格和构图的图片。
reference_videos否array(URL)无最多3个用于引导动作、节奏或互动的视频。
reference_audios否array(URL)无最多3个音频指引;还需提供图片或视频。
aspect_ratio *是 (*)string16:921:9、16:9、4:3、1:1、3:4、9:16输出画面的宽高比。
duration *是 (*)integer55-15视频长度,以整秒计。
resolution *是 (*)string2k2k输出分辨率规格。

必须至少提供一张参考图片或一个参考视频。


价格#


Minimax H3 Reference to Video 的价格为每秒$0.13。计费秒数等于输出视频的长度加上所有参考视频的合计长度。参考图片和参考音频不按时长收费。


输出视频参考视频计费秒数价格
5秒无5$0.65
10秒无10$1.30
15秒无15$1.95
10秒5秒15$1.95

任务运行后才会测量参考视频的实际长度,因此提交前显示的金额仅为预估,最终费用以实际计费秒数为准。


使用方法#


1) 上传参考素材 — 添加用于确定主体外观的图片;如果动作很重要,再添加用于定义动作的视频。Minimax H3 Reference to Video 至少需要其中一种素材。


2) 撰写描述 — 说明动作、运镜、光线和氛围。


3) 说明参考素材之间的关系 — 明确哪份素材决定主体,哪份素材决定动作。相比需要自行推断的关系,Minimax H3 Reference to Video 更能准确遵循明确写出的对应关系。


4) 添加参考音频(选填) — 在 Minimax H3 Reference to Video 中,参考音频必须与图片或视频参考素材一同提供。


5) 选择宽高比 — 16:9适合宽屏,9:16适合竖屏,1:1适合方形画面,21:9适合电影感超宽画面。


6) 设置时长 — 测试时先生成较短的视频;确认 Minimax H3 Reference to Video 的表现符合预期后,再逐步延长至15秒。


7) 生成并调整 — 每次只修改一份参考素材或一处描述,便于判断 Minimax H3 Reference to Video 输出变化的原因。

相关模型

ai-avatar/v2/standard

使用一张人像和一段音频生成口播数字人视频,并可通过提示词引导动作与表达方式。

minimax-h3/text-to-video

MiniMax H3:具备原生立体声的 2K 多模态 AI 视频

wan-2-2/lora/text-to-image

根据提示词生成图像,并设置 LoRA、图像尺寸、格式、推理步数、负面提示词和随机种子。

wan-2-6/text-to-video

根据文字提示词生成 5 秒、10 秒或 15 秒视频,可添加源音频,并设置尺寸、镜头结构、反向提示词、随机种子、提示词扩写和生成音频。

kling-2-1/pro/image-to-video

使用 Kling 2.1 Pro 根据必填起始图片和提示词生成视频,并可设置选填结束图片、时长、宽高比、负面提示词和提示词强度。

seedance-2.0-mini/video-to-video

根据文字提示词改造源视频,并支持原生音频。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Minimax H3 Reference to Video 示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...