Оживите исходное изображение и превратите его в кинематографичный ролик с нативным звуком.
MiniMax H3 — семейство мультимодальных моделей MiniMax для генерации и редактирования изображений, видео и аудио с помощью инструкций на естественном языке. На этой странице доступен инструмент MiniMax H3 Text-to-Video: он превращает один текстовый промпт в 2K-видео длительностью 5–15 секунд с частотой 24 FPS и нативным стереозвуком, который создается вместе с изображением. Инструмент принимает только текст; если нужны референсные изображения, видео или аудио, используйте связанные рабочие процессы H3.
| Преимущество MiniMax H3 | Что оно дает пользователю |
|---|---|
| Совместная генерация 2K-видео и нативного стереозвука | Создавайте детализированное изображение, реплики, эффекты, атмосферу и музыку за один проход, сокращая отдельные этапы повышения разрешения, звукового дизайна и синхронизации. |
| Omni-Reference под управлением языка | В разных рабочих процессах MiniMax H3 изображениям, видео и аудио можно назначать разные роли — например, идентичность, внешний вид продукта, движение, стиль камеры, голос или музыку, — чтобы несколько источников направляли единый связный результат. |
| Перенос V2V и точечное редактирование | MiniMax H3 может переносить движение или язык камеры и изменять выбранные визуальные или звуковые элементы, сохраняя остальное. Так производственная команда может не генерировать весь кадр заново. |
| Хронометраж и кадрирование, готовые к публикации | Генерируйте ролики длительностью 5–15 секунд с частотой 24 FPS в шести соотношениях сторон, чтобы хуки, демонстрации продуктов и многосоставные сцены подходили для кино, веба, лент, портретных и вертикальных форматов с меньшим объемом повторного монтажа и кадрирования. |
9:16 или материалы для ленты в формате 1:1 с четким начальным хуком и кадрированием под платформу.В первой таблице перечислены настройки инструмента MiniMax H3 Text-to-Video, доступные на этой странице.
| Параметр | Обязательный | Тип | По умолчанию | Диапазон / варианты | Как выбрать |
|---|---|---|---|---|---|
prompt* | Да (*) | String | Пример промпта | 1–4,000 символов | Передайте MiniMax H3 структурированное задание с описанием объекта, одного основного действия, камеры, окружения и освещения, визуального стиля, звука и желаемого финала. Четкая структура важнее, чем использование всего лимита. |
aspect_ratio | Нет | String | 16:9 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Согласуйте результат MiniMax H3 с площадкой: 21:9 для сверхшироких кинематографических кадров, 16:9 для обычного видео и рекламы, 4:3 для редакционной или ретро-композиции, 1:1 для лент, 3:4 для портретных кадров продукта и 9:16 для вертикального видео в соцсетях. |
resolution | Нет | String | 2k | 2k | Для этого инструмента значение фиксировано и соответствует ступени 1440p, описанной ниже. Выбирайте MiniMax H3, когда нужны детали в высоком разрешении без выбора другой ступени качества. |
duration | Нет | Integer | 5 | 5–15 секунд с шагом 1 секунда | Используйте ролики MiniMax H3 длительностью 5–7 секунд для одного действия или быстрых итераций, 8–10 секунд для простого изменения и 11–15 секунд только тогда, когда промпт задает четкое начало, развитие и финал. |
\* Обязательное поле.
В следующей таблице приведена сводка по всему семейству моделей MiniMax H3. Входные данные для режимов первого/последнего кадра и Omni-Reference доступны в отдельных рабочих процессах, а не в настройках этой страницы Text-to-Video.
| Основной параметр | MiniMax H3 |
|---|---|
| Модель | MiniMax-H3 |
| Длительность результата | MiniMax H3 создает ролики длительностью 5–15 секунд. |
| Соотношение сторон результата | Режим первого/последнего кадра: сохраняет исходное соотношение сторон входного изображения.<br>Режим Text-to-Video: использует выбранное пользователем соотношение 21:9, 16:9, 4:3, 1:1, 3:4 или 9:16.<br>Режим Omni-Reference: использует одно из этих шести соотношений или Auto, позволяя MiniMax H3 выбрать соотношение сторон результата. |
| Разрешение | MiniMax H3 поддерживает две задокументированные ступени. Режим 768p (появится позже): для соотношений сторон от 16:9 до 9:16 короткая сторона составляет 768 пикселей; для более широкого результата общее разрешение составляет около 1 MP — например, 21:9 соответствует 1536×672. Результат 768p можно повысить до 1440p.<br>Режим 1440p / 2K: для соотношений сторон от 16:9 до 9:16 короткая сторона составляет 1440 пикселей; для более широкого результата общее разрешение составляет около 3.7 MP — например, 21:9 соответствует 2976×1248. |
| Частота кадров результата | MiniMax H3 выводит видео с частотой 24 FPS. |
| Звук результата | Каждый результат MiniMax H3 содержит нативный стереозвук. |
| Входные данные первого/последнего кадра | Изображения: 0, 1 или 2; ширина и высота — по 256–5760 пикселей; соотношение сторон — от 5:2 до 2:5 (0.4–2.5). Без входного изображения MiniMax H3 работает в режиме Text-to-Video — это инструмент, представленный на этой странице. |
| Входные данные Omni-Reference | Изображения: до 9; ширина и высота — по 256–5760 пикселей.<br>Видео: до 3; каждое длительностью 2–15 секунд; суммарная длительность видео — до 15 секунд; ширина и высота — по 256–5760 пикселей; соотношение сторон — от 5:2 до 2:5 (0.4–2.5).<br>Аудио: до 3 клипов; каждый длительностью 2–15 секунд; суммарная длительность аудио — до 15 секунд. Аудио должно сопровождать изображение или видео и не может быть единственным референсом.<br>Смешанный ввод: всего до 12 файлов. Если изображения, видео и аудио отсутствуют, рабочий процесс становится Text-to-Video. |
| Поддерживаемые входные форматы | MiniMax H3 принимает видео: H.264/AVC или H.265/HEVC; встроенное аудио: AAC или MP3.<br>Изображения: JPG, JPEG, PNG, WEBP, HEIC или HEIF.<br>Аудио: WAV или MP3. |
| Ограничения размера входных данных | Каждое видео: 50 MB; каждое изображение: 30 MB; каждый аудиофайл: 15 MB. Отдельного общего лимита для всех медиа помимо пофайловых ограничений нет, но тело API-запроса ограничено 64 MB; рекомендуется использовать медиа по URL. |
| Лимит промпта | Руководство по MiniMax H3 допускает до 7,000 символов. Текущее развертывание Text-to-Video принимает 1–4,000 символов, как указано в таблице настроек страницы выше. |
На этой странице MiniMax H3 стоит $0.13 USD за каждую сгенерированную секунду в разрешении 2K.
| Длительность | Цена за видео |
|---|---|
| 5 секунд | $0.65 |
| 10 секунд | $1.30 |
| 15 секунд | $1.95 |
Для пакета из 1–4 результатов рассчитайте общую стоимость по формуле duration × $0.13 × output count.
Используйте эту универсальную структуру промпта MiniMax H3:
[subject + defining details] + [one action over time] + [camera framing and movement] + [setting + lighting] + [visual treatment] + [dialogue / effects / ambience / music] + [ending frame or constraint]
Слабый промпт
> Реклама премиальных часов, кинематографично и динамично, с музыкой.
Улучшенный промпт для MiniMax H3
> Автоматические часы из матовой стали лежат на черном вулканическом камне. Узкий студийный луч скользит по сапфировому стеклу, секундная стрелка движется, а на корпусе собираются капли конденсата. Начать с экстремального макро, затем выполнить медленный облет на 30 градусов и закончить на циферблате. Контрастная премиальная реклама, глубокий черный фон. Аудио: тихое механическое тиканье и один низкий кинематографический импульс; без диалогов.
Улучшенная версия передает MiniMax H3 узнаваемый объект, действие с заданным временем, отдельное указание для камеры, освещение, визуальную отделку, источники звука и финальный кадр, который можно проверить.
Используйте это сравнение MiniMax H3 как ориентир по семействам моделей. Максимальное разрешение и длительность могут быть недоступны одновременно, а рабочие процессы RunComfy могут предлагать разные входные данные, ступени разрешения и настройки звука.
| Модель | Разрешение | Максимальная длительность | Аудио | Отличительная особенность |
|---|---|---|---|---|
| MiniMax H3 | До 2K | 15s | Нативное стерео (голос, SFX, музыка) | Связывает текстовые, графические, видео- и аудиореференсы через язык для переноса движения V2V и производственного редактирования; выпуск публичных весов запланирован, но они еще не опубликованы. |
| Hailuo 02 | 1080p | ~10s | Нет | Хорошее следование промпту и движение с акцентом на физику подходят для гимнастики, танцев, движения продуктов и других немых экшен-кадров, к которым звук добавят позднее на этапе производства. |
| Kling 3.0 | До 4K | 15s | Нативное аудио с синхронизацией губ | Согласует смены камеры в нескольких кадрах с многоязычными репликами, назначенными говорящим, и синхронизацией губ — полезно для рекламы по сценарию, раскадровок и сцен с персонажами. |
| Seedance 2.0 | 1080p | 15s | Совместная генерация аудио и видео | Объединяет плотный набор референсных изображений, видео и аудио с совместной аудиовизуальной генерацией и точной синхронизацией губ для рекламы с сохранением идентичности, брендовых историй и монтажа с большим количеством референсов. |
| Veo 3.1 | 4K | 8s | Нативные реплики и эффекты | Сочетает заданные промптом реплики и эффекты с управлением первым/последним кадром, референсным изображением и расширением сцены — подходит для кинематографических переходов и собранных последовательностей. |
Для Hailuo 02 указанные максимумы зависят от режима: вывод 1080p ограничен 6 секундами, а 10-секундный вывод доступен в 512p или 768p.
Возможности Omni-Reference и V2V у MiniMax H3 относятся к связанным рабочим процессам; инструмент Text-to-Video на этой странице остается доступным только для промптов.
MiniMax H3 выделяется сочетанием возможностей: одно универсальное семейство моделей связывает текст, изображения, видео и аудио, генерирует нативный стереозвук и достигает 2K по цене $0.13 за сгенерированную секунду на этой странице. Выбирайте MiniMax H3, если хотите начать с текстового задания и сохранить возможность перейти к генерации или редактированию по референсам в связанных рабочих процессах. Опираясь на общедоступную информацию, проверяйте одно и то же задание в каждой модели, прежде чем закреплять производственный процесс.
Если MiniMax H3 не подходит как отправная точка проекта, сравните эти специализированные рабочие процессы в RunComfy:
Оживите исходное изображение и превратите его в кинематографичный ролик с нативным звуком.
Создавайте музыку по промпту с выводом WAV в 44.1 кГц и редактированием отдельных секций.
Замените выбранную область видео с помощью маски или текстового описания, при необходимости добавив изображение и промпт.
Увеличьте исходное видео до выбранного разрешения и частоты кадров.
Анимируйте обязательное изображение с помощью обязательного промпта, используя Kling 2.1 Standard, с элементами управления длительностью, соотношением сторон, негативным промптом и силой промпта.
Создавайте реалистичные видео из изображений быстро и легко с Hailuo 2.3.
Да. MiniMax H3 Text-to-Video доступна в браузере и через RunComfy API с использованием кредитов вашего аккаунта.
MiniMax H3 — это семейство универсальных мультимодальных моделей MiniMax для генерации и редактирования. Общая архитектура охватывает текст, изображения, видео и аудио, но отдельные процессы предоставляют разные входные данные. На этой странице доступен процесс Text-to-Video, который принимает только текстовый запрос.
MiniMax позиционирует H3 для рекламы, брендинга, электронной коммерции, кино, дизайна титров, анимированных постеров, коротких историй, концепций продуктов и UI, игр, виртуальных персонажей и стилизованной анимации. Текущий процесс Text-to-Video лучше всего подходит для коротких концепций, которыми можно управлять с помощью текстового запроса.
На этой странице MiniMax H3 создаёт видео только в 2K. Можно выбрать любую целую длительность от 5 до 15 секунд; значение по умолчанию — 5 секунд. В этом процессе нет варианта 768p.
Да. Этот процесс Text-to-Video создаёт нативный стереозвук вместе с видео. Опишите в запросе диалог, атмосферу, звуковые эффекты или музыку; отдельного переключателя аудио нет. Результаты могут различаться, поэтому проверяйте синхронизацию губ и тайминг звука.
Нет. На этой странице представлен процесс MiniMax H3 Text-to-Video только с текстовым запросом, а его API принимает лишь prompt, aspect_ratio, resolution и duration. Для исходных медиафайлов используйте отдельный процесс H3 Image-to-Video или Reference-to-Video.
В процессах H3 с поддержкой референсов естественный язык может назначать разные роли тексту, изображениям, видео и аудио. Например, один источник может задавать движение камеры, другой — персонажа, а третий — голос. Это возможность семейства моделей, а не функция загрузки медиафайлов на текущей странице.
Нет. RunComfy предоставляет MiniMax H3 в браузере и через HTTP API, поэтому вам не нужно самостоятельно размещать или масштабировать модель. В публикации о запуске от 31 июля MiniMax описывала условный план выпуска весов модели; прежде чем планировать самостоятельное размещение, проверьте текущую доступность и условия лицензии.
MiniMax H3 Text-to-Video стоит $0.13 за каждую сгенерированную секунду в 2K. Видео длительностью 5 секунд стоит $0.65, 10 секунд — $1.30, а 15 секунд — $1.95. При пакетной генерации стоимость по длительности умножается на число результатов.
По описанию MiniMax, Hailuo 02 сосредоточена на архитектуре, данных и масштабе, а MiniMax H3 — на обобщении задач и модальностей. H3 также добавляет нативный стереозвук и результат 2K в процесс Text-to-Video.
Проверьте запрос, соотношение сторон и длительность в RunComfy. Затем вызовите тот же шаблон MiniMax H3 Text-to-Video через API с полями prompt (обязательно), aspect_ratio, resolution (только 2k) и duration (5–15). В этом процессе нет полей для загрузки медиафайлов.
RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.














