logo
RunComfy
  • ComfyUI
  • ТренерНовое
  • Модели
  • API
  • Цены
discord logo
МОДЕЛИ
Обзор
Все модели
БИБЛИОТЕКА
Генерации
API МОДЕЛЕЙ
Документация API
API-ключи
АККАУНТ
Использование

FLUX 3 Video: мультимодальная генерация видео с нативным звуком на странице модели и через API | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video создает клипы продолжительностью до 20 секунд с синхронизированным нативным звуком. Сейчас модель находится в ограниченном раннем доступе и еще не запущена на RunComfy.

Текстовый промпт для видео (рекомендуется до ~500 китайских иероглифов или ~1000 английских слов).
Референсные изображения для мультимодального режима (0–9). Поддерживаются jpeg, png, webp, bmp, tiff, gif.
Референсные видео для мультимодального режима (0–3). Поддерживаются mp4, mov. Продолжительность видео должна составлять от 2 до 15 секунд.
Референсные аудиофайлы для мультимодального режима (0–3). Поддерживаются wav, mp3. Продолжительность аудио должна составлять от 2 до 15 секунд, а размер файла — менее 15 МБ.
По умолчанию используется адаптивный режим: модель выбирает ближайшее соотношение сторон, а фактическое значение возвращается при запросе задачи.
Целое число секунд в диапазоне [4, 15].
Если включено, модель создает видео с синхронизированным звуком (речь, звуковые эффекты и музыка).
Случайный сид для генерации видео.
Если включен `web_search`, модель может выполнить онлайн-поиск в зависимости от промпта (например, для конкретных товаров или текущей погоды). Это повышает актуальность фактов, но увеличивает задержку.
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

Знакомство с созданием видео FLUX 3 Video

FLUX 3 Video скоро появится на RunComfy. Это единая мультимодальная модель Black Forest Labs для видео и аудио, превращающая промпты и референсные материалы в кинематографичные клипы с синхронизированным нативным звуком. FLUX 3 Video заменяет покадровое редактирование, ручные маски и отдельную озвучку генерацией по промпту и предназначена для маркетинговых команд, агентств, специалистов по превизуализации фильмов и игровых студий, которым нужно быстро создавать короткие кинематографичные ролики. Разработчики смогут использовать FLUX 3 Video на RunComfy как в браузере, так и через HTTP API, не размещая и не масштабируя модель самостоятельно.
Лучше всего подходит для: видеорекламы с высокой конверсией | точной превизуализации отдельных планов | многоязычных брендовых историй с синхронизацией губ

Black Forest Labs / FLUX 3 Video#


FLUX 3 — следующая единая модель Black Forest Labs, совместно обученная на изображениях, видео и аудио, чтобы движение и звук интерпретировались на общей основе. Эта страница посвящена видео и показывает, какой будет работа с FLUX 3 Video в производственной среде.


Примечание: FLUX 3 Video скоро появится в открытом доступе. На этой странице представлена предварительная версия, пока Black Forest Labs завершает подготовку публичной модели и API.


Основные возможности FLUX 3 Video#


Почему авторы выбирают возможности FLUX 3 Video:


  • Без монтажной программы: текстовое задание заменяет монтаж на временной шкале, озвучку и ручную доработку.
  • Режиссура как на съемочной площадке: в FLUX 3 Video ракурс камеры, настроение и темп определяются вашими словами.
  • Звук за один проход: каждый клип создается с синхронизированным нативным звуком, без отдельного этапа озвучки.
  • Для реальных задач: результаты подходят для рекламы, превизуализации и публикаций в соцсетях, а не только для тестовых кадров.

Кратко о FLUX 3 Video#


Основные возможности FLUX 3 Video:


  • Продолжительность клипа: до 20 секунд за одну генерацию — примерно вдвое больше обычного для большинства видеомоделей ограничения в 10 секунд; отдельные планы можно объединять в многоминутные последовательности.
  • Аудио: нативный синхронизированный звук создается одновременно с изображением; при необходимости можно получить видео без звука.
  • Входные данные: текстовые промпты, а также референсные изображения, видео и аудио (примерно до десяти изображений), благодаря чему модель так же легко редактирует и ремикширует материал, как создает его с нуля.
  • Разрешение: 720p в период раннего доступа; по мере развития модели ожидаются более высокие разрешения.
  • Соотношения сторон: широкий выбор от вертикального 9:16 до сверхширокого 21:9 для соцсетей, кино и продуктовых материалов.
  • Стили: в одной модели доступны непринужденная съемка на портативную камеру, анимация и профессиональная кинематографичная картинка.
  • Статус: ограниченный ранний доступ; FLUX 3 Video скоро появится на RunComfy.

Ключевые функции FLUX 3 Video#


Black Forest Labs описывает FLUX 3 Video как единую мультимодальную модель с несколькими режимами генерации, причем каждый результат сопровождается нативным звуком. Официально подтверждены следующие задачи:


  • Текст в видео: создает по одному текстовому промпту полностью озвученный клип продолжительностью до 20 секунд.
  • Изображение в видео: оживляет стартовый кадр или использует предоставленные изображения как визуальные референсы для управления движением.
  • Видео в видео: переносит главные элементы исходного клипа — того же персонажа или объект — в новую сцену или контекст.
  • Продолжение видео + аудио: продлевает исходное видео вместе с его звуковой дорожкой, не начиная работу заново.
  • Ключевые кадры в видео: задайте важные моменты, а модель заполнит управляемый переход между ними.

Помимо этих режимов, FLUX 3 Video предлагает:


  • Многоязычные диалоги с движением губ в соответствии с речью.
  • Агентное объединение нескольких планов в последовательности продолжительностью несколько минут с сохранением постоянства персонажей.
  • Широкий выбор стилей и соотношений сторон — от непринужденной съемки на портативную камеру до анимации и кинематографичной картинки.
  • Качественную типографику и анимированный дизайн, отрисованные непосредственно в кадре.
  • Реализм, основанный на физических закономерностях: по данным Black Forest Labs, FLUX 3 Video уже особенно хорошо передает выразительные лица и сопоставляет звуки с физическими событиями на экране.

Нативный звук и физически достоверное движение в FLUX 3 Video#


FLUX 3 Video выделяется тем, что изображение и звук проектируются вместе, а не соединяются постфактум. За один проход модель создает синхронизированные с действием диалоги, шумовые эффекты, атмосферу и музыку: хлопок двери сопровождается собственным звуком удара, сигнал тревоги пульсирует в ритме предупреждающей лампы, а персонаж может говорить в том же кадре, по которому движется камера.


Такая синхронизация обусловлена обучением модели. По данным Black Forest Labs, на прогнозирование видео пришлось более 95% вычислений при обучении FLUX 3, поэтому модели потребовалось освоить контакт, движение, вес, причины и следствия — иначе говоря, то, как ведет себя физический мир. Затем аудио изучается как следствие этой модели мира: звуки совпадают с вызвавшими их событиями на экране, а речь — с движением губ. Для автора это означает физически правдоподобное движение и звуковую дорожку, которая усиливает монтаж, а не конфликтует с ним.


Советы по промптам и референсам для FLUX 3 Video#


Эти рекомендации помогут получать предсказуемые результаты во время предварительного знакомства с FLUX 3 Video:


  • Точно задавайте камеру и движение (средний крупный план, медленное приближение, съемка с рук или со штатива).
  • Используйте изображения для элементов, которые должны оставаться неизменными (лицо, одежда, логотип), а текст — для того, что должно развиваться (действие, настроение).
  • Продолжительность референсных видео и аудио должна составлять 2–15 секунд, а размер аудиофайла — менее 15 МБ.
  • При включенном аудио укажите желаемый тон диалога или фоновый звук.
  • Во время итераций зафиксируйте сид, чтобы изменения зависели от промпта, а не от случайности.
  • Упростите промпт, если результат кажется перегруженным или противоречивым.

Сравнение FLUX 3 Video с другими моделями#


Поскольку FLUX 3 Video пока находится в раннем доступе, наиболее наглядные данные получены из предварительных оценок самой Black Forest Labs: сравнивались 10-секундные клипы в 720p, сгенерированные со звуком. В этих попарных тестах участники предпочли FLUX 3 широкому кругу конкурентов: Luma Ray 3.2 в 93% сравнений, Runway Gen-4.5 в 77%, Grok Imagine Video — до 69%, Kling v3 Pro в 60%, а Seedance 2.0 и Gemini Omni Flash — в 52%. Это предварительные показатели, которые еще могут измениться, но они позволяют опираться в сравнении ниже на реальные возможности, а не на рекламу.


FLUX 3 Video и FLUX.2#


  • От изображений к движению: все предыдущие версии FLUX, включая FLUX.2, создают только статичные изображения; FLUX 3 впервые объединяет видео и синхронизированный звук в одной основе, поэтому работа FLUX с референсами, следование промптам и типографика теперь распространяются и на клипы.
  • Общее происхождение: качества, сделавшие изображения FLUX надежными, — стабильность персонажа, продукта или логотипа — FLUX 3 Video сохраняет на протяжении всего плана.
  • Новая область: движение, временная стабильность и синхронный с событиями звук — новые задачи для лаборатории, которая прежде занималась прежде всего изображениями; именно поэтому модели нужен период раннего доступа.

FLUX 3 Video и Seedance 2.0#


  • Данные: в первых тестах Black Forest Labs FLUX 3 предпочли Seedance 2.0 в 52% сравнений, то есть результат оказался практически равным зрелой и проверенной мультимодальной видеомодели.
  • Возможности: Seedance 2.0 объединяет текст, изображения, видео и аудио в одном запросе и возвращает около пятнадцати секунд многопланового видео в разрешении от 480p до 4K с нативным синхронизированным многодорожечным звуком, а также циклами редактирования и продления. FLUX 3 Video соответствует этим мультимодальным амбициям и, по данным Black Forest Labs, особенно хорошо передает выразительные лица, синхронизирует звуки с физическими событиями и поддерживает многоязычные диалоги.
  • Как выбрать: если выпускать результат нужно сегодня, Seedance 2.0 уже проверен; за FLUX 3 Video стоит следить по мере приближения публичного запуска.

FLUX 3 Video и Kling, Runway, Luma#


  • Данные: в первых сравнениях Black Forest Labs FLUX 3 предпочли Kling v3 Pro в 60% случаев, Runway Gen-4.5 — в 77%, а Luma Ray 3.2 — в 93%.
  • Причина разрыва: эти показатели соответствуют заявленным сильным сторонам FLUX 3 Video — выразительным лицам, звуку, синхронизированному с физическими событиями в кадре, многоязычным диалогам и последовательному объединению нескольких планов. Именно эти детали позволяют короткому клипу выглядеть готовым материалом, а не тестовым рендером.

Чего ожидать от FLUX 3 Video в раннем доступе#


FLUX 3 Video — предварительная версия модели, которая пока находится в ограниченном раннем доступе, поэтому важно понимать текущие ограничения:


  • Уже хорошо работает: длинные связные клипы, драматические сцены и сцены с диалогами, а также нативный синхронизированный звук уверенно показывают себя в первых практических испытаниях.
  • Продолжает развиваться: следование референсу при преобразовании изображения в видео в ранних версиях может быть нестабильным, а очень быстрым и энергичным сценам пока не хватает динамики наиболее ориентированных на движение конкурентов.
  • Постепенный запуск: начальное разрешение составляет около 720p, в дальнейшем ожидаются более высокие варианты; цены и открытые веса Black Forest Labs пока не подтвердила.

Воспринимайте FLUX 3 Video как взгляд на направление развития модели: ее возможности и ограничения будут меняться по мере приближения к общедоступному выпуску.


Версии FLUX 3 Video и семейство FLUX 3 AI#


Black Forest Labs выпускает FLUX 3 AI как единую мультимодальную основу с несколькими версиями, каждая из которых выходит поэтапно после собственного периода раннего доступа. Согласно официальному плану запуска:


  • FLUX 3 Video: генерация и редактирование видео и аудио через API и приватный доступ к весам — именно эта версия представлена на странице.
  • FLUX 3 Image: генерация и редактирование изображений, также через API и приватный доступ к весам.
  • FLUX 3 Action (FLUX-mimic): прогнозирование действий для робототехники, разработанное совместно с такими партнерами, как mimic robotics, и уже испытанное на производственных линиях Audi.
  • FLUX 3 Dev: мультимодальная основа с открытыми весами для генерации изображений, видео и аудио, а также прогнозирования действий — для команд, желающих запускать и адаптировать модель самостоятельно.

Black Forest Labs подтвердила планы открыть веса. После выхода основы FLUX 3 Dev естественным следующим шагом станет созданный сообществом рабочий процесс FLUX 3 LoRA, включая дообучение FLUX 3 dev LoRA для постоянных персонажей, стилей и фирменного оформления, — по аналогии с большой экосистемой LoRA вокруг предыдущих выпусков FLUX.


Большинству команд FLUX 3 Video подойдет для повседневного создания клипов, а FLUX 3 Dev и FLUX 3 dev LoRA откроют путь к самостоятельному размещению и настройке.


Официальные ресурсы FLUX 3 Video#


  • Black Forest Labs

Итак, FLUX 3 Video скоро появится на RunComfy: единая мультимодальная основа превращает промпты и референсные материалы в кинематографичные клипы с синхронизированным нативным звуком.

Похожие модели

wan-2-2/speech-to-video

Оживите изображение с помощью аудиодорожки в режиме речи, пения или выступления.

seedance-1-0/pro/fast/image-to-video

Создавайте кинематографическое видео из фото быстро и просто с Seedance 1.0 Pro Fast

sync/lipsync/v2

Создайте видео с синхронизацией губ по необходимым URL-адресам видео и аудио. Выберите `lipsync-2` или `lipsync-2-pro` — Pro стоит примерно в 1,67 раза дороже за ту же продолжительность — и выберите один из пяти режимов несоответствия продолжительности.

happyhorse-1.0/text-to-video

HappyHorse 1.0 с нативным выводом 1080p, кинематографичным движением и согласованностью мультишотов.

infinite-talk/fast

Создавайте видео по аудиодорожке и изображению и при необходимости задавайте промпт и сид.

gemini-omni-flash/reference-to-video

Создайте короткое видео с синхронным звуком по референсным изображениям и промпту.

Часто задаваемые вопросы

FLUX 3 Video уже доступен на RunComfy?

FLUX 3 Video скоро появится на RunComfy. Эта предварительная версия позволяет познакомиться с FLUX 3 Video, пока Black Forest Labs завершает подготовку единой мультимодальной модели и ее API. До подключения серверной части FLUX 3 доступные поля ввода и ограничения соответствуют модели, на которой сейчас работает эта предварительная версия.

Для чего используется FLUX 3 Video?

FLUX 3 Video превращает промпты и необязательные референсные изображения, видео и аудио в короткие кинематографичные клипы с нативным звуком. Модель предназначена для создания рекламы, превизуализации фильмов и брендовых историй, где важны согласованность с референсами и синхронизация звука.

Что FLUX 3 Video улучшает по сравнению с предыдущими подходами к генерации видео?

FLUX 3 Video переносит разработки Black Forest Labs в область движения и звука на единой мультимодальной основе. Официально подтверждены пять задач: текст в видео, изображение в видео, видео в видео, продолжение видео + аудио и ключевые кадры в видео. Модель также предлагает нативный звук, многоязычные диалоги и клипы продолжительностью до 20 секунд за одну генерацию. Реальный прирост зависит от контента, поэтому после запуска модели сравните клипы на одном и том же промпте.

Какой продолжительности может быть клип FLUX 3 Video?

FLUX 3 Video создает клипы продолжительностью до 20 секунд за один проход — примерно вдвое больше обычного для большинства видеомоделей ограничения в 10 секунд. Этого достаточно для реплик и более медленных драматических планов. Клипы также можно объединять в многоплановые последовательности продолжительностью несколько минут с сохранением постоянства персонажей. В модели, на которой сейчас работает эта предварительная версия, продолжительность составляет от 4 до 15 секунд; полная версия FLUX 3 Video рассчитана на 20 секунд.

Поддерживает ли FLUX 3 Video нативный звук и синхронизацию губ?

Да. Нативный звук — одна из основных целей FLUX 3 Video. В модели, на которой сейчас работает эта предварительная версия, можно включить генерацию аудио и получить синхронизированные речь, звуковые эффекты и музыку, в том числе многоязычные клипы с синхронизацией губ. Для немого видео аудио можно отключить. Качество синхронизации губ зависит от ясности промпта и описанной сцены.

Почему движение и звук в FLUX 3 Video выглядят реалистично?

На прогнозирование видео пришлась основная доля вычислений при обучении FLUX 3, поэтому модели потребовалось освоить контакт, движение, вес, причины и следствия — то есть поведение физического мира. Нативный звук изучается поверх этой модели мира, поэтому он совпадает с вызвавшими его событиями на экране, а речь — с движением губ. На практике FLUX 3 Video особенно хорошо передает выразительные лица и физически правдоподобное движение.

Может ли FLUX 3 Video сохранять персонажа или стиль на протяжении всего клипа?

Работа с референсами лежит в основе FLUX 3 Video. Референсные изображения в сочетании с ясным промптом помогают закрепить идентичность, одежду и атмосферу во всех кадрах, а FLUX 3 умеет переносить объект из исходного клипа в новую сцену. В модели, на которой сейчас работает эта предварительная версия, для повышения согласованности можно прикреплять референсные изображения, видео и аудио в пределах установленных ограничений.

Какие ограничения входных данных нужно учитывать при работе с FLUX 3 Video на RunComfy?

В модели, на которой сейчас работает эта предварительная версия, рекомендуемая длина промпта составляет до ~500 китайских иероглифов или ~1000 английских слов. Можно прикрепить до 9 референсных изображений, 3 референсных видео (по 2–15 секунд) и 3 референсных аудиофайлов (по 2–15 секунд и менее 15 МБ). Обязателен только prompt. Следите за актуальной панелью параметров: после запуска FLUX 3 Video ограничения изменятся.

Какие разрешения, соотношения сторон и варианты продолжительности доступны в этой предварительной версии FLUX 3 Video?

Доступны разрешения 480p, 720p (по умолчанию), 1080p и 4K. Соотношение сторон может быть адаптивным (по умолчанию модель выбирает ближайший вариант) или фиксированным: 16:9, 9:16, 4:3, 3:4, 1:1 либо 21:9. В модели, на которой сейчас работает эта предварительная версия, duration принимает целое число от 4 до 15 секунд со значением по умолчанию 5; полная версия FLUX 3 Video рассчитана на 20 секунд за одну генерацию.

Будут ли у FLUX 3 Video открытые веса или дообучение LoRA?

FLUX 3 AI задуман как единая основа с несколькими версиями. Помимо размещенной в облаке FLUX 3 Video, Black Forest Labs анонсировала FLUX 3 Image, FLUX 3 Action (робототехнический проект FLUX-mimic) и FLUX 3 Dev — мультимодальную основу с открытыми весами. Black Forest Labs подтвердила планы открыть веса. После выхода FLUX 3 Dev можно ожидать созданный сообществом рабочий процесс FLUX 3 LoRA, включая обучение FLUX 3 dev LoRA для постоянных персонажей, стилей и фирменного оформления.

Как перейти от тестирования FLUX 3 Video в браузере к интеграции API в рабочую среду?

Создайте прототип в интерфейсе модели RunComfy, а затем вызывайте тот же шаблон через API RunComfy с идентичными входными полями (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Сначала проверьте промпты и ограничения медиафайлов в интерфейсе, затем используйте API-ключ и кредиты своей учетной записи для автоматизированных задач.

Сколько стоит генерация в этой предварительной версии FLUX 3 Video?

Генерация расходует кредиты в зависимости от продолжительности видео по тарифу модели, на которой сейчас работает предварительная версия, Seedance 2.0 Pro: $0.08 за секунду в 480p, $0.175 за секунду в 720p, $0.40 за секунду в 1080p и $0.90 за секунду в 4K. Актуальная цена указана на этой странице и изменится после запуска FLUX 3 Video.

Подписывайтесь на нас
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Поддержка
  • Discord
  • Email
  • Статус системы
  • партнёр
Модели видео
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • Посмотреть все модели →
Модели изображений
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • Посмотреть все модели →
Юридическая информация
  • Условия обслуживания
  • Политика конфиденциальности
  • Политика в отношении файлов cookie
RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.

Примеры FLUX 3 Video

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...