Оживите изображение с помощью аудиодорожки в режиме речи, пения или выступления.
FLUX 3 — следующая единая модель Black Forest Labs, совместно обученная на изображениях, видео и аудио, чтобы движение и звук интерпретировались на общей основе. Эта страница посвящена видео и показывает, какой будет работа с FLUX 3 Video в производственной среде.
Примечание: FLUX 3 Video скоро появится в открытом доступе. На этой странице представлена предварительная версия, пока Black Forest Labs завершает подготовку публичной модели и API.
Почему авторы выбирают возможности FLUX 3 Video:
Основные возможности FLUX 3 Video:
Black Forest Labs описывает FLUX 3 Video как единую мультимодальную модель с несколькими режимами генерации, причем каждый результат сопровождается нативным звуком. Официально подтверждены следующие задачи:
Помимо этих режимов, FLUX 3 Video предлагает:
FLUX 3 Video выделяется тем, что изображение и звук проектируются вместе, а не соединяются постфактум. За один проход модель создает синхронизированные с действием диалоги, шумовые эффекты, атмосферу и музыку: хлопок двери сопровождается собственным звуком удара, сигнал тревоги пульсирует в ритме предупреждающей лампы, а персонаж может говорить в том же кадре, по которому движется камера.
Такая синхронизация обусловлена обучением модели. По данным Black Forest Labs, на прогнозирование видео пришлось более 95% вычислений при обучении FLUX 3, поэтому модели потребовалось освоить контакт, движение, вес, причины и следствия — иначе говоря, то, как ведет себя физический мир. Затем аудио изучается как следствие этой модели мира: звуки совпадают с вызвавшими их событиями на экране, а речь — с движением губ. Для автора это означает физически правдоподобное движение и звуковую дорожку, которая усиливает монтаж, а не конфликтует с ним.
Эти рекомендации помогут получать предсказуемые результаты во время предварительного знакомства с FLUX 3 Video:
Поскольку FLUX 3 Video пока находится в раннем доступе, наиболее наглядные данные получены из предварительных оценок самой Black Forest Labs: сравнивались 10-секундные клипы в 720p, сгенерированные со звуком. В этих попарных тестах участники предпочли FLUX 3 широкому кругу конкурентов: Luma Ray 3.2 в 93% сравнений, Runway Gen-4.5 в 77%, Grok Imagine Video — до 69%, Kling v3 Pro в 60%, а Seedance 2.0 и Gemini Omni Flash — в 52%. Это предварительные показатели, которые еще могут измениться, но они позволяют опираться в сравнении ниже на реальные возможности, а не на рекламу.
FLUX 3 Video — предварительная версия модели, которая пока находится в ограниченном раннем доступе, поэтому важно понимать текущие ограничения:
Воспринимайте FLUX 3 Video как взгляд на направление развития модели: ее возможности и ограничения будут меняться по мере приближения к общедоступному выпуску.
Black Forest Labs выпускает FLUX 3 AI как единую мультимодальную основу с несколькими версиями, каждая из которых выходит поэтапно после собственного периода раннего доступа. Согласно официальному плану запуска:
Black Forest Labs подтвердила планы открыть веса. После выхода основы FLUX 3 Dev естественным следующим шагом станет созданный сообществом рабочий процесс FLUX 3 LoRA, включая дообучение FLUX 3 dev LoRA для постоянных персонажей, стилей и фирменного оформления, — по аналогии с большой экосистемой LoRA вокруг предыдущих выпусков FLUX.
Большинству команд FLUX 3 Video подойдет для повседневного создания клипов, а FLUX 3 Dev и FLUX 3 dev LoRA откроют путь к самостоятельному размещению и настройке.
Итак, FLUX 3 Video скоро появится на RunComfy: единая мультимодальная основа превращает промпты и референсные материалы в кинематографичные клипы с синхронизированным нативным звуком.
Оживите изображение с помощью аудиодорожки в режиме речи, пения или выступления.
Создавайте кинематографическое видео из фото быстро и просто с Seedance 1.0 Pro Fast
Создайте видео с синхронизацией губ по необходимым URL-адресам видео и аудио. Выберите `lipsync-2` или `lipsync-2-pro` — Pro стоит примерно в 1,67 раза дороже за ту же продолжительность — и выберите один из пяти режимов несоответствия продолжительности.
HappyHorse 1.0 с нативным выводом 1080p, кинематографичным движением и согласованностью мультишотов.
Создавайте видео по аудиодорожке и изображению и при необходимости задавайте промпт и сид.
Создайте короткое видео с синхронным звуком по референсным изображениям и промпту.
FLUX 3 Video скоро появится на RunComfy. Эта предварительная версия позволяет познакомиться с FLUX 3 Video, пока Black Forest Labs завершает подготовку единой мультимодальной модели и ее API. До подключения серверной части FLUX 3 доступные поля ввода и ограничения соответствуют модели, на которой сейчас работает эта предварительная версия.
FLUX 3 Video превращает промпты и необязательные референсные изображения, видео и аудио в короткие кинематографичные клипы с нативным звуком. Модель предназначена для создания рекламы, превизуализации фильмов и брендовых историй, где важны согласованность с референсами и синхронизация звука.
FLUX 3 Video переносит разработки Black Forest Labs в область движения и звука на единой мультимодальной основе. Официально подтверждены пять задач: текст в видео, изображение в видео, видео в видео, продолжение видео + аудио и ключевые кадры в видео. Модель также предлагает нативный звук, многоязычные диалоги и клипы продолжительностью до 20 секунд за одну генерацию. Реальный прирост зависит от контента, поэтому после запуска модели сравните клипы на одном и том же промпте.
FLUX 3 Video создает клипы продолжительностью до 20 секунд за один проход — примерно вдвое больше обычного для большинства видеомоделей ограничения в 10 секунд. Этого достаточно для реплик и более медленных драматических планов. Клипы также можно объединять в многоплановые последовательности продолжительностью несколько минут с сохранением постоянства персонажей. В модели, на которой сейчас работает эта предварительная версия, продолжительность составляет от 4 до 15 секунд; полная версия FLUX 3 Video рассчитана на 20 секунд.
Да. Нативный звук — одна из основных целей FLUX 3 Video. В модели, на которой сейчас работает эта предварительная версия, можно включить генерацию аудио и получить синхронизированные речь, звуковые эффекты и музыку, в том числе многоязычные клипы с синхронизацией губ. Для немого видео аудио можно отключить. Качество синхронизации губ зависит от ясности промпта и описанной сцены.
На прогнозирование видео пришлась основная доля вычислений при обучении FLUX 3, поэтому модели потребовалось освоить контакт, движение, вес, причины и следствия — то есть поведение физического мира. Нативный звук изучается поверх этой модели мира, поэтому он совпадает с вызвавшими его событиями на экране, а речь — с движением губ. На практике FLUX 3 Video особенно хорошо передает выразительные лица и физически правдоподобное движение.
Работа с референсами лежит в основе FLUX 3 Video. Референсные изображения в сочетании с ясным промптом помогают закрепить идентичность, одежду и атмосферу во всех кадрах, а FLUX 3 умеет переносить объект из исходного клипа в новую сцену. В модели, на которой сейчас работает эта предварительная версия, для повышения согласованности можно прикреплять референсные изображения, видео и аудио в пределах установленных ограничений.
В модели, на которой сейчас работает эта предварительная версия, рекомендуемая длина промпта составляет до ~500 китайских иероглифов или ~1000 английских слов. Можно прикрепить до 9 референсных изображений, 3 референсных видео (по 2–15 секунд) и 3 референсных аудиофайлов (по 2–15 секунд и менее 15 МБ). Обязателен только prompt. Следите за актуальной панелью параметров: после запуска FLUX 3 Video ограничения изменятся.
Доступны разрешения 480p, 720p (по умолчанию), 1080p и 4K. Соотношение сторон может быть адаптивным (по умолчанию модель выбирает ближайший вариант) или фиксированным: 16:9, 9:16, 4:3, 3:4, 1:1 либо 21:9. В модели, на которой сейчас работает эта предварительная версия, duration принимает целое число от 4 до 15 секунд со значением по умолчанию 5; полная версия FLUX 3 Video рассчитана на 20 секунд за одну генерацию.
FLUX 3 AI задуман как единая основа с несколькими версиями. Помимо размещенной в облаке FLUX 3 Video, Black Forest Labs анонсировала FLUX 3 Image, FLUX 3 Action (робототехнический проект FLUX-mimic) и FLUX 3 Dev — мультимодальную основу с открытыми весами. Black Forest Labs подтвердила планы открыть веса. После выхода FLUX 3 Dev можно ожидать созданный сообществом рабочий процесс FLUX 3 LoRA, включая обучение FLUX 3 dev LoRA для постоянных персонажей, стилей и фирменного оформления.
Создайте прототип в интерфейсе модели RunComfy, а затем вызывайте тот же шаблон через API RunComfy с идентичными входными полями (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Сначала проверьте промпты и ограничения медиафайлов в интерфейсе, затем используйте API-ключ и кредиты своей учетной записи для автоматизированных задач.
Генерация расходует кредиты в зависимости от продолжительности видео по тарифу модели, на которой сейчас работает предварительная версия, Seedance 2.0 Pro: $0.08 за секунду в 480p, $0.175 за секунду в 720p, $0.40 за секунду в 1080p и $0.90 за секунду в 4K. Актуальная цена указана на этой странице и изменится после запуска FLUX 3 Video.
RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.





