logo
RunComfy
  • ComfyUI
  • ТренерНовое
  • Модели
  • API
  • Цены
discord logo
МОДЕЛИ
Обзор
Все модели
БИБЛИОТЕКА
Генерации
API МОДЕЛЕЙ
Документация API
API-ключи
АККАУНТ
Использование

Gemini Omni Flash: текст в видео с синхронизированным звуком | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flash создаёт по текстовому промпту короткие кинематографические видео с нативно синхронизированным звуком, поддерживая форматы 16:9 и 9:16 и длительность 3–10 секунд.

Опишите видео, которое хотите создать. Темп и звук можно задать прямо в промпте, например «одним непрерывным кадром», «спокойная фоновая музыка» или «без диалогов». Также можно добавить отрицательные инструкции, например «не показывать текст».
Соотношение сторон создаваемого видео.
Длительность создаваемого видео в секундах.
Idle
The rate is $0.13 per second of generated video.

Знакомство с Gemini Omni Flash

Gemini Omni Flash от Google превращает один текстовый промпт в кинематографический ролик длительностью 3–10 секунд с синхронизированным звуком. Знания Gemini о реальном мире помогают создавать последовательное и физически правдоподобное движение. Вместо отдельных этапов монтажа, саунд-дизайна и связывания нескольких инструментов маркетологи, кинематографисты, игровые команды и авторы контента могут управлять видео и звуком одним промптом. На RunComfy модель доступна в браузере и через HTTP API без самостоятельного хостинга и масштабирования.
Подходит для: Короткой рекламы в соцсетях | Кинематографических сюжетных моментов | Быстрой превизуализации

Google / Gemini Omni Flash#


Gemini Omni Flash — это семейство мультимодальных видеогенераторов Google, основанное на реальных знаниях Gemini и более глубоком понимании физики для более правдоподобного движения и взаимодействия. Более широкое семейство охватывает четыре взаимосвязанных задачи: преобразование текста в видео, преобразование изображения в видео, редактирование видео и преобразование ссылки в видео. На этой странице RunComfy выполняется задача преобразования текста в видео, превращая письменное приглашение в короткий кинематографический клип с синхронизированным звуком.


Поскольку она рассуждает о том, как на самом деле ведет себя мир, модель сохраняет согласованность объектов, освещения и движения на протяжении всего кадра, а не дрейфует от кадра к кадру.


Основные моменты#


  • Встроенный синхронизированный звук. Создавайте речь, звуковые эффекты и музыку в соответствии с действием, поэтому клип можно будет опубликовать без отдельного аудиопрохода.
  • Движение с учетом физики. Улучшение физического понимания обеспечивает более плавное и естественное движение и взаимодействие объектов.
  • Основано на реальных знаниях. Результаты основаны на реальных знаниях Gemini, что помогает сценам выглядеть правдоподобными и соответствовать теме.
  • Управление на уровне подсказки: прямой темп и звук прямо из подсказки (например, один непрерывный кадр, спокойная фоновая музыка или отсутствие диалогов).
  • Семейство из четырех задач: линейка Gemini Omni Flash обеспечивает преобразование текста в видео, изображение в видео, редактирование видео и преобразование ссылок в видео; на этой странице представлена только задача преобразования текста в видео.
  • Гибкое кадрирование: поддерживается альбомная ориентация 16:9 и портретная 9:16 с длительностью от 3 до 10 секунд.

Параметры#


Входные данные соответствуют схеме RunComfy OpenAPI Input для задачи преобразования текста в видео.


ПараметрОбязательныйТипПо умолчаниюДиапазон / ВариантыОписание
prompt*Да (*)string—Описательный текстПромпт для создаваемого видео
aspect_ratioНетstring16:916:9, 9:16Соотношение сторон видео
durationНетinteger83–10 (секунд)Длительность видео в целых секундах

Цены#


Оплата производится в зависимости от длины созданного клипа:


  • Видео: 0,13 доллара США за секунду созданного видео.

Как использовать#


  1. Напишите описательную подсказку – опишите объект, действие, обстановку, настроение, освещение и камеру. Подробные подсказки расширяют возможности работы с моделью.
  2. Задайте темп словами. Попросите один непрерывный кадр или определенный ритм прямо в подсказке.
  3. Направляйте звук — запрашивайте диалог, окружающий звук или фоновую музыку или не говорите диалог, если хотите, чтобы он был тихим.
  4. Добавить отрицательные инструкции — добавьте исключения в само приглашение, например, не показывать текст.
  5. Выберите соотношение сторон. Выберите 16:9 для горизонтальной ориентации или 9:16 для вертикальной ориентации и показа на мобильных устройствах.
  6. Установите продолжительность — выберите любое целое число секунд от 3 до 10.
  7. Создать и уточнить — просмотрите клип, затем измените формулировку, соотношение сторон или продолжительность и запустите его еще раз.

Подсказки и справочные советы#


  • Ведите с помощью камеры и движения, которые вы хотите (например, медленное нажатие, ручное управление или блокировка).
  • Назовите настроение и освещение, чтобы сцена выглядела так, как вы задумали.
  • Сохраняйте одно четкое действие на клип; Короткая продолжительность вознаграждает за целенаправленные подсказки.
  • Обозначьте звуковую среду, когда звук имеет значение, поскольку модель может генерировать синхронизированный звук.
  • Используйте простые негативные формулировки (например, никакого текста на экране), а не расплывчатые намеки.
  • Если результат кажется перегруженным, упростите подсказку и удалите конкурирующие элементы стиля.

Чем Gemini Omni Flash отличается от других моделей#


  • По сравнению с более ранними моделями преобразования текста в видео: Он подчеркивает движение с учетом физики и встроенную синхронизацию звука за один шаг. На основании общедоступной информации сравните по собственным подсказкам.
  • По сравнению с генераторами бесшумного видео: он включает в себя генерацию звука, поэтому вы пропускаете отдельный этап озвучивания или звукового дизайна.
  • В рамках отдельного семейства. Преобразование текста в видео – одна из четырех задач в этом семействе; целевые рабочие процессы преобразования изображения в видео, редактирования видео и ссылки на видео, которые начинаются с существующих медиа, а не только с текста.

Больше моделей, которые стоит попробовать#


  • Veo 3 Fast — быстрое преобразование текста в видео со звуком для быстрых черновиков.
  • Seedance 2.5 — Кинематографическое мультимодальное видео с поддержкой ссылок.
  • Kling Video — создание видео, ориентированного на движение.
  • Wan 2.5 — универсальная альтернатива преобразованию текста в видео.

Официальные ресурсы#


  • Google DeepMind: https://deepmind.google/

Похожие модели

kling-2-1/standard/image-to-video

Анимируйте обязательное изображение с помощью обязательного промпта, используя Kling 2.1 Standard, с элементами управления длительностью, соотношением сторон, негативным промптом и силой промпта.

kling-2-6/motion-control-pro

Кинематографическая модель движения для создания плавных сцен и адаптивного визуального редактирования.

flux-3/first-last-frame-to-video

Генерация видео между начальным и конечным кадрами с дополнительным звуком

runway-gen-4/turbo/image-to-video

Создавайте реалистичные видеосцены с точным стилем и движением

ltx-2/fast/image-to-video

Создайте видео 16:9 по исходному изображению и промпту, выбрав длительность, разрешение, частоту кадров и генерацию звука.

pixverse/v5.5/text-to-video

Создайте видео по обязательному текстовому промпту с точными настройками соотношения сторон, разрешения, длительности, стиля, сида, аудио, нескольких клипов и оптимизации.

Часто задаваемые вопросы

Для чего используется Gemini Omni Flash?

Gemini Omni Flash — это мультимодальная видеомодель Google, которая превращает текстовую подсказку в короткий кинематографический клип с синхронизированным звуком. На этой странице RunComfy он запускает задачу преобразования текста в видео, что делает его пригодным для социальной рекламы, сюжетных моментов и быстрой предварительной визуализации, где важны как движение, так и звук.

Какие задачи решает семейство Gemini Omni Flash?

Семейство Gemini Omni Flash выполняет четыре взаимосвязанные задачи: преобразование текста в видео, преобразование изображения в видео, редактирование видео и преобразование ссылки в видео. На этой странице RunComfy представлена задача преобразования текста в видео, которая генерирует видео только из письменного запроса, в то время как другие задачи начинаются с существующих изображений или видеоматериалов.

Генерирует ли Gemini Omni Flash звук вместе с видео?

Да. Gemini Omni Flash создает синхронизированный звук, например речь, звуковые эффекты и музыку, в соответствии с сгенерированным действием. Вы можете управлять звуком из подсказки, например, попросив включить спокойную фоновую музыку или запретив диалог.

Что делает движения Gemini Omni Flash более естественными?

Gemini Omni Flash основана на реальных знаниях Gemini и обладает улучшенным пониманием физики, что помогает сохранять согласованность движения, освещения и взаимодействия объектов на протяжении всего кадра. Это уменьшает дрейф между кадрами, характерный для старых моделей преобразования текста в видео.

Какие ограничения ввода следует знать перед использованием Gemini Omni Flash?

Задача преобразования текста в видео требует обязательного запроса, соотношения сторон 16:9 или 9:16 и продолжительности от 3 до 10 секунд. Перед созданием проверьте текущую панель параметров RunComfy на предмет точных значений по умолчанию и любых ограничений на стороне провайдера.

Как мне написать подсказки для Gemini Omni Flash?

Описывайте объект, действие, камеру, настроение и освещение, а также управляйте темпом непосредственно в подсказке (например, один непрерывный снимок). Поместите исключения в само приглашение, например «не показывать текст», поскольку Gemini Omni Flash считывает из приглашения отрицательные инструкции.

Могут ли разработчики использовать Gemini Omni Flash через API RunComfy?

Да. Вы можете создать прототип Gemini Omni Flash в пользовательском интерфейсе модели RunComfy, а затем вызвать ту же модель через API RunComfy с идентичными параметрами. Это позволяет вам перейти от браузерного теста к автоматизированной генерации без необходимости размещения или масштабирования модели самостоятельно.

Сколько стоит создание с помощью Gemini Omni Flash на RunComfy?

За генерацию с Gemini Omni Flash взимается плата в размере 0,13 доллара США за секунду созданного видео, и они расходуют ваш баланс RunComfy в долларах США или кредит. Новые пользователи обычно начинают с бесплатной пробной суммы; текущие подробности см. в разделе «Генерация» на этой странице.

Подписывайтесь на нас
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Поддержка
  • Discord
  • Email
  • Статус системы
  • партнёр
Модели видео
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Посмотреть все модели →
Модели изображений
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Посмотреть все модели →
Юридическая информация
  • Условия обслуживания
  • Политика конфиденциальности
  • Политика в отношении файлов cookie
RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.

Примеры Gemini Omni Flash

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...