logo
RunComfy
  • ComfyUI
  • EntrenadorNuevo
  • Modelos
  • API
  • Precios
discord logo
MODELOS
Explorar
Todos los modelos
BIBLIOTECA
Generaciones
APIS DE MODELOS
Documentación de la API
Claves API
CUENTA
Uso

Gemini Omni Flash: texto a vídeo con audio sincronizado | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flash genera vídeos cinematográficos cortos con audio nativo sincronizado a partir de un prompt, en formato 16:9 o 9:16 y con una duración de 3 a 10 segundos.

Describe el vídeo que quieres generar. Puedes controlar el ritmo y el audio en el propio prompt, por ejemplo «en una sola toma continua», «música de fondo tranquila» o «sin diálogo», y añadir instrucciones negativas como «no mostrar texto».
Relación de aspecto del vídeo generado.
Duración del vídeo generado, en segundos.
Idle
The rate is $0.13 per second of generated video.

Introducción a Gemini Omni Flash

Gemini Omni Flash de Google convierte un único prompt de texto en un clip cinematográfico de 3 a 10 segundos con audio sincronizado. El conocimiento de Gemini sobre el mundo real ayuda a producir movimientos coherentes y físicamente creíbles. En lugar de editar el vídeo, diseñar el sonido y conectar varias herramientas por separado, equipos de marketing, cineastas, desarrolladores de videojuegos y creadores sociales pueden dirigir todo el resultado desde un prompt. Gemini Omni Flash se usa en RunComfy desde el navegador o mediante la API HTTP, sin alojar ni escalar el modelo.
Ideal para: Anuncios cortos en redes sociales | Momentos narrativos cinematográficos | Previsualización rápida

Google / Gemini Omni Flash#


Gemini Omni Flash es la familia de generación de vídeo multimodal de Google, basada en el conocimiento del mundo real de Gemini y una mayor comprensión de la física para lograr movimientos e interacciones más creíbles. La familia más amplia abarca cuatro tareas relacionadas: texto a vídeo, imagen a vídeo, edición de vídeo y referencia a vídeo. Esta página RunComfy ejecuta la tarea de conversión de texto a video, convirtiendo un mensaje escrito en un clip cinematográfico corto con audio sincronizado.


Debido a que razona sobre cómo se comporta realmente el mundo, el modelo mantiene los objetos, la iluminación y el movimiento coherentes a lo largo de una toma en lugar de desviarse fotograma a fotograma.


Destacados#


  • Audio nativo sincronizado: genera voz, efectos de sonido y música alineados con la acción, para que un clip esté listo para compartir sin un pase de audio separado.
  • Movimiento consciente de la física: La comprensión física mejorada produce un movimiento y una interacción con objetos más estables y naturales.
  • Basado en conocimiento real: Los resultados se basan en el conocimiento del mundo real de Gemini, lo que ayuda a que las escenas parezcan plausibles y acordes con el tema.
  • Control de nivel de aviso: Ritmo directo y sonido directamente desde el aviso (por ejemplo, una sola toma continua, música de fondo tranquila o sin diálogo).
  • Familia de cuatro tareas: La línea Gemini Omni Flash cubre conversión de texto a video, imagen a video, edición de video y referencia a video; Esta página expone únicamente la tarea de conversión de texto a vídeo.
  • Encuadre flexible: Admite formato horizontal 16:9 y retrato 9:16, con duraciones de 3 a 10 segundos.

Parámetros#


Las entradas coinciden con el esquema RunComfy OpenAPI Input para la tarea de conversión de texto a vídeo.


ParámetroObligatorioTipoPredeterminadoRango / OpcionesDescripción
prompt*Sí (*)string—Texto descriptivoPrompt del vídeo que se va a generar
aspect_ratioNostring16:916:9, 9:16Relación de aspecto del vídeo
durationNointeger83–10 (segundos)Duración del vídeo en segundos enteros

Precios#


La facturación se basa en la duración del clip generado:


  • Video: $0.13 por segundo de video generado.

Cómo utilizar#


  1. Escribe un mensaje descriptivo: describe el tema, la acción, el entorno, el estado de ánimo, la iluminación y la cámara. Las indicaciones detalladas le dan al modelo más con qué trabajar.
  2. Establezca el ritmo en palabras: solicite una única toma continua o un ritmo específico directamente en la indicación.
  3. Dirige el audio: solicita diálogo, sonido ambiental o música de fondo, o di no diálogo cuando quieras que esté en silencio.
  4. Agregue instrucciones negativas: incluya exclusiones en el mensaje, como no mostrar texto.
  5. Elija una relación de aspecto: elija 16:9 para paisaje o 9:16 para entrega vertical, orientada a dispositivos móviles.
  6. Establezca la duración: elija cualquier número entero de segundos entre 3 y 10.
  7. Generar y perfeccionar: revise el clip, luego ajuste la redacción, la proporción o la duración y ejecútelo nuevamente.

Consejos rápidos y de referencia#


  • Lidera con la cámara y el movimiento que desees (por ejemplo, empuje lento, cámara en mano o bloqueado).
  • Nombra el ambiente y la iluminación para que la escena se lea como deseas.
  • Mantenga una acción clara por clip; Las duraciones cortas recompensan las indicaciones centradas.
  • Detalla el paisaje sonoro cuando el audio importa, ya que el modelo puede generar audio sincronizado.
  • Utilice frases negativas simples (por ejemplo, sin texto en pantalla) en lugar de sugerencias vagas.
  • Si un resultado parece abarrotado, simplifique el mensaje y elimine las señales de estilo que compitan.

Cómo se compara Gemini Omni Flash con otros modelos#


  • En comparación con modelos anteriores de texto a video: Enfatiza el movimiento con reconocimiento de la física y el audio nativo sincronizado en un solo paso. Según la información disponible públicamente, compare según sus propias indicaciones.
  • En comparación con los generadores de video silenciosos: Incluye generación de audio, por lo que te saltas una etapa separada de partitura o diseño de sonido.
  • Dentro de su propia familia: La conversión de texto a vídeo es una de las cuatro tareas de esta familia; flujos de trabajo de destino de imagen a vídeo, edición de vídeo y referencia a vídeo que parten de medios existentes en lugar de texto únicamente.

Más modelos para probar#


  • Veo 3 Fast: conversión rápida de texto a vídeo con audio para borradores rápidos.
  • Seedance 2.5 — Vídeo cinematográfico multimodal con soporte de referencia.
  • Kling Video: generación de vídeo centrado en el movimiento.
  • Wan 2.5: alternativa de texto a vídeo de uso general.

Recursos oficiales#


  • Google DeepMind: https://deepmind.google/

Modelos relacionados

wan-2-1/text-to-video

Crea un vídeo con Wan 2.1 a partir de un prompt de texto y configura resolución, relación de aspecto, fotogramas, frecuencia y otras opciones.

happyhorse-1.1/text-to-video

Modelo de video con IA multimodal y audio nativo para generación desde texto, imágenes y referencias.

flux-3/keyframes-to-video/draft

FLUX 3 Draft Keyframes: vistas previas rápidas de vídeo con múltiples fotogramas clave a 720p

pikaswaps

Sustituye una zona seleccionada de un vídeo mediante una máscara o una descripción, con imagen y prompt opcionales.

sync/lipsync/v2/pro

Cree un video sincronizado con los labios a partir de las URL de audio y video requeridas, con cinco modos para manejar duraciones de entrada que no coinciden.

seedance-1.0/text-to-video

Crea un vídeo con Seedance 1.0 desde un prompt y elige resolución, relación de aspecto y duración.

Preguntas Frecuentes

¿Para qué se utiliza Gemini Omni Flash?

Gemini Omni Flash es el modelo de vídeo multimodal de Google que convierte un mensaje de texto en un clip cinematográfico corto con audio sincronizado. En esta página RunComfy, ejecuta la tarea de conversión de texto a video, lo que la hace adecuada para anuncios sociales, ritmos de historias y previsualizaciones rápidas donde tanto el movimiento como el sonido son importantes.

¿Qué tareas cubre la familia Gemini Omni Flash?

La familia Gemini Omni Flash abarca cuatro tareas relacionadas: texto a video, imagen a video, edición de video y referencia a video. Esta página RunComfy expone la tarea de texto a video, que genera un video solo a partir de un mensaje escrito, mientras que las otras tareas comienzan a partir de imágenes o metraje existentes.

¿Gemini Omni Flash genera audio con el vídeo?

Sí. Gemini Omni Flash produce audio sincronizado (como voz, efectos de sonido y música) alineado con la acción generada. Puede controlar el sonido desde el mensaje, por ejemplo pidiendo música de fondo tranquila o no especificando ningún diálogo.

¿Qué hace que el movimiento de Gemini Omni Flash parezca más natural?

Gemini Omni Flash se basa en el conocimiento del mundo real de Gemini y tiene una comprensión mejorada de la física, lo que le ayuda a mantener coherentes el movimiento, la iluminación y la interacción de los objetos en una toma. Esto reduce la deriva de cuadro a cuadro común en los modelos más antiguos de texto a video.

¿Qué límites de entrada debo conocer antes de usar Gemini Omni Flash?

La tarea de texto a video requiere un mensaje requerido, una relación de aspecto de 16:9 o 9:16 y una duración de entre 3 y 10 segundos. Verifique el panel de parámetros RunComfy actual para conocer los valores predeterminados exactos y los límites del lado del proveedor antes de generar.

¿Cómo debo escribir indicaciones para Gemini Omni Flash?

Sea descriptivo sobre el tema, la acción, la cámara, el estado de ánimo y la iluminación, y controle el ritmo directamente en el mensaje (por ejemplo, una única toma continua). Coloque exclusiones en el mensaje, como "no mostrar texto", ya que Gemini Omni Flash lee instrucciones negativas del mensaje.

¿Pueden los desarrolladores utilizar Gemini Omni Flash a través de la API RunComfy?

Sí. Puede crear un prototipo de Gemini Omni Flash en la interfaz de usuario del modelo RunComfy y luego llamar al mismo modelo a través de la API RunComfy con parámetros idénticos. Eso le permite pasar de una prueba de navegador a una generación automatizada sin alojar ni escalar el modelo usted mismo.

¿Cuánto cuesta generar con Gemini Omni Flash en RunComfy?

Las generaciones con Gemini Omni Flash se facturan a $0,13 por segundo de vídeo generado y retiran su saldo de crédito o dólares de RunComfy. Los nuevos usuarios suelen comenzar con una cantidad de prueba gratuita; consulte la sección Generación en esta página para obtener detalles actuales.

Síguenos
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Soporte
  • Discord
  • Correo electrónico
  • Estado del sistema
  • afiliado
Modelos de Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Ver todos los modelos →
Modelos de Imagen
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Ver todos los modelos →
Legal
  • Términos de servicio
  • Política de privacidad
  • Política de cookies
RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.

Ejemplos de Gemini Omni Flash

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...