logo
RunComfy
  • ComfyUI
  • TrainerNuovo
  • Modelli
  • API
  • Prezzi
discord logo
MODELLI
Esplora
Tutti i modelli
LIBRERIA
Generazioni
API DEI MODELLI
Documentazione API
Chiavi API
ACCOUNT
Utilizzo

Gemini Omni Flash: da testo a video con audio sincronizzato | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flash genera da un prompt brevi video cinematografici con audio nativo sincronizzato, nei formati 16:9 o 9:16 e con una durata di 3–10 secondi.

Descrivi il video da generare. Puoi controllare ritmo e audio direttamente nel prompt, ad esempio «in un’unica ripresa continua», «musica di sottofondo tranquilla» o «nessun dialogo», e aggiungere istruzioni negative come «non mostrare testo».
Proporzioni del video generato.
Durata del video generato, in secondi.
Idle
The rate is $0.13 per second of generated video.

Introduzione a Gemini Omni Flash

Gemini Omni Flash di Google trasforma un singolo prompt in una clip cinematografica di 3–10 secondi con audio sincronizzato. La conoscenza del mondo reale di Gemini aiuta a ottenere movimenti coerenti e fisicamente credibili. Invece di montare il video, progettare il suono e collegare più strumenti separatamente, team marketing, filmmaker, studi di videogiochi e creator social possono dirigere l’intero risultato con un prompt. Gemini Omni Flash si usa su RunComfy nel browser o tramite API HTTP, senza ospitare o scalare il modello.
Ideale per: Brevi annunci social | Momenti narrativi cinematografici | Previsualizzazione rapida

Google / Gemini Omni Flash#


Gemini Omni Flash è la famiglia di generazione video multimodale di Google, basata sulla conoscenza del mondo reale di Gemini e su una conoscenza più approfondita della fisica per movimenti e interazioni più credibili. La famiglia più ampia comprende quattro attività correlate: testo in video, immagine in video, editing video e riferimento a video. Questa pagina RunComfy esegue l'attività di conversione del testo in video, trasformando un messaggio scritto in una breve clip cinematografica con audio sincronizzato.


Poiché ragiona su come si comporta effettivamente il mondo, il modello mantiene gli oggetti, l'illuminazione e il movimento coerenti in un'inquadratura invece di spostarsi da un fotogramma all'altro.


In evidenza#


  • Audio sincronizzato nativo: genera parlato, effetti sonori e musica allineati all'azione, in modo che una clip sia pronta per essere condivisa senza un passaggio audio separato.
  • Movimento basato sulla fisica: una migliore comprensione fisica produce movimenti e interazioni con gli oggetti più stabili e naturali.
  • Basato su conoscenze reali: i risultati attingono alla conoscenza del mondo reale di Gemini, aiutando le scene a sembrare plausibili e in tema.
  • Controllo a livello di prompt: Ritmo diretto e suono direttamente dal prompt (ad esempio, un singolo scatto continuo, musica di sottofondo calma o nessun dialogo).
  • Famiglia a quattro attività: la linea Gemini Omni Flash copre testo in video, immagine in video, editing video e riferimento in video; questa pagina espone solo l'attività di conversione del testo in video.
  • Inquadratura flessibile: Supporta il formato 16:9 orizzontale e 9:16 verticale, con durate da 3 a 10 secondi.

Parametri#


Gli input corrispondono allo schema RunComfy OpenAPI Input per l'attività da testo a video.


ParametroObbligatorioTipoPredefinitoIntervallo / OpzioniDescrizione
prompt*Sì (*)string—Testo descrittivoPrompt del video da generare
aspect_ratioNostring16:916:9, 9:16Proporzioni del video
durationNointeger83–10 (secondi)Durata del video in secondi interi

Prezzi#


La fatturazione si basa sulla lunghezza del clip generato:


  • Video: $ 0,13 al secondo di video generato.

Come usare#


  1. Scrivi un messaggio descrittivo: descrivi soggetto, azione, ambientazione, umore, illuminazione e fotocamera. Le istruzioni dettagliate danno al modello il massimo con cui lavorare.
  2. Imposta il ritmo in parole: chiedi una singola ripresa continua o un ritmo specifico direttamente nel messaggio.
  3. Dirigi l'audio: richiedi dialoghi, suoni ambientali o musica di sottofondo oppure dì di no ai dialoghi quando vuoi che la situazione sia silenziosa.
  4. Aggiungi istruzioni negative: inserisci le esclusioni nel prompt stesso, ad esempio non mostrare il testo.
  5. Scegli le proporzioni: scegli 16:9 per il formato orizzontale o 9:16 per la visualizzazione verticale, con priorità ai dispositivi mobili.
  6. Imposta la durata: scegli un numero intero di secondi compreso tra 3 e 10.
  7. Genera e perfeziona: rivedi la clip, quindi regola il testo, le proporzioni o la durata ed esegui di nuovo.

Suggerimenti e suggerimenti di riferimento#


  • Guida con la videocamera e il movimento che desideri (ad esempio, push-in lento, palmare o bloccato).
  • Dai un nome all'atmosfera e all'illuminazione in modo che la scena venga interpretata come desideri.
  • Mantieni un'azione chiara per clip; brevi durate premiano i suggerimenti mirati.
  • Descrivi il paesaggio sonoro quando l'audio è importante, poiché il modello può generare audio sincronizzato.
  • Utilizzare semplici frasi negative (ad esempio, nessun testo sullo schermo) anziché suggerimenti vaghi.
  • Se un risultato sembra impegnativo, semplifica il suggerimento e rimuovi i segnali di stile concorrenti.

Confronta Gemini Omni Flash con altri modelli#


  • Rispetto ai precedenti modelli da testo a video: enfatizza il movimento basato sulla fisica e l'audio sincronizzato nativo in un unico passaggio. Sulla base delle informazioni disponibili al pubblico, confronta secondo le tue istruzioni.
  • Rispetto ai generatori di video muti: raggruppa la generazione audio, quindi salti una fase separata di colonna sonora o progettazione del suono.
  • All'interno della propria famiglia: La conversione da testo a video è uno dei quattro compiti di questa famiglia; flussi di lavoro target da immagine a video, editing video e riferimento a video che iniziano da media esistenti anziché solo dal testo.

Altri modelli da provare#


  • Veo 3 Fast: conversione rapida da testo a video con audio per bozze veloci.
  • Seedance 2.5 — Video multimodale cinematografico con supporto di riferimento.
  • Kling Video: generazione di video incentrati sul movimento.
  • Wan 2.5: alternativa generica da testo a video.

Risorse ufficiali#


  • Google DeepMind: https://deepmind.google/

Modelli correlati

pikaffects

Trasforma una singola immagine in un video applicando il Pikaffect che preferisci.

infinite-talk/image-to-video

Trasforma foto in video realistici con sincronizzazione labiale naturale

hailuo-2-3/fast/pro/image-to-video

Converti immagini in video 1080p realistici e dinamici, in pochi secondi

happyhorse-1.0/image-to-video

HappyHorse 1.0 I2V su Alibaba anima un'immagine fissa in un video nativo a 1080p con movimenti fisicamente accurati e soggetti con identità stabile.

hunyuan/video-to-video

Applica un nuovo stile a un video esistente con Tencent Hunyuan Video.

happyhorse-1.0/video-edit

HappyHorse 1.0 Video Edit su Alibaba modifica un video di input con istruzioni di testo e immagini di riferimento per il trasferimento di stile, la sostituzione locale e gli scambi di outfit.

Domande Frequenti

A cosa serve Gemini Omni Flash?

Gemini Omni Flash è il modello video multimodale di Google che trasforma un messaggio di testo in una breve clip cinematografica con audio sincronizzato. In questa pagina RunComfy esegue l'attività di conversione del testo in video, rendendola adatta per annunci social, ritmi di storie e previsualizzazione rapida in cui sia il movimento che il suono contano.

Quali attività copre la famiglia Gemini Omni Flash?

La famiglia Gemini Omni Flash comprende quattro attività correlate: testo in video, immagine in video, editing video e riferimento in video. Questa pagina RunComfy espone l'attività di conversione del testo in video, che genera un video solo da un messaggio scritto, mentre le altre attività iniziano da immagini o filmati esistenti.

Gemini Omni Flash genera audio con il video?

SÌ. Gemini Omni Flash produce audio sincronizzato, ad esempio parlato, effetti sonori e musica, allineato all'azione generata. Puoi gestire il suono dal prompt, ad esempio chiedendo una musica di sottofondo calma o specificando l'assenza di dialoghi.

Cosa rende il movimento di Gemini Omni Flash più naturale?

Gemini Omni Flash si basa sulla conoscenza del mondo reale di Gemini e ha una migliore comprensione della fisica, che lo aiuta a mantenere coerenti il movimento, l'illuminazione e l'interazione con gli oggetti in uno scatto. Ciò riduce la deriva da fotogramma a fotogramma comune nei vecchi modelli da testo a video.

Quali limiti di input dovrei conoscere prima di utilizzare Gemini Omni Flash?

L'attività di conversione del testo in video richiede un prompt richiesto, proporzioni 16:9 o 9:16 e una durata compresa tra 3 e 10 secondi. Controlla l'attuale pannello dei parametri RunComfy per le impostazioni predefinite esatte e gli eventuali limiti lato provider prima di generare.

Come dovrei scrivere i prompt per Gemini Omni Flash?

Descrivi il soggetto, l'azione, la fotocamera, l'atmosfera e l'illuminazione e controlla il ritmo direttamente nel prompt (ad esempio, un singolo scatto continuo). Inserisci le esclusioni nel prompt stesso, come "non mostrare il testo", poiché Gemini Omni Flash legge le istruzioni negative dal prompt.

Gli sviluppatori possono utilizzare Gemini Omni Flash tramite l'API RunComfy?

SÌ. Puoi prototipare Gemini Omni Flash nell'interfaccia utente del modello RunComfy e quindi chiamare lo stesso modello tramite l'API RunComfy con parametri identici. Ciò ti consente di passare da un test del browser alla generazione automatizzata senza ospitare o ridimensionare il modello da solo.

Quanto costa generare con Gemini Omni Flash su RunComfy?

Le generazioni con Gemini Omni Flash vengono fatturate a $ 0,13 al secondo di video generato e prelevano il saldo USD o credito di RunComfy. I nuovi utenti in genere iniziano con un importo di prova gratuito; vedere la sezione Generazione in questa pagina per i dettagli attuali.

Seguici
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Supporto
  • Discord
  • Email
  • Stato del Sistema
  • affiliato
Modelli Video
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Visualizza tutti i modelli →
Modelli Immagine
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Visualizza tutti i modelli →
Legale
  • Termini di Servizio
  • Informativa sulla Privacy
  • Informativa sui Cookie
RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.

Esempi di Gemini Omni Flash

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...