logo
RunComfy
  • ComfyUI
  • 訓練器新
  • 模型
  • API
  • 定價
discord logo
模型
探索
所有模型
資源庫
生成記錄
模型 API
API 文檔
API 金鑰
帳戶
使用情況

Gemini Omni Flash:支援同步音訊的文字生成影片模型 | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flash 可根據文字提示詞產生帶原生同步音訊的電影級短片,支援16:9或9:16畫幅以及3–10秒時長。

描述希望產生的影片。你可以直接在提示詞中控制節奏和音訊,例如「單一連續鏡頭」「加入舒緩的背景音樂」或「無對白」,也可以加入「不顯示文字」等排除指令。
產生影片的寬高比。
產生影片的時長,以秒為單位。
Idle
The rate is $0.13 per second of generated video.

Gemini Omni Flash 簡介

Google 的 Gemini Omni Flash 可將一條文字提示詞轉化為3–10秒、帶同步音訊的電影級影片。模型利用 Gemini 對現實世界的理解,讓動作和物體互動更加連貫、符合物理規律。行銷人員、影視創作者、遊戲團隊和社群內容創作者無須再分別剪輯影片、設計聲音並串聯多個工具,只要透過一條提示詞即可同時控制畫面與音訊。Gemini Omni Flash 可直接在 RunComfy 瀏覽器介面或透過 HTTP API 使用,無須自行託管和擴縮模型。
適合場景:短影音廣告 | 電影感故事片段 | 快速影視預演

Google / Gemini Omni Flash#


Gemini Omni Flash 是 Google 的多模態影片生成模型系列,結合 Gemini 對現實世界的理解和更強的物理規律推理,讓動作與物體互動更可信。該系列涵蓋文字生成影片、圖片生成影片、影片編輯和參考素材生成影片四類任務;本 RunComfy 頁面提供的是文字生成影片任務,可根據一條文字提示詞產生帶同步音訊的電影級短片。


模型能理解現實世界中的運動方式,因此更容易在同一鏡頭內維持物體、光線和動作連貫,減少逐格漂移。


主要特色#


  • 原生同步音訊: 依畫面動作同步產生語音、音效和音樂,無須再單獨製作音軌。
  • 符合物理規律的動作: 更強的物理理解可帶來更穩定、自然的動作與物體互動。
  • 以現實知識為基礎: 利用 Gemini 的現實世界知識,讓場景更合理、更貼合主題。
  • 提示詞層級控制: 可直接在提示詞中控制節奏和聲音,例如單一連續鏡頭、舒緩背景音樂或無對白。
  • 四類任務: Gemini Omni Flash 系列涵蓋文字生成影片、圖片生成影片、影片編輯和參考素材生成影片;本頁面僅提供文字生成影片。
  • 靈活畫幅: 支援16:9橫向和9:16直向,時長可設為3–10秒。

參數#


輸入項目與文字生成影片任務的 RunComfy OpenAPI Input schema 保持一致。


參數必填類型預設值範圍 / 選項說明
prompt*是 (*)string—描述性文字要產生影片的文字提示詞
aspect_ratio否string16:916:9, 9:16產生影片的寬高比
duration否integer83–10(秒)產生影片的整數秒時長

價格#


依生成影片的時長計費:


  • 影片: $0.13/秒。

使用方法#


  1. 編寫清楚的提示詞 — 描述主體、動作、環境、氛圍、光線和鏡頭。細節越明確,模型越容易準確理解。
  2. 用文字控制節奏 — 可直接要求單一連續鏡頭或指定動作節奏。
  3. 指定音訊 — 描述對白、環境聲或背景音樂;需要安靜畫面時可明確寫「無對白」。
  4. 加入排除指令 — 在提示詞中直接寫明「不顯示文字」等不希望出現的內容。
  5. 選擇寬高比 — 橫向內容選擇16:9;行動裝置優先的直向內容選擇9:16。
  6. 設定時長 — 選擇3–10秒之間的任意整數。
  7. 產生並最佳化 — 查看結果後,調整提示詞、寬高比或時長,再次產生。

提示詞建議#


  • 先說明想要的鏡頭和運動方式,例如緩慢推近、手持拍攝或固定機位。
  • 明確氛圍與光線,讓場景呈現符合預期。
  • 每個短片聚焦一個清楚動作;較短時長更適合重點明確的提示詞。
  • 如果聲音很重要,請具體描述聲景,因為模型可以產生同步音訊。
  • 使用「不要出現畫面文字」等直接的排除表達,避免含糊暗示。
  • 如果結果過於雜亂,可簡化提示詞,移除互相衝突的風格要求。

Gemini Omni Flash 與其他模型的差異#


  • 與早期文字生成影片模型相比: 更強調符合物理規律的動作,並能一步產生原生同步音訊。建議使用自己的提示詞進行比較。
  • 與無聲影片生成器相比: 已整合音訊生成,可省去單獨配樂和聲音設計環節。
  • 在同系列中: 文字生成影片只是四類任務之一;圖片生成影片、影片編輯和參考素材生成影片則從既有媒體開始創作。

其他可嘗試的模型#


  • Veo 3 Fast — 適合快速草稿、支援音訊的高速文字生成影片模型。
  • Seedance 2.5 — 支援參考素材的電影級多模態影片模型。
  • Kling Video — 強調動作表現的影片生成模型。
  • Wan 2.5 — 通用文字生成影片替代方案。

官方資源#


  • Google DeepMind: https://deepmind.google/

相關模型

kling-video-o3/4K/text-to-video

電影感 4K 文字轉影片,輸出每秒 $0.42。

one-to-all-animation/14b

將驅動影片中的動作遷移到參考角色圖片,並可調整提示詞、解析度、推理步數、圖片引導與姿態引導。

wan-2-6/flash/image-to-video

將靜態影像變成動作自然、對白同步且創作可控的逼真影片場景。

ace-step-1.5/text-to-audio

根據風格標籤和歌詞生成最長 4 分鐘、帶人聲的歌曲。

kling-video-o3/standard/image-to-video

以每秒 $0.084,將圖片製作成 3–15 秒影片。

luma-ray-2/text-to-video

根據必填文字提示詞產生影片。可選擇六種長寬比、`540p`/`720p`/`1080p`、`5` 秒/`9` 秒,以及是否循環播放。

常見問題

Gemini Omni Flash 適合做什麼?

Gemini Omni Flash 是 Google 的多模態影片模型,可將文字提示詞轉化為帶同步音訊的電影級短片。本 RunComfy 頁面提供文字生成影片任務,適合同時重視畫面動作和聲音的社群廣告、故事片段與快速影視預演。

Gemini Omni Flash 系列涵蓋哪些任務?

該系列涵蓋文字生成影片、圖片生成影片、影片編輯和參考素材生成影片四類任務。本頁面提供的是僅根據文字提示詞產生影片的任務,其他任務則從既有圖片或影片素材開始。

Gemini Omni Flash 會隨影片一起產生音訊嗎?

會。模型可產生與畫面動作同步的語音、音效和音樂。你可以直接在提示詞中控制聲音,例如要求舒緩背景音樂或指定「無對白」。

為什麼 Gemini Omni Flash 的動作更自然?

Gemini Omni Flash 結合了 Gemini 對現實世界的理解與更強的物理規律推理,有助於在同一鏡頭中維持動作、光線和物體互動連貫,減少早期文字生成影片模型常見的逐格漂移。

使用 Gemini Omni Flash 前需要了解哪些輸入限制?

文字生成影片任務必須提供 prompt,寬高比可選16:9或9:16,時長範圍為3–10秒。生成前請查看 RunComfy 目前參數面板,確認預設值和服務商端的最新限制。

Gemini Omni Flash 的提示詞應該怎麼寫?

請清楚描述主體、動作、鏡頭、氛圍和光線,並在提示詞中直接控制節奏,例如要求單一連續鏡頭。不希望出現的內容也應明確寫出,例如「不顯示文字」。

開發者能否透過 RunComfy API 使用 Gemini Omni Flash?

可以。你可以先在 RunComfy 模型介面中測試,再透過 RunComfy API 使用相同參數呼叫模型,從瀏覽器原型快速轉向自動化生成,無須自行託管或擴縮模型。

在 RunComfy 使用 Gemini Omni Flash 需要多少費用?

Gemini Omni Flash 依生成影片時長收費,價格為 $0.13/秒,並從 RunComfy 帳戶餘額中扣除。新使用者通常會獲得試用額度;最新資訊請以本頁面生成區域為準。

關注我們
  • 領英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 電子郵件
  • 系統狀態
  • 附屬
視頻模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
影像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服務條款
  • 隱私政策
  • Cookie 政策
RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。

Gemini Omni Flash 範例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...