從文字提示快速生成具對話和音效的動態短片
輸入一張圖片和文字指令,模型即可將靜態畫面生成含聲音的電影感短片。它屬於 Google Gemini Omni Flash 系列;該系列還支援文字轉影片、影片編輯和參考圖轉影片,本頁面對應圖像轉影片任務。
模型會結合對現實世界和物理規律的理解來推斷動態,因此從第一幀開始,主體與場景的變化更連貫,不易在播放過程中出現漂移或變形。
輸入參數與 RunComfy OpenAPI 中圖像轉影片任務的 Input 架構一致。
| 參數 | 必填 | 類型 | 預設值 | 範圍 / 選項 | 說明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 描述性文字 | 描述輸入影像應如何移動或變化 |
| image_url* | 是 (*) | string(影像 URI) | — | jpg, jpeg, png, webp | 要製作動畫的靜態影像 |
| aspect_ratio | 否 | string | 16:9 | 16:9, 9:16 | 生成影片的長寬比 |
| duration | 否 | integer | 8 | 3–10(秒) | 生成影片的時長,以整秒設定 |
依生成影片的時長計費:
從文字提示快速生成具對話和音效的動態短片
依照提示詞將現有影片延長 7 秒,以 720p 輸出,並可選擇是否產生音訊。
根據必填影片 URL 和音訊 URL 建立口型同步影片,並可從五種模式中選擇音影片時長不一致的處理方式。
將第一幀圖像動畫化為 768p 或 2K 視頻,最長 15 秒
FLUX 3 Draft Extend: 720p 的快速低成本剪輯延續草稿
根據提示詞重做現有影片中的指定片段,並可選擇替換音訊、畫面或同時替換兩者。
Gemini Omni Flash Image to Video 接收一張靜態影像和一段文字提示詞,將畫面生成含同步音訊的短片。模型會推斷主體與場景的自然動態,因此無需分別製作動畫和音軌,就能把單幀畫面變成有動作、有聲音的鏡頭。
它適合把靜態照片製作成社群媒體短片、根據參考圖測試鏡頭運動與節奏,以及快速驗證視聽概念。創作者、行銷人員、影視和遊戲團隊常用 Gemini Omni Flash Image to Video 先探索動作與氛圍,再投入完整製作。
模型會生成與畫面同步的對白、環境音效和音樂。你可以在 Gemini Omni Flash Image to Video 的提示詞中說明對白語氣或所需背景聲;如果需要安靜的短片,也可以明確要求「無對白」。
以上傳影像作為起點,相較於只使用文字提示詞,更容易固定開場構圖和主體形象。在 Gemini Omni Flash Image to Video 中,靜態圖決定畫面外觀,提示詞控制場景如何運動,因此特別適合已經有明確起始畫面的情況。
Gemini Omni Flash Image to Video 支援 16:9 橫向和 9:16 直向,影片時長可按整秒設定為 3–10 秒。可用設定可能會調整,請以目前 RunComfy 參數面板為準。
你需要提供一張輸入影像,以及描述運動方式的文字提示詞。支援的影像格式包括 jpg、jpeg、png 和 webp。部分限制可能會隨服務供應商的設定變化,未在此處列出的要求請以 RunComfy 參數面板為準。
可以。你可以先在 RunComfy 模型頁面中測試 Gemini Omni Flash Image to Video,再使用相同參數透過 RunComfy HTTP API 呼叫模型,用於自動化和正式環境。這樣無需自行託管或擴展模型,即可從測試順利過渡到整合。
Gemini Omni Flash Image to Video 依生成影片的時長計費,每秒 $0.14,費用從 RunComfy 帳戶的美元餘額或點數中扣除。新用戶通常可獲得試用額度,目前價格請查看本頁面的生成區域。
RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。





