以 Veo 3.1 Fast 快速將文字或圖像轉為高質感影片,實現創意即時視覺化。
模型會同時讀取一張或多張參考影像與文字提示詞,生成含動作和聲音的電影感短片,並盡量保留參考圖中的主體、視覺風格和構圖。它屬於 Google Gemini Omni Flash 系列;該系列也支援文字轉影片和圖像轉影片,本頁面對應參考圖轉影片任務。
參考圖能固定主體身分與視覺方向,讓同一角色或產品從第一幀到最後一幀維持可辨識,減少在鏡頭中逐漸走樣的問題。
輸入參數與 RunComfy OpenAPI 中參考圖轉影片任務的 Input 架構一致。
| 參數 | 必填 | 類型 | 預設值 | 範圍 / 選項 | 說明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 描述性文字 | 指引動作、節奏、場景發展與音訊 |
| image_urls* | 是 (*) | array(影像 URI) | — | jpg, jpeg, png, webp | 一張或多張參考圖,用於指引主體、風格與構圖 |
| aspect_ratio | 否 | string | 16:9 | 16:9, 9:16 | 生成影片的長寬比 |
| duration | 否 | integer | 8 | 3–10(秒) | 生成影片的時長,以整秒設定 |
依生成影片的時長計費:
以 Veo 3.1 Fast 快速將文字或圖像轉為高質感影片,實現創意即時視覺化。
以首幀風格重塑整支影片,確保AI影像風格一致、創作更流暢。
使用 Sora 2 Pro 依文字提示詞生成影片,並選擇輸出尺寸與時長。
透過提示詞創作歌曲,支援 44.1 kHz WAV 輸出與分段編輯。
以每秒 $0.083,將圖片製作成 3–15 秒影片。
Kling V3.0 系列中具有最高視覺保真度的優質電影文字轉影片。
Gemini Omni Flash Reference to Video 接收一張或多張參考影像和文字提示詞,生成含同步音訊的短片。參考圖決定主體、風格和構圖,提示詞則控制動作、節奏、場景發展與聲音,讓畫面在保留參考特徵的同時動起來。
它適合在短片中維持角色、產品或品牌外觀一致,製作由參考圖引導的電影感鏡頭,以及根據現有視覺素材生成宣傳片。當主體形象和視覺方向需要貼近來源圖時,行銷人員、影視創作者、遊戲團隊和社群內容創作者常會使用 Gemini Omni Flash Reference to Video。
你可以提供一張或多張參考影像,支援 jpg、jpeg、png 和 webp 格式。使用 Gemini Omni Flash Reference to Video 時,可在提示詞中說明每張圖分別用於角色、服裝或環境等內容,從而明確其對結果的作用。具體輸入數量限制請以目前 RunComfy 參數面板為準。
模型會生成與影片同步的對白、環境音效和音樂。你可以在 Gemini Omni Flash Reference to Video 的提示詞中說明對白語氣或所需背景聲;如果需要安靜的短片,也可以明確要求「無對白」。
相較於只使用文字提示詞,參考圖能更好地固定主體形象、風格和構圖。在 Gemini Omni Flash Reference to Video 中,影像決定鏡頭的視覺基礎,提示詞控制鏡頭如何運動,因此很適合把既有角色或場景延續到短片中。
Gemini Omni Flash Reference to Video 支援 16:9 橫向和 9:16 直向,影片時長可按整秒設定為 3–10 秒。可用設定可能會調整,請以目前 RunComfy 參數面板為準。
可以。你可以先在 RunComfy 模型頁面中測試 Gemini Omni Flash Reference to Video,再使用相同參數透過 RunComfy HTTP API 呼叫模型,用於自動化和正式環境。這樣無需自行託管或擴展模型,即可從測試順利過渡到整合。
Gemini Omni Flash Reference to Video 依生成影片的時長計費,每秒 $0.14,費用從 RunComfy 帳戶的美元餘額或點數中扣除。新用戶通常可獲得試用額度,目前價格請查看本頁面的生成區域。
RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。





