支援33種表情與400+動作,輕鬆創作具質感的人像短片
模型會同時讀取一張或多張參考影像與文字提示詞,生成含動作和聲音的電影感短片,並盡量保留參考圖中的主體、視覺風格和構圖。它屬於 Google Gemini Omni Flash 系列;該系列也支援文字轉影片和圖像轉影片,本頁面對應參考圖轉影片任務。
參考圖能固定主體身分與視覺方向,讓同一角色或產品從第一幀到最後一幀維持可辨識,減少在鏡頭中逐漸走樣的問題。
輸入參數與 RunComfy OpenAPI 中參考圖轉影片任務的 Input 架構一致。
| 參數 | 必填 | 類型 | 預設值 | 範圍 / 選項 | 說明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 描述性文字 | 指引動作、節奏、場景發展與音訊 |
| image_urls* | 是 (*) | array(影像 URI) | — | jpg, jpeg, png, webp | 一張或多張參考圖,用於指引主體、風格與構圖 |
| aspect_ratio | 否 | string | 16:9 | 16:9, 9:16 | 生成影片的長寬比 |
| duration | 否 | integer | 8 | 3–10(秒) | 生成影片的時長,以整秒設定 |
依生成影片的時長計費:
支援33種表情與400+動作,輕鬆創作具質感的人像短片
只要一段提示詞,即可將靜態照片變成流暢的 720P 或 1080P 影片。
為單張圖片套用所選的 Pikaffect 特效,並將結果生成影片。
將靜態圖像轉化為富有表現力的動態短片,並生成同步音訊。
使用 Hailuo 02 Pro 根據一段必填文字提示詞生成 6 秒影片,並可選擇提示詞擴寫。
以照片生成自然對話影片,呈現真實臉部動作與表情
Gemini Omni Flash Reference to Video 接收一張或多張參考影像和文字提示詞,生成含同步音訊的短片。參考圖決定主體、風格和構圖,提示詞則控制動作、節奏、場景發展與聲音,讓畫面在保留參考特徵的同時動起來。
它適合在短片中維持角色、產品或品牌外觀一致,製作由參考圖引導的電影感鏡頭,以及根據現有視覺素材生成宣傳片。當主體形象和視覺方向需要貼近來源圖時,行銷人員、影視創作者、遊戲團隊和社群內容創作者常會使用 Gemini Omni Flash Reference to Video。
你可以提供一張或多張參考影像,支援 jpg、jpeg、png 和 webp 格式。使用 Gemini Omni Flash Reference to Video 時,可在提示詞中說明每張圖分別用於角色、服裝或環境等內容,從而明確其對結果的作用。具體輸入數量限制請以目前 RunComfy 參數面板為準。
模型會生成與影片同步的對白、環境音效和音樂。你可以在 Gemini Omni Flash Reference to Video 的提示詞中說明對白語氣或所需背景聲;如果需要安靜的短片,也可以明確要求「無對白」。
相較於只使用文字提示詞,參考圖能更好地固定主體形象、風格和構圖。在 Gemini Omni Flash Reference to Video 中,影像決定鏡頭的視覺基礎,提示詞控制鏡頭如何運動,因此很適合把既有角色或場景延續到短片中。
Gemini Omni Flash Reference to Video 支援 16:9 橫向和 9:16 直向,影片時長可按整秒設定為 3–10 秒。可用設定可能會調整,請以目前 RunComfy 參數面板為準。
可以。你可以先在 RunComfy 模型頁面中測試 Gemini Omni Flash Reference to Video,再使用相同參數透過 RunComfy HTTP API 呼叫模型,用於自動化和正式環境。這樣無需自行託管或擴展模型,即可從測試順利過渡到整合。
Gemini Omni Flash Reference to Video 依生成影片的時長計費,每秒 $0.14,費用從 RunComfy 帳戶的美元餘額或點數中扣除。新用戶通常可獲得試用額度,目前價格請查看本頁面的生成區域。
RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。





