logo
RunComfy
  • ComfyUI
  • トレーナー新着
  • モデル
  • API
  • 価格
discord logo
モデル
探索
すべてのモデル
ライブラリ
生成履歴
モデルAPI
APIドキュメント
APIキー
アカウント
使用量

Gemini Omni Flash:同期音声対応のテキスト動画生成 | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flashは、テキストプロンプトからネイティブ同期音声付きの短いシネマティック動画を生成します。16:9と9:16、3~10秒の長さに対応します。

生成したい動画を記述します。プロンプト内で「1つの連続ショット」「穏やかなBGM」「台詞なし」のようにテンポや音を指定でき、「画面に文字を表示しない」といったネガティブ指示も追加できます。
生成する動画のアスペクト比です。
生成する動画の長さを秒単位で指定します。
Idle
The rate is $0.13 per second of generated video.

Gemini Omni Flash の概要

GoogleのGemini Omni Flashは、1つのテキストプロンプトから同期音声付きの3~10秒のシネマティック動画を生成します。Geminiが持つ現実世界の知識を生かし、動きや物体の相互作用を一貫した物理的に自然なものにします。動画編集、サウンド制作、複数ツールの連携を個別に行う代わりに、マーケティング、映像制作、ゲーム開発、SNS制作のチームが1つのプロンプトで映像と音をまとめて指示できます。RunComfyではブラウザまたはHTTP APIから利用でき、モデルを自前でホストしたりスケールしたりする必要はありません。
おすすめ用途:短尺SNS広告 | シネマティックな物語のワンシーン | 素早いプリビズ

Google / Gemini Omni Flash#


Gemini Omni Flash は、Google のマルチモーダル 動画生成ファミリーであり、Gemini の実世界の知識と物理学のより強力な把握に基づいて構築されており、より本物らしい動きとインタラクションを実現します。より広いファミリーは、テキスト動画生成、画像からの動画生成、動画編集、および動画への参照という 4 つの関連タスクにまたがります。この RunComfy ページはテキストから動画へのタスクを実行し、書かれたプロンプトを同期音声を含む短い映画のようなクリップに変換します。


モデルは世界が実際にどのように動作するかを推論するため、オブジェクト、照明、動きがフレームからフレームへと流れるのではなく、ショット全体で一貫した状態を保ちます。


ハイライト#


  • ネイティブ同期音声: アクションに合わせてスピーチ、効果音、音楽を生成するため、別の音声 パスを必要とせずにクリップを共有できるようになります。
  • 物理を意識したモーション: 物理的理解の向上により、より安定した、より自然な動きとオブジェクトの相互作用が生み出されます。
  • 現実の知識に基づいている: 出力はジェミニの実世界の知識に基づいており、シーンがもっともらしく、話題に沿っていると感じられるようにします。
  • プロンプト レベルのコントロール: プロンプトから直接ペーシングとサウンドを直接出力します (たとえば、単一の連続ショット、穏やかなバックグラウンド ミュージック、または対話なし)。
  • 4 つのタスク ファミリー: Gemini Omni Flash のラインナップは、テキストから動画へ、画像から動画へ、動画編集、および参照から動画をカバーします。このページでは、テキストから動画へのタスクのみを公開します。
  • 柔軟なフレーミング: 16:9 の風景と 9:16 の肖像画をサポートしており、持続時間は 3 ~ 10 秒です。

パラメータ#


入力は、テキストから動画へのタスクの RunComfy OpenAPI Input スキーマと一致します。


パラメーター必須型初期値範囲 / 選択肢説明
prompt*はい (*)string—説明文生成する動画のテキストプロンプト
aspect_ratioいいえstring16:916:9, 9:16動画のアスペクト比
durationいいえinteger83~10(秒)動画の長さ(整数秒)

価格設定#


料金は、生成されたクリップの長さに基づいて計算されます。


  • 動画: 生成された動画は 1 秒あたり 0.13 ドル。

使用方法#


  1. 説明的なプロンプトを作成します — 被写体、アクション、設定、雰囲気、照明、カメラについて説明します。詳細なプロンプトにより、モデルを最大限に活用できます。
  2. 言葉でペースを設定 — プロンプトで直接、単一の連続ショットまたは特定のリズムを要求します。
  3. 音声を指示 — 会話、環境音、または BGM をリクエストするか、静かにしたい場合は会話をしないと言います。
  4. 否定的な指示を追加 — テキストを表示しないなど、プロンプト自体に除外項目を追加します。
  5. アスペクト比を選択します — 横長の場合は 16:9、縦長のモバイルファースト配信の場合は 9:16 を選択します。
  6. 動画の長さを設定 — 3 ~ 10 の整数秒を選択します。
  7. 生成と調整 — クリップを確認し、文言、比率、または長さを調整して、再度実行します。

プロンプトとリファレンスのヒント#


  • 必要なカメラとモーションを使用してリードします (ゆっくりと押し込む、手持ち、ロックオフなど)。
  • シーンが意図したとおりに表示されるように、ムードと照明に名前を付けます。
  • クリップごとに 1 つの明確なアクションを保持します。短い期間では、焦点を絞ったプロンプトに報酬を与えます。
  • このモデルは同期した音声を生成できるため、音声が重要な場合はサウンドスケープを詳しく説明します。
  • 曖昧なヒントではなく、単純な否定的な表現 (画面上にテキストを表示しないなど) を使用します。
  • 結果が複雑に感じられる場合は、プロンプトを簡素化し、競合するスタイル キューを削除します。

Gemini Omni Flash と他のモデルとの比較#


  • 以前のテキストから動画へのモデルとの比較: 物理を意識したモーションとネイティブの同期音声を 1 ステップで強調します。公開されている情報に基づいて、独自のプロンプトで比較してください。
  • サイレント 動画 ジェネレーターとの比較: 音声生成がバンドルされているため、別のスコアリングやサウンド デザインの段階を省略できます。
  • 独自のファミリー内: テキスト動画生成は、このファミリーの 4 つのタスクのうちの 1 つです。画像からの動画生成、動画編集、および動画への参照ターゲットのワークフローは、テキストだけではなく既存のメディアから開始されます。

さらに試してみたいモデル#


  • Veo 3 Fast — 音声付きのテキストを動画に高速変換し、素早いドラフトを実現します。
  • Seedance 2.5 — リファレンスをサポートする映画のようなマルチモーダル 動画。
  • Kling Video — モーションに焦点を当てた動画生成。
  • Wan 2.5 — 汎用のテキストから動画への代替手段。

公式リソース#


  • Google DeepMind: https://deepmind.google/

関連モデル

kling-1-6/pro/image-to-video

画像を滑らかに動画化。Kling 1.6 Proが実現する高品質なAI映像制作。

wan-2-1/text-to-video

Wan 2.1でテキストプロンプトから動画を生成し、解像度、アスペクト比、フレーム数、フレームレートなどを設定します。

kling-2-1/master/image-to-video

静止画像やテキストをリアルな3D映像に変換する高精細ビデオ生成ツール。

seedance-2.5/text-to-video/480p

Seedance 2.5 480p: プロンプトからの高速かつ低コストのテキストからビデオへのドラフト

pikaswaps

マスクまたは範囲の説明を使って動画内の選択範囲を置き換え、必要に応じて画像やプロンプトを追加します。

video-background-removal/video-to-video

動画内の人物や物体を背景から分離し、コーデック、輪郭調整、被写体タイプを設定できます。

よくある質問

Gemini Omni Flashは何に使えますか?

テキストプロンプトから、音声付きの短い動画を生成するGoogleのマルチモーダル動画モデルです。このページではテキスト動画生成を利用でき、映像と音の両方が重要なSNS広告、短い物語、プリビズなどに向いています。

Gemini Omni Flashファミリーにはどのような機能がありますか?

テキスト動画生成、画像動画生成、動画編集、参照素材を使った動画生成の4種類があります。このページで利用できるのはテキスト動画生成で、画像や既存動画を入力せず、文章だけから動画を作ります。

動画と一緒に音声も生成されますか?

はい。映像の動きに合わせて、セリフ、効果音、音楽などの音声も生成します。「穏やかなBGM」「セリフなし」のように、プロンプトで音の内容を指定できます。

自然な動きを作りやすいのはなぜですか?

Geminiの実世界に関する知識と物理的な動きの理解を活用し、1つのショット内で動き、照明、物体同士の関係を保つよう設計されています。そのため、フレーム間で被写体や動きがずれる現象を抑えやすくなっています。

入力時に確認すべき制限は?

promptは必須です。アスペクト比は16:9または9:16、動画の長さは3~10秒です。生成前に、RunComfyの設定画面で現在のデフォルト値とプロバイダー側の制限も確認してください。

プロンプトはどのように書けばよいですか?

被写体、動作、カメラワーク、雰囲気、照明を具体的に記述し、「途切れないワンショット」のように展開の速さや撮り方も指定します。表示したくない内容がある場合は、「文字を表示しない」のようにプロンプト内で明記してください。

RunComfy APIから利用できますか?

はい。まずRunComfyのモデル画面でプロンプトと設定を試し、その後は同じモデルとパラメーターをRunComfy APIから呼び出せます。モデルを自前でホストせずに、ブラウザーでの検証から自動生成へ移行できます。

RunComfyでの生成料金はいくらですか?

Gemini Omni Flashは、生成動画1秒あたり$0.13です。料金はRunComfyのUSDまたはクレジット残高から差し引かれます。最新の料金や試用枠は、このページの「Generation」欄で確認してください。

フォローする
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
サポート
  • Discord
  • メール
  • システムステータス
  • アフィリエイト
ビデオモデル
  • Seedance 2.5 Reference to Video 1080p
  • Seedance 2.5 1080p Text to video
  • Seedance 2.5 1080p
  • MiniMax H3 Open
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • すべてのモデルを見る →
画像モデル
  • Qwen Image 3.0 Edit
  • Qwen Image 3.0 Pro Edit
  • Qwen Image 3.0
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • すべてのモデルを見る →
法的情報
  • 利用規約
  • プライバシーポリシー
  • Cookieポリシー
RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。

Gemini Omni Flash の例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...