画像とプロンプトから16:9動画を生成し、長さ、解像度、フレームレート、音声生成の有無を選べます。
LTX 2.5 Fast Audio To Video は、速度最適化モードで提供されたオーディオ ベッド (ダイアログ、音楽、または SFX) にピクチャー タイミングが従うクリップを構築します。オーディオ (2 ~ 20 秒) をアップロードし、オプションで開始画像とプロンプトを追加し、トラックに合わせて 1080p ビデオを生成します。オーディオからのカットを実行していない場合は、テキストからビデオへの高速ページまたは画像からビデオへの高速ページを使用します。
| 利点 | それはあなたにとって何を意味しますか |
|---|---|
| 音声主導のタイミング | 画像の長さとフレージングはアップロードされたクリップに従います。これは、ミュージック スポット、VO ショート、トラックロック広告に役立ちます。 |
| オプションのビジュアルアンカー | 開始画像を追加してアイデンティティや製品の外観をロックします。それを省略し、プロンプトのみを信頼してください。 |
| 高速プレビュー | 他の場所で重い最終レンダリングを行う前に、カットのアイデアを反復するための速度重視のモード。 |
| シンプルな配信管理 | アスペクト比 auto / 16:9 / 9:16、および迅速な遵守を強化するためのガイダンス スケール。 |
この LTX 2.5 Fast Audio To Video ページのコントロール:
| パラメータ | 必須 | タイプ | デフォルト | 範囲/オプション | 選び方 |
|---|---|---|---|---|---|
audio_url* | はい (*) | 音声 URL | サンプルクリップ | MP3、OGG、WAV、M4A、AAC; 2 ~ 20 秒 | 清潔なベッドを使用してください。出力の長さはこのクリップの後に続きます。 |
image_url | いいえ | 画像の URL | — | JPG、JPEG、PNG、WEBP、GIF、AVIF | アンカーのアイデンティティまたは製品。プロンプトのみを表示するには空のままにします。 |
プロンプト | 条件付き | 文字列 | プロンプトの例 | 最大 5,000 文字 | 画像が提供されない場合は必須です。音声に合わせて動きを説明します。 |
guidance_scale | いいえ | 番号 | 5 | 1–50 | 値が大きいほど、プロンプトに従います (プロバイダー側にイメージが存在する場合のデフォルトは 9 近くです)。 |
aspect_ratio | いいえ | 文字列 | auto | auto、16:9、9:16 | auto が存在する場合は画像の後に続きます。それ以外の場合は、デフォルトで 16:9 が使用されます。 |
LTX 2.5 Fast Audio To Video は 1080p で 入力音声 1 秒あたりに請求されます。
| 入力音声 | $0.14/秒の価格 |
|---|---|
| 5秒 | $0.70 |
| 10代 | $1.40 |
| 15秒 | $2.10 |
| 20代 | $2.80 |
バッチの場合、合計 ≈ audio_秒 × $0.14 × 出力カウント。
LTX 2.5 Fast Audio To Video に関するヒント:
guidance_scale を上げます。改善されたプロンプトの例
> 黒のタートルネックを着たボーカリストが、薄暗いブースでビンテージのリボンマイクに向かってヘッドフォンを付けて歌っています。ソフトなサイドキーライト、ボーカルのフレーズに合わせてゆっくり押し込みます。クリーンなスタジオのリアリズム、テキストや透かしはありません。
画像とプロンプトから16:9動画を生成し、長さ、解像度、フレームレート、音声生成の有無を選べます。
必要な音声 トラックを含む短い元動画を駆動し、感情、編集範囲、長さの不一致の動作、表現力を制御します。
高い視覚整合性とリアルな動きを備えた次世代映像生成AI
Pika 2.2でテキストプロンプトから高品質な動画を生成します。
スタイルタグと歌詞から、ボーカル入りの楽曲を最長4分まで生成。
スタイルタグと歌詞から、ボーカル入りの楽曲を最長4分まで生成。
LTX 2.5 Fast Audio To Video は、指定されたオーディオ クリップに合わせてビデオを生成します。音楽主導の短編、ダイアログ ティーザー、VO スポット、および音声に続いて画像を表示する必要があるトラックに合わせた広告に適しています。
オーディオ URL が必要です (2 ~ 20 秒、MP3、WAV、M4A、AAC、または OGG)。オプションの開始画像でアイデンティティをロックでき、プロンプトでモーションを説明できます。画像を指定しない場合はプロンプトが必要です。
生成はこのページの1080pに請求され、配信されます。クリップの長さは、別個の継続時間を制御するのではなく、入力オーディオの継続時間に従います。アスペクト比は、auto、16:9、または 9:16 です。
ガイダンス スケール (1 ~ 50、デフォルト 5) は、結果がプロンプトにどれだけ厳密に従うかを制御します。テキストが無視されている場合は、徐々に値を上げてください。値が非常に高いと、制約が過剰に見える可能性があります。
はい。オプションの image_url を最初のフレームとして追加して、オーディオがタイミングを制御しながら、フェイス、製品、またはパッケージのアイデンティティを安定させます。画像がない場合は、明確なプロンプトを頼りにしてください。
はい。 RunComfy Web UI で実行を構成し、automation の同じパラメーターを使用して、HTTP API 経由で同じ LTX 2.5 Fast Audio To Video モデルを呼び出します。
1080p では、入力音声 1 秒あたり 0.14 ドルが請求されます。たとえば、10 秒の音声の場合、出力ごとに 1.40 ドルかかります。世代ごとに USD/クレジットが消費されます。通常、新規ユーザーは無料試用版を受け取ります。
完成したミュージックベッド、VO、またはダイアログテイクでカットタイミングを設定する必要がある場合は、LTX 2.5 Fast Audio To Video を選択してください。プロンプトからサウンドと画像を組み合わせて作成する場合は、テキストからビデオへの高速変換を使用します。
RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。





