Modèle vidéo IA multimodal avec audio natif pour les entrées texte, image et référence.
Le tableau ci-dessous liste les contrôles du tool Seedance 2.5 Reference to Video 720p sur cette page.
| Paramètre | Obligatoire | Type | Par défaut | Plage / Options | Comment choisir |
|---|---|---|---|---|---|
prompt* | Oui (*) | String | Prompt d’exemple | Chinois ~≤500 caractères ou anglais ~≤1000 mots recommandé | Décrivez l’action et la caméra ; les références ancrent identité, mouvement et ambiance. |
images | Non | Array (URL d’images) | Image d’exemple | jusqu’à 9 | jpeg, png, webp, bmp, tiff, gif ; guident identité et style. |
videos | Non | Array (URL de vidéos) | [] | jusqu’à 3 | mp4, mov ; ~2–15 s chacun ; portent le mouvement de caméra et le rythme. |
audios | Non | Array (URL audio) | [] | jusqu’à 3 | wav, mp3 ; ~2–15 s, moins de 15 Mo ; fixent l’ambiance. |
aspect_ratio | Non | String | 16:9 | 16:9, 9:16, 1:1, 4:3, 3:4, 21:9, adaptive | Adaptez le cadre de destination ; adaptive laisse le modèle choisir le ratio le plus proche. |
duration | Non | Integer | 5 | 4–30 secondes, par pas de 1 seconde | Clips courts pour une seule action ; plus longs seulement si le prompt a un arc clair. |
generate_audio | Non | Boolean | true | true / false | Laissez activé pour parole, effets et musique synchronisés ; désactivez pour une vidéo muette. |
\* Champ obligatoire. Seul le prompt est requis ; les références sont facultatives mais recommandées pour des résultats cohérents.
Le tarif est de $0.306 par seconde sans vidéo de référence, et $0.187 par seconde avec une vidéo de référence.
Modèle vidéo IA multimodal avec audio natif pour les entrées texte, image et référence.
Créez des vidéos réalistes à partir d’images avec fluidité et style.
FLUX 3 Draft Extend : brouillons de suite de clips rapides et à faible coût à 720p
Texte-vidéo cinématographique haut de gamme avec la plus haute fidélité visuelle de la famille Kling V3.0.
Prolongez un morceau au début, à la fin ou des deux côtés en respectant son style.
Générez une vidéo de 5, 10 ou 15 secondes à partir d'une invite de texte, avec une source audio en option et des commandes pour la taille, la structure du plan, l'invite négative, la graine, l'expansion de l'invite et l'audio généré.
Il guide un clip 720p avec des images de référence et de la vidéo ou de l'audio en option, gardant ainsi l'identité, la garde-robe et le style cohérents. Il s'adapte aux vidéos de personnages cohérents, aux clips de référence de produits et aux vidéos de marque au style verrouillé.
Vous joignez du matériel de référence (jusqu'à 9 images, 3 courtes vidéos et 3 clips audio) et décrivez la prise de vue dans l'invite. Les références ancrent l’identité, la garde-robe, le style, le mouvement et le son, tandis que l’invite guide l’action et la caméra. Seule l'invite est strictement requise.
Jusqu'à 9 images de référence, 3 vidéos de référence et 3 fichiers audio de référence (vidéos et audio de référence d'environ 2 à 15 secondes chacun ; audio de moins de 15 Mo). La durée est un nombre entier de secondes compris entre 4 et 30 (par défaut 5). Le rapport hauteur/largeur peut être 16:9 (par défaut), 9:16, 1:1, 4:3, 3:4, 21:9 ou adaptatif. La sortie est fixée à 720p.
Non. Il peut être exécuté uniquement à partir d’une invite de texte et d’images. Ajoutez de courtes vidéos ou audio de référence lorsque vous souhaitez des conseils plus précis en matière de mouvement ou d'humeur.
Oui. generate_audio est activé par défaut, le modèle peut donc produire des paroles, des effets et de la musique synchronisés. Désactivez-le lorsque vous n'avez besoin que d'une vidéo silencieuse.
Oui. Prototypez dans l'interface utilisateur du modèle RunComfy, puis appelez le même modèle via l'API avec les champs correspondants (prompt, images, videos, audios, aspect_ratio, duration, generate_audio). Les générations consomment des crédits dans les deux sens.
Sans vidéo de référence : prix total = durée de sortie × $0.306. Avec vidéo de référence : prix total = (durée de la vidéo de référence + durée de sortie) × $0.187. Exemple : 10s de référence + 10s de sortie = 20s × $0.187 = $3.74. Les références images et audio ne sont pas facturées.
Les deux partagent le même chemin guidé par référence et la même fenêtre de 4 à 30 secondes ; cette page sort à 720p. Pour des brouillons moins chers et plus rapides, utilisez la page de référence à la vidéo 480p.
RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.





