logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

Wan 2.2 S2V : Générateur de parole en vidéo | RunComfy

wan-ai/wan-2-2/speech-to-video

Combinez une image et un fichier audio pour créer une vidéo de personnage parlant, chantant ou jouant en 480P ou 720P.

Image JPG, JPEG, PNG, BMP ou WEBP requise. La largeur et la hauteur doivent chacune dépasser 400 pixels sans excéder 7 000 pixels.
0:00
0:00
Audio WAV ou MP3 requis inférieur à 20 secondes et inférieur à 15 Mo.
Choisissez le mode parole, chant ou performance ; valeur par défaut : parole.
Choisissez une sortie 480P ou 720P ; par défaut : 480P.
Idle
The rate is $0.10 per second for 480P, and $0.20 per second for 720P.

Présentation de Wan 2.2 S2V

Wan 2.2 S2V transforme une image fixe et une piste audio obligatoires en une vidéo de personnage. Sélectionnez le mode parole, chant ou performance en fonction de l’enregistrement, puis choisissez la résolution 480P ou 720P. Les champs image et audio imposent des limites de format, de dimensions, de durée et de taille de fichier.

Fonctionnalités de Wan 2.2 S2V

Entrée image et audio

Créez une vidéo à partir d'une image requise et d'un fichier audio requis, sans invite de texte.

Mouvement des personnages piloté par l'audio

Utilisez l'enregistrement pour piloter une vidéo de personnage, avec un mode sélectionné pour la parole, le chant ou une performance plus large.

Trois modes d’animation

Choisissez parole pour les dialogues, chant pour les voix ou performance pour une animation plus générale du personnage ; parole est la valeur par défaut.

Deux résolutions de sortie

Générez à 480P par défaut ou sélectionnez 720P lorsqu'une résolution de sortie plus élevée est nécessaire.

Wan 2.2 S2V actualités et exemples sur X

Modèles associés

wan-2-1/image-to-video

Transformez vos images en vidéos réalistes avec mouvement fluide.

wan-2-2/fun-camera

Animez une image requise à partir d’une invite requise. Contrôlez la taille de sortie, le nombre d’images, la vitesse de lecture, la force de mouvement de la caméra, la graine, les étapes, le guidage et le décalage.

pixverse-c1/reference-to-video

Guide des clips cinématographiques avec jusqu'à sept images et des instructions précises.

veo-3-1/extend-video

Prolongez une vidéo existante de 7 secondes en 720p, avec guidage par prompt et génération audio facultative.

ace-step/text-to-audio

Générez à partir de tags des morceaux chantés avec paroles pouvant durer jusqu’à 4 minutes.

kling-3.0/4k/text-to-video

Générez des vidéos cinématographiques natives en 4K à partir de texte, avec dialogues synchronisés et personnages cohérents.

Questions Fréquemment Posées

De quelles entrées Wan 2.2 S2V a-t-il besoin ?

Le modèle nécessite une image et un fichier audio. Aucune invite de texte n'est exposée dans cette interface.

Quels formats d'images sont pris en charge ?

Utilisez JPG, JPEG, PNG, BMP ou WEBP. La largeur et la hauteur de l'image doivent chacune dépasser 400 pixels sans excéder 7 000 pixels.

Quelles sont les exigences audio ?

Utilisez un son WAV ou MP3 de moins de 20 secondes. Sa taille doit aussi être inférieure à 15 Mo.

Quels modes d’animation sont disponibles ?

Choisissez parole, chant ou performance. La parole est le mode par défaut.

Quelles résolutions puis-je générer ?

Choisissez 480P ou 720P. La valeur par défaut est 480P.

Combien coûte la production ?

Une vidéo de 5 secondes nécessite 68 crédits.

Quand dois-je choisir de parler, de chanter ou de jouer ?

Choisissez parole pour les dialogues, chant pour les voix et performance pour une animation plus générale du personnage, qui ne se limite pas à parler ou chanter.

Pourquoi un téléchargement peut-il être rejeté ?

Vérifiez le type de fichier pris en charge et les limites. Les images doivent respecter les deux règles de dimension, tandis que l'audio doit respecter les règles de format, de durée et de taille de fichier.

Wan 2.2 S2V prend-il en charge la génération par lots ?

Oui. Les tailles de lot prises en charge sont de 1, 2, 3 et 4 tâches.

Le mode de performance modifie-t-il les exigences relatives à l’image et à l’audio ?

Non. Les modes speech, sing et perform utilisent les mêmes limites de format, de dimensions, de durée et de taille de fichier.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • Runway Aleph 2
  • Wan 2.5
  • Wan 2.6 Flash
  • MiniMax H3 Max
  • Wan 3.0 Reference To Video
  • Seedance 2.5 Reference to Video 480p
  • Voir tous les modèles →
Modèles d'images
  • Wan 2.6 Image to Image
  • Seedream 5.0 Pro
  • Flux 2 Klein 9B
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • Z Image Turbo LoRA
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...