logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

Wan 2.2 S2V : Générateur de parole en vidéo | RunComfy

wan-ai/wan-2-2/speech-to-video

Combinez une image et un fichier audio pour créer une vidéo de personnage parlant, chantant ou jouant en 480P ou 720P.

Image JPG, JPEG, PNG, BMP ou WEBP requise. La largeur et la hauteur doivent chacune dépasser 400 pixels sans excéder 7 000 pixels.
0:00
0:00
Audio WAV ou MP3 requis inférieur à 20 secondes et inférieur à 15 Mo.
Choisissez le mode parole, chant ou performance ; valeur par défaut : parole.
Choisissez une sortie 480P ou 720P ; par défaut : 480P.
Idle
The rate is $0.10 per second for 480P, and $0.20 per second for 720P.

Présentation de Wan 2.2 S2V

Wan 2.2 S2V transforme une image fixe et une piste audio obligatoires en une vidéo de personnage. Sélectionnez le mode parole, chant ou performance en fonction de l’enregistrement, puis choisissez la résolution 480P ou 720P. Les champs image et audio imposent des limites de format, de dimensions, de durée et de taille de fichier.

Fonctionnalités de Wan 2.2 S2V

Entrée image et audio

Créez une vidéo à partir d'une image requise et d'un fichier audio requis, sans invite de texte.

Mouvement des personnages piloté par l'audio

Utilisez l'enregistrement pour piloter une vidéo de personnage, avec un mode sélectionné pour la parole, le chant ou une performance plus large.

Trois modes d’animation

Choisissez parole pour les dialogues, chant pour les voix ou performance pour une animation plus générale du personnage ; parole est la valeur par défaut.

Deux résolutions de sortie

Générez à 480P par défaut ou sélectionnez 720P lorsqu'une résolution de sortie plus élevée est nécessaire.

Wan 2.2 S2V actualités et exemples sur X

Modèles associés

pixverse/v5.5/text-to-video

Générez une vidéo à partir d’un prompt textuel obligatoire avec des réglages précis du format, de la résolution, de la durée, du style, de la graine, de l’audio, du multiclip et de l’optimisation.

flux-3/first-last-frame-to-video

Générez une vidéo entre les images de début et de fin avec de l'audio en option

kling-3.0/pro/text-to-video

Texte-vidéo cinématographique haut de gamme avec la plus haute fidélité visuelle de la famille Kling V3.0.

minimax-h3-open/reference-to-video

Référence à poids ouverts à la vidéo à partir d'images, de vidéos et d'indices audio.

wan-2-5/text-to-video

Générez une vidéo de 5 ou 10 secondes à partir d'une invite requise. Ajoutez éventuellement une piste audio WAV ou MP3, une invite négative et l'une des 13 tailles de sortie.

Veo 2

Effets fluides, précision des mouvements et rendu cinématographique

Questions Fréquemment Posées

De quelles entrées Wan 2.2 S2V a-t-il besoin ?

Le modèle nécessite une image et un fichier audio. Aucune invite de texte n'est exposée dans cette interface.

Quels formats d'images sont pris en charge ?

Utilisez JPG, JPEG, PNG, BMP ou WEBP. La largeur et la hauteur de l'image doivent chacune dépasser 400 pixels sans excéder 7 000 pixels.

Quelles sont les exigences audio ?

Utilisez un son WAV ou MP3 de moins de 20 secondes. Sa taille doit aussi être inférieure à 15 Mo.

Quels modes d’animation sont disponibles ?

Choisissez parole, chant ou performance. La parole est le mode par défaut.

Quelles résolutions puis-je générer ?

Choisissez 480P ou 720P. La valeur par défaut est 480P.

Combien coûte la production ?

Une vidéo de 5 secondes nécessite 68 crédits.

Quand dois-je choisir de parler, de chanter ou de jouer ?

Choisissez parole pour les dialogues, chant pour les voix et performance pour une animation plus générale du personnage, qui ne se limite pas à parler ou chanter.

Pourquoi un téléchargement peut-il être rejeté ?

Vérifiez le type de fichier pris en charge et les limites. Les images doivent respecter les deux règles de dimension, tandis que l'audio doit respecter les règles de format, de durée et de taille de fichier.

Wan 2.2 S2V prend-il en charge la génération par lots ?

Oui. Les tailles de lot prises en charge sont de 1, 2, 3 et 4 tâches.

Le mode de performance modifie-t-il les exigences relatives à l’image et à l’audio ?

Non. Les modes speech, sing et perform utilisent les mêmes limites de format, de dimensions, de durée et de taille de fichier.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...