Segmentez l’élément décrit au fil des images d’une vidéo.
Wan 3.0 est le modèle de génération vidéo tout-en-un de Wan-AI qui transforme le texte, les images, la vidéo, l'audio, les fichiers et les pages Web en clips cohérents avec un son synchronisé. Cette page fournit Wan 3.0 Image to Video : donnez-lui une image de première image et une invite, et elle anime cette image dans un clip de 2 à 30 secondes, avec une dernière image facultative pour épingler la façon dont la prise de vue se termine. Le même modèle sous-jacent gère également le texte vers la vidéo et la référence vers la vidéo, de sorte que le look que vous développez ici est transféré à toute la famille.
| Avantage Wan 3.0 | Ce que cela signifie pour vous |
|---|---|
| Un modèle, plusieurs entrées | Wan 3.0 gère le texte, les images de la première/dernière image, les images de référence, la vidéo, l'audio, les documents et les liens, vous avez donc rarement besoin de changer d'outil entre les idées. |
| Contrôle de la première et de la dernière image | Sur cette page, vous pouvez définir à la fois l'image d'ouverture et de fermeture, donnant à Wan 3.0 un contrôle plus strict sur la façon dont un plan commence et se résout qu'une animation de la première image uniquement. |
| Sortie flexible de 2 à 30 secondes | Wan 3.0 rend des brouillons courts ou des prises uniques plus longues, de sorte que les itérations rapides et les plans finis proviennent du même point final. |
| Audio synchronisé, en option | Chaque résultat Wan 3.0 peut inclure une piste audio correspondante, ou vous pouvez exporter un clip silencieux : le basculement de l'audio ne change pas le prix. |
- Vidéos de produits et de marketing : utilisez Wan 3.0 pour transformer un produit ou un packshot en un court clip promotionnel avec un mouvement et un cadrage contrôlés.
Le premier tableau répertorie les contrôles exposés par l'outil Wan 3.0 Image to Video sur cette page.
| Paramètre | Obligatoire | Tapez | Par défaut | Gamme / Options | Comment choisir |
|---|---|---|---|---|---|
invite* | Oui (*) | Chaîne | Exemple d'invite | Jusqu'à 20 000 caractères | Décrivez le sujet, son mouvement, le mouvement de la caméra, l'éclairage et le style. Une structure claire compte plus que la longueur. |
image_url* | Oui (*) | Chaîne | Exemple d'image | URL de l'image ou Base64 | La première image à partir de laquelle Wan 3.0 s'anime. Utilisez une image nette, bien éclairée et épurée pour une meilleure préservation du sujet. |
end_image_url | Non | Chaîne | vide | URL de l'image ou Base64 | Une dernière image facultative ; réglez-le lorsque la pose ou la composition finale est fixée. |
résolution | Non | Chaîne | 720p | 480p, 720p, 1080p | Utilisez 480p pour des brouillons rapides et 1080p pour une livraison plus détaillée. |
aspect_ratio | Non | Chaîne | adaptive | adaptive, 16:9, 9:16, 1:1, 4:3, 3:4 | Laissez adaptive suivre l'image d'entrée ou forcez un rapport pour un emplacement spécifique. |
durée | Non | Entier | '5' | « 2 » à « 30 » secondes | Gardez-le court tout en affinant le mouvement, puis relevez-le une fois la direction confirmée. |
thinking_mode | Non | Booléen | faux | vrai / faux | Activez cette option pour les invites complexes qui combinent plusieurs mouvements ou règles de composition. |
enable_audio | Non | Booléen | vrai | vrai / faux | Continuez pour une piste audio synchronisée ; éteignez-le pour un clip silencieux. |
graine | Non | Entier | Aléatoire | 0–2147483647 | Corrigez une graine pour reproduire un résultat pendant que vous effectuez de petites modifications comparables. |
Le tableau suivant résume le modèle Wan 3.0 plus large. Les entrées de référence, de document et de texte uniquement sont disponibles via les autres modes et outils frères du modèle, et non en tant que contrôles sur cette page Image vers vidéo.
| Dimension centrale | Wan 3.0 |
|---|---|
| Modèle | wan3.0-video |
| Modes de génération | Texte vers vidéo ; Image vers vidéo (première image ou première + dernière image) ; Référence à la vidéo à partir d'images, de vidéos et d'audio ; ainsi que des références de documents et de liens Web. |
| Durée de sortie | 2 à 30 secondes. Avec l'entrée vidéo, l'entrée et la sortie restent dans les 30 secondes. Une option de durée intelligente permet à Wan 3.0 de recommander une durée. |
| Résolution | 480P, 720P ou 1080P. |
| Rapport hauteur/largeur de sortie | adaptive (recommandé à partir de l'entrée) ou 16:9, 4:3, 1:1, 3:4, 9:16. |
| Sortie audio | Audio synchronisé en option, généré avec l'image et activé par défaut. |
| Entrée de la première/dernière image | Jusqu'à un first_frame et un last_frame. Images : JPEG, JPG, PNG, BMP ou WEBP ; « 240 à 8 000 pixels par côté ; rapport hauteur/largeur jusqu'à « 8 : 1 » ; jusqu'à 20 Mo chacun. |
| Images de référence | Jusqu'à 10 images de référence pour la cohérence du sujet, de l'objet ou de la scène. |
| Vidéos de référence | Jusqu'à 5 clips ; MP4 ou MOV ; « 1 à 15 » secondes chacun ; vidéo combinée jusqu'à 15 secondes ; « 240 à 4 096 pixels par côté ; jusqu'à 100 Mo par clip. |
| Audio de référence | Jusqu'à 5 clips ; WAV ou MP3 ; audio combiné jusqu'à 15 secondes ; jusqu'à 15 Mo chacun. |
| Saisie de documents/Web | Un document (DOCX, PDF, PPTX, XLSX, TXT et similaire, jusqu'à 50 pages) ou un lien Web public. |
| Mode exclusivité | Les entrées de première/dernière image ne peuvent pas être combinées avec des entrées de référence, de document ou de lien dans la même requête. |
| Limite d'invite | Jusqu'à 20 000 caractères. |
Le prix du Wan 3.0 dépend de la résolution que vous choisissez et de la durée générée. L'activation ou la désactivation de l'audio Wan 3.0 ne modifie pas le débit.
| Résolution | Prix par seconde | 5s | 10s | années 30 |
|---|---|---|---|---|
| 480p | 0,06 $ | 0,30 $ | 0,60 $ | 1,80 $ |
| 720p | 0,12 $ | 0,60 $ | 1,20 $ | 3,60 $ |
| 1080p | 0,25 $ | 1,25 $ | 2,50 $ | 7,50 $ |
Pour les lots de 1 à 4 sorties, calculez le total comme suit : « durée × taux par seconde × nombre de sorties ».
Utilisez cette structure Wan 3.0 réutilisable :
[sujet + détails de définition] + [un mouvement dans le temps] + [cadrage et mouvement de la caméra] + [réglage + éclairage] + [traitement visuel] + [audio] + [cadre ou contrainte de fin]
Utilisez cette comparaison Wan 3.0 comme guide de famille modèle ; La résolution et la durée maximales peuvent ne pas être disponibles ensemble, et différents outils peuvent exposer différentes entrées et contrôles. Basé sur des informations accessibles au public.
| Modèle | Résolution | Durée maximale | Audio | Se démarquer |
|---|---|---|---|---|
| Wan 3.0 | 480p–1080p | années 30 | Audio synchronisé en option | Un modèle tout-en-un couvrant le texte, la première/dernière image et la référence à la vidéo à partir d'images, de vidéo et d'audio, ainsi que des entrées de documents et Web. |
| Kling 3.0 | Jusqu'à 4K | 15s | Audio natif avec synchronisation labiale | Coordonne les changements de caméra multi-plans et les dialogues attribués par le locuteur pour les publicités scénarisées et les scènes de personnages. |
| Hailuo 02 | 1080p | ~10s | Aucun | Mouvement axé sur la physique et forte adhésion rapide pour des actions silencieuses et des photos de produits. |
| Semis 2.5 | 1080p | années 30 | Audio et vidéo communs | Génération riche en références avec parole et effets synchronisés pour les modifications sensibles à l'identité. |
| Véo 3.1 | 4K | 8s | Dialogues et effets natifs | Commandes de première/dernière image et de référence adaptées aux transitions cinématographiques et aux séquences assemblées. |
Ce qui distingue Wan 3.0, c'est sa largeur : un modèle unique qui anime une première image, honore une dernière image et peut extraire des images, des vidéos, de l'audio, des documents et des liens, tout en générant un son synchronisé en option. Choisissez Wan 3.0 Image to Video lorsque vous avez un cadre d'ouverture à donner vie, et passez au texte ou aux outils de référence lorsque votre point de départ change.
Segmentez l’élément décrit au fil des images d’une vidéo.
Transformez vos photos en vidéos réalistes avec synchronisation des lèvres
Transformez vos visuels statiques en contenu vidéo synchronisé avec le mouvement et haute définition grâce à Wan 2.6 et son contrôle flexible.
Générez une vidéo à partir d’une piste audio et d’une image, avec prompt et seed facultatifs.
Créez des vidéos réalistes instantanément avec Dreamina 3.0, l'outil IA pour créateurs.
Outil de conversion de mouvement piloté par l'IA permettant une création d'animation précise et stable
Wan 3.0 image-to-video prend une seule image de la première image et l'anime en un clip court et cohérent basé sur votre invite de texte. C'est un bon choix pour transformer des photos de produits, des portraits, des photos de style de vie ou des illustrations conceptuelles en mouvements sans truquage ni images clés manuelles.
Vous fournissez toujours une image de première image et vous pouvez éventuellement ajouter une image de dernière image lorsque la pose ou la composition finale est importante. Wan 3.0 génère ensuite un mouvement continu qui commence à votre première image et se résout vers la dernière, vous donnant ainsi un contrôle plus strict sur la façon dont la prise de vue commence et se termine.
Étant donné que la première image est utilisée directement comme ouverture de la vidéo, Wan 3.0 a tendance à garder l'apparence et le cadrage du sujet cohérents tout au long du clip. L’utilisation d’une image d’entrée nette, bien éclairée et épurée permet d’obtenir la meilleure préservation du sujet.
Wan 3.0 prend en charge les sorties 480p, 720p et 1080p, avec 720p comme valeur par défaut commune. La durée est réglable de 2 à 30 secondes et le format d'image peut être grand écran, vertical, carré ou classique, ou réglé sur adaptive pour qu'il suive l'image d'entrée. Vérifiez le panneau de paramètres RunComfy pour connaître les limites de courant exactes.
Oui. Wan 3.0 peut produire une piste audio synchronisée avec le clip, et vous pouvez désactiver l'audio lorsque vous n'avez besoin que de séquences silencieuses. Le basculement de l'audio ne modifie pas le coût de génération.
Les images d'entrée doivent être dans des formats courants tels que JPEG, PNG ou WEBP, avec une résolution et un rapport hauteur/largeur raisonnables. Des images de très mauvaise qualité ou très encombrées peuvent réduire la qualité du mouvement, préférez donc une première image propre et haute résolution. Les limites peuvent varier selon les paramètres du fournisseur.
Oui. Vous pouvez prototyper Wan 3.0 dans l'interface utilisateur du modèle RunComfy, puis appeler le même modèle via RunComfy HTTP API avec des paramètres identiques pour la production ou l'automatisation. Cela vous permet de passer d'un test de navigateur à un pipeline intégré sans changer de modèle.
Les générations consomment des USD ou des crédits en fonction de la résolution et de la durée de sortie : 0,06 $ par seconde à 480p, 0,12 $ par seconde à 720p et 0,25 $ par seconde à 1080p. Les nouveaux utilisateurs bénéficient généralement d'un montant d'essai gratuit pour essayer Wan 3.0 avant de s'engager dans des courses plus importantes.
RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.





