Convierte imágenes estáticas en clips fluidos con control de audio.
video_url, text y voice_id son obligatorios..mp4 o .mov, ocupar como máximo 100 MB y durar de 2 a 10 segundos. Se admiten 720p o 1080p y un ancho y alto de 720–1920 píxeles.text admite un máximo de 120 caracteres.voice_id ofrece 27 valores fijos; el valor predeterminado es genshin_vindi2.voice_language ofrece zh y en; el valor predeterminado es en.voice_speed va de 0,8 a 2; el valor predeterminado es 1.genshin_vindi2, zhinen_xuesheng, AOT, ai_shatang, genshin_klee2, genshin_kirara, ai_kaiya, oversea_male1, ai_chenjiahao_712, girlfriend_4_speech02, chat1_female_new-3, chat_0407_5-1, cartoon-boy-07, uk_boy1, cartoon-girl-01, PeppaPig_platform, ai_huangzhong_712, ai_huangyaoshi_712, ai_laoguowang_712, chengshu_jiejie, you_pingjing, calm_story1, uk_man2, laopopo_speech02, heainainai_speech02, reader_en_m-v1, commercial_lady_en_f-v1
Elige una Voice ID y el idioma correspondiente, mantén el texto dentro de 120 caracteres y adapta la velocidad a la duración del vídeo. Usa frases cortas y bien puntuadas. Revisa inicios de frase, pausas, sílabas rápidas y movimientos de cabeza en el resultado.
Esta variante no contiene un campo para cargar un archivo de audio propio.
Convierte imágenes estáticas en clips fluidos con control de audio.
MiniMax H3 Max: texto o imagen a vídeo con audio nativo en 480p/768p
Genere vídeo a partir de fotografías de varios fotogramas clave con audio opcional
Restaure y mejore un video requerido. Controle el ancho de salida, el límite de cuadros, la velocidad de fotogramas, la semilla, la guía de restauración y el tamaño del lote.
Genere video entre los fotogramas inicial y final con audio opcional
Image-to-video prémium con la mayor fidelidad visual y el movimiento más realista de la familia Kling V3.0.
Genera voz a partir de texto y la sincroniza con un vídeo existente.
video_url, text y voice_id son obligatorios.
Debe ser .mp4 o .mov, ocupar como máximo 100 MB, durar 2–10 segundos, ser 720p o 1080p y medir 720–1920 píxeles de ancho y alto.
text admite un máximo de 120 caracteres.
genshin_vindi2, zhinen_xuesheng, AOT, ai_shatang, genshin_klee2, genshin_kirara, ai_kaiya, oversea_male1, ai_chenjiahao_712, girlfriend_4_speech02, chat1_female_new-3, chat_0407_5-1, cartoon-boy-07, uk_boy1, cartoon-girl-01, PeppaPig_platform, ai_huangzhong_712, ai_huangyaoshi_712, ai_laoguowang_712, chengshu_jiejie, you_pingjing, calm_story1, uk_man2, laopopo_speech02, heainainai_speech02, reader_en_m-v1, commercial_lady_en_f-v1
El valor predeterminado es genshin_vindi2.
voice_language ofrece zh y en; el valor predeterminado es en.
voice_speed va de 0,8 a 2; el valor predeterminado es 1.
No. Esta variante no contiene un campo de URL de audio.
Usa frases cortas y bien puntuadas y elige una velocidad acorde con la duración del vídeo.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





