Genera vídeos cinematográficos nativos en 4K a partir de texto, con diálogo sincronizado y personajes coherentes.
React-1 toma un video_url y un audio_url requeridos y crea una edición sincronizada con los labios. Ambas entradas deben ser de 15 segundos o menos. Puede dirigir la interpretación con emotion, elegir el alcance de edición con model_mode, decidir cómo se manejan las longitudes de entrada que no coinciden con lipsync_mode y ajustar la expresividad con temperature.
| Parámetro | Requerido | Predeterminado/opciones | Qué controla |
|---|---|---|---|
video_url | Sí | URL de vídeo de ejemplo | URL pública del vídeo fuente; 15 segundos o menos. |
audio_url | Sí | URL de audio de ejemplo | URL pública para el audio de conducción; 15 segundos o menos. |
emotion | No | Predeterminado neutral | Valores exactos: happy, angry, sad, neutral, disgusted, surprised. Solo se admiten valores de emoción de una palabra. |
model_mode | No | Predeterminado face | Valores exactos: lips, face, head. Establece la región de edición y el alcance del movimiento. |
lipsync_mode | No | Predeterminado bounce | Valores exactos: cut_off, loop, bounce, silence, remap. Controla el manejo cuando las duraciones de audio y video difieren. |
temperature | No | Predeterminado 0.5; 0–1 | Controla la expresividad de la sincronización de labios. |
emotion exacto y el model_mode más estrecho y adecuado.lipsync_mode deliberadamente cuando las longitudes de entrada difieran, luego ajuste temperature en pequeños pasos.Genera vídeos cinematográficos nativos en 4K a partir de texto, con diálogo sincronizado y personajes coherentes.
Convierta imágenes fijas en clips de movimiento cinematográficos con cámara y control de audio.
Modelo de video con IA multimodal y audio nativo para generación desde texto, imágenes y referencias.
Convierte imágenes en videos 1080p fluidos con realismo sorprendente
Transformación de vídeo eficiente con movimiento cinematográfico y precisión de diseño.
Texto a vídeo de peso abierto con 480p/768p y audio estéreo nativo.
Esta página documenta React-1 como un flujo de trabajo de sincronización de labios de video y audio con controles de emoción, alcance de edición, manejo de discrepancias y expresividad. No incluye datos de referencia contra Lipsync-2 o Lipsync-2-Pro, por lo que las afirmaciones de calidad relativa o preservación de la identidad no se pueden confirmar únicamente a partir del esquema.
Sí. Suministre el clip existente a través de video_url requerido y la pista de conducción a través de audio_url. Ambos deben durar 15 segundos o menos. Luego elija emotion, model_mode, lipsync_mode y temperature según sea necesario.
El esquema limita las entradas video_url y audio_url a 15 segundos cada una. No expone la resolución de salida, la relación de aspecto, la velocidad de fotogramas, el formato de salida, ControlNet o la configuración del adaptador IP, por lo que esta página no establece afirmaciones sobre 4K, 1080p y 16:9.
No. Las entradas documentadas video_url y audio_url deben ser cada una de 15 segundos o menos. El esquema no describe un modo de secuencia más larga.
Después de probar la configuración, utilice el RunComfy extremo API y envíe los mismos campos documentados: video_url, audio_url, emotion, model_mode, lipsync_mode y temperature. Consulte la documentación API actual para autenticación, sondeo de estado, límites y facturación.
emotion acepta exactamente happy, angry, sad, neutral, disgusted o surprised, con neutral como valor predeterminado. model_mode establece el alcance de la edición y temperature ajusta la expresividad entre 0 y 1. El esquema no documenta un método específico de difusión o geometría facial.
Como guía práctica, utilice un clip corto donde la cara y la boca que hablan sean visibles y proporcione un audio final limpio. Una oclusión intensa, caras muy pequeñas o movimientos conflictivos pueden dificultar la revisión, aunque el esquema no publica umbrales de calidad formales para estas condiciones.
Esta página comienza con un video_url existente y conduce audio_url, luego expone los controles de rendimiento de sincronización de labios. No ofrece campos de generación de texto a vídeo o de imagen a vídeo para crear una nueva escena desde cero.
El uso comercial depende de los últimos términos de sincronización y RunComfy y de los derechos sobre el vídeo y el audio de origen. El esquema en sí no otorga una licencia comercial universal; Verifique la licencia actual antes de la distribución pública o paga.
Significa que puede elegir uno de los seis valores exactos de emotion y establecer el alcance del movimiento en lips, face o head hasta model_mode. lipsync_mode maneja las discrepancias de duración, mientras que temperature ajusta la expresividad. No se debe inferir ninguna capacidad de desempeño más amplia más allá de estos controles documentados.
RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.





