Referência de peso aberto ao vídeo a partir de pistas de imagem, vídeo e áudio.
React-1 recebe video_url e audio_url obrigatórios e cria uma edição sincronizada com os lábios. Ambas as entradas devem ter 15 segundos ou menos. Você pode orientar a atuação com emotion, escolher o escopo de edição com model_mode, decidir como comprimentos de entrada incompatíveis são tratados com lipsync_mode e ajustar a expressividade com temperature.
| Parâmetro | Obrigatório | Padrão / opções | O que controla |
|---|---|---|---|
video_url | Sim | URL de vídeo de exemplo | URL pública do vídeo de origem; 15 segundos ou menos. |
audio_url | Sim | URL de áudio de exemplo | URL pública para o áudio da direção; 15 segundos ou menos. |
emotion | Não | Padrão neutral | Valores exatos: happy, angry, sad, neutral, disgusted, surprised. Apenas valores emocionais de uma palavra são suportados. |
model_mode | Não | Padrão face | Valores exatos: lips, face, head. Define a região de edição e o escopo do movimento. |
lipsync_mode | Não | Padrão bounce | Valores exatos: cut_off, loop, bounce, silence, remap. Controla o manuseio quando as durações de áudio e vídeo são diferentes. |
temperature | Não | Padrão 0.5; 0–1 | Controla a expressividade da sincronização labial. |
emotion exato e o model_mode mais restrito e adequado.lipsync_mode deliberadamente quando os comprimentos de entrada forem diferentes e ajuste temperature em pequenos passos.Referência de peso aberto ao vídeo a partir de pistas de imagem, vídeo e áudio.
Crie vídeos cinematográficos com IA e controle preciso de imagem e texto
Sincronize uma faixa de áudio com um vídeo existente usando duas URLs obrigatórias.
Gere um vídeo de 5, 10 ou 15 segundos a partir de um prompt de texto, com fonte de áudio opcional e controles de tamanho, estrutura da cena, prompt negativo, propagação, expansão do prompt e áudio gerado.
Transforme imagens em vídeos realistas com áudio e movimento precisos.
HappyHorse 1.0 com saída nativa 1080p, movimento cinematográfico e coerência multi-plano.
Esta página documenta React-1 como um fluxo de trabalho de sincronização labial de vídeo e áudio com controles de emoção, escopo de edição, tratamento de incompatibilidade e expressividade. Ele não inclui dados de benchmark contra Lipsync-2 ou Lipsync-2-Pro, portanto, as reivindicações de qualidade relativa ou preservação de identidade não podem ser confirmadas apenas pelo esquema.
Sim. Forneça o clip-through existente necessário video_url e a pista de condução necessária audio_url. Ambos devem ter 15 segundos ou menos. Em seguida, escolha emotion, model_mode, lipsync_mode e temperature conforme necessário.
O esquema limita as entradas video_url e audio_url a 15 segundos cada. Ele não expõe resolução de saída, proporção de aspecto, taxa de quadros, formato de saída, ControlNet ou configurações do adaptador IP, portanto, as reivindicações de 4K, 1080p e 16:9 não são estabelecidas por esta página.
Não. As entradas video_url e audio_url documentadas devem ter 15 segundos ou menos cada. O esquema não descreve um modo de sequência mais longa.
Depois de testar as configurações, use o RunComfy endpoint da API e envie os mesmos campos documentados: video_url, audio_url, emotion, model_mode, lipsync_mode e temperature. Consulte a documentação atual da API para autenticação, pesquisa de status, limites e cobrança.
emotion aceita exatamente happy, angry, sad, neutral, disgusted ou surprised, com neutral como padrão. model_mode define o escopo de edição e temperature ajusta a expressividade entre 0 e 1. O esquema não documenta uma difusão específica ou método de geometria facial.
Como orientação prática, use um clipe curto onde o rosto e a boca do locutor estejam visíveis e forneça um áudio final limpo. Oclusão intensa, faces muito pequenas ou movimentos conflitantes podem dificultar a revisão, embora o esquema não publique limites formais de qualidade para essas condições.
Esta página começa com um video_url existente e direcionando audio_url e, em seguida, expõe os controles de desempenho de sincronização labial. Ele não oferece campos de geração de texto para vídeo ou imagem para vídeo para criar uma nova cena do zero.
O uso comercial depende dos termos mais recentes de sincronização e RunComfy e dos direitos do vídeo e áudio de origem. O esquema em si não concede uma licença comercial universal; verifique o licenciamento atual antes da distribuição paga ou pública.
Isso significa que você pode escolher um dos seis valores emotion exatos e definir o escopo de movimento para lips, face ou head até model_mode. lipsync_mode lida com incompatibilidades de duração, enquanto temperature ajusta a expressividade. Nenhuma capacidade de desempenho mais ampla deve ser inferida além desses controles documentados.
RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.





