ComfyUI>Fluxos de Trabalho>MiniMax H3 Fun Control | Imagem para Vídeo Preciso

MiniMax H3 Fun Control | Imagem para Vídeo Preciso

Workflow Name: RunComfy/MiniMax-H3-Control
Workflow ID: 0000...1506
Transforme uma imagem de referência em um vídeo controlado. Mantenha a identidade, roupa e cena do seu sujeito consistentes. Guie o movimento com H3 Fun ControlNet. Escolha entre ramos de controle único ou profundidade mais pose. Use SolAttn opcional para execuções mais rápidas. Crie caminhadas, giros, acenos e movimentos de corpo inteiro limpos.

ComfyUI MiniMax H3 Fun Control Workflow

MiniMax H3 Fun Control in ComfyUI | Depth and Pose Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Fun Control Examples

MiniMax H3 Fun Control: geração controlável de imagem de referência para vídeo no ComfyUI#

Esta tela pronta para RunComfy traz MiniMax H3 Fun Control para o ComfyUI para imagem para vídeo precisa e prontamente configurável. Ela segue sua passagem de estrutura (profundidade, canny, pose, HED ou MLSD) enquanto respeita uma referência de primeiro quadro ou referências completas de personagem/estilo. O layout padrão vem com três ramos prontos para executar, para que você possa começar simples e aumentar o controle conforme necessário.

O Gráfico 1 executa um fluxo de controle único e está habilitado por padrão. O Gráfico 2 adiciona uma configuração de profundidade mais pose em cadeia com referências de personagem/estilo e sugestão negativa verdadeira. O Gráfico 3 espelha o Gráfico 2, mas inclui um patch opcional de aceleração SolAttn. Você pode habilitar ou ignorar qualquer ramo preparado após carregar o fluxo de trabalho.

Modelos principais no fluxo de trabalho Comfyui MiniMax H3 Fun Control#

  • MiniMax H3 base UNet (fl2va) e UNet de referência para vídeo (ref2va). Estes são os backbones de vídeo que sintetizam o movimento a partir de um prompt e primeiro quadro (fl2va) ou de referências de imagem persistentes (ref2va). Pesos empacotados pela comunidade para ComfyUI estão disponíveis no conjunto experimental MiniMax H3 no Hugging Face: MiniMax-H3-experimental.
  • MiniMax H3 Video VAE e Audio VAE. Estes codificam e decodificam os fluxos de vídeo e áudio latentes usados por H3 para que o pipeline possa amostrar eficientemente, e depois transformar os resultados de volta em pixels e som. Veja o mesmo pacote de modelos: MiniMax-H3-experimental.
  • Codificador de texto da família Qwen-VL. O fluxo de trabalho usa uma variante ajustada MiniMax da série Qwen-VL para analisar prompts e alimentar o condicionamento de texto no H3. Para informações sobre esta família de modelos, veja o repositório oficial: Qwen2-VL.
  • MiniMax H3 Fun ControlNet Union (formato de curva). Este único ControlNet suporta múltiplas passagens de controle (profundidade, canny, HED, pose, MLSD) e permite que você direcione a estrutura da cena através dos quadros. Use o checkpoint no formato de curva do lançamento oficial: MiniMax-H3-Fun-Controlnet-Union.

Como usar o fluxo de trabalho Comfyui MiniMax H3 Fun Control#

A tela contém três ramos preparados. O Gráfico 1 (controle único) está habilitado, o Gráfico 2 (profundidade+pose com referências) e o Gráfico 3 (aceleração SolAttn) estão ignorados. Ative um ramo quando estiver pronto; apenas o ramo habilitado será executado.

01 · Controle Único · HABILITADO POR PADRÃO#

01 · Modelos Este grupo carrega o MiniMax H3 base UNet, o codificador de texto Qwen-VL e os VAEs H3 para vídeo e áudio. Ele também carrega o MiniMax H3 Fun ControlNet Union no formato de curva para que um único fluxo de controle possa guiar a estrutura. Você não precisa alterar nada aqui, a menos que queira trocar pesos de um conjunto de checkpoints diferente.

01 · CONTROLE: este é o nó Carregue um vídeo de controle que corresponda à largura, altura e contagem de quadros de saída desejada; o nó verifica e aumentará ambos os números se eles discordarem. Escolha qualquer uma das passagens suportadas (profundidade, canny, pose, HED, MLSD) com base no que melhor captura seu movimento e silhuetas. A força age como um orçamento de adesão; 1.0 é o ponto de partida certo para um controle único, e empurrar mais tende a saturar o detalhe. A janela de agendamento de controle define quando o controle está ativo durante a amostragem; terminar a janela por volta de 0.6 geralmente bloqueia a estrutura cedo enquanto libera etapas tardias para adicionar textura fina. Use o checkpoint ControlNet no formato de curva; a variante de largura total não será carregada neste nó.

01 · Condicionamento Escreva seu prompt e opcionalmente forneça um primeiro quadro. Com um primeiro quadro, o modelo é inicializado a partir dessa imagem e tende a preservar a composição; sem ele, apenas o prompt orienta a aparência. Defina largura, altura e comprimento aqui; MiniMax H3 ajusta o comprimento à sua grade válida em 24 fps (17n + 5), então planeje sua edição em torno dessas contagens. Manter os primeiros e últimos quadros não definidos usa o início e o fim naturais do modelo; adicionar um último quadro não é necessário para este ramo.

01 · Amostragem O amostrador executa com um guia básico que não tem CFG e nenhuma entrada negativa, o que significa que negativos no seu texto são ignorados aqui; use o Gráfico 2 ou mude para um guia CFG se precisar de negativos. O deslocamento sigma é aplicado para equilibrar os cronogramas de difusão de vídeo e áudio para uma decodificação estável posteriormente. A escolha de cronograma e amostrador neste ramo são ajustadas para trocas sensatas entre qualidade e velocidade; uma vez que você tenha uma linha de base, sinta-se à vontade para experimentar.

01 · Saída Os latentes amostrados são decodificados com o H3 Video VAE e, se presente, o Audio VAE. Quadros e áudio são muxados em um vídeo e salvos em suas saídas. Use o resultado salvo como uma verificação de estilo e retorne à força de controle, janela de agendamento ou prompt conforme necessário.

02 · Referência de Profundidade + Pose · IGNORADO POR PADRÃO#

02 · Modelos Este ramo carrega o H3 UNet de referência para vídeo, que é projetado para manter identidade e estilo de imagens paradas em todos os quadros. Ele compartilha o codificador de texto Qwen-VL e os VAEs H3. O MiniMax H3 Fun ControlNet Union no formato de curva é reutilizado aqui para dirigir a estrutura.

02 · CONTROLE: encadeado, forças SOMAM para cerca de 1.0 Dois nós Aplicar são encadeados para que cada fluxo de controle adicione sua própria contribuição, primeiro profundidade, depois pose. Trate a força como um orçamento: as duas forças somam, e empurrar o total bem acima de 1.0 apagará detalhes e borrará o sujeito. A profundidade é ótima para geometria grosseira e posicionamento de câmera; a pose trava membros e articulação. Ajuste configurando uma força para zero e ouvindo a outra, depois traga-as juntas perto de um total de 1.0.

02 · Condicionamento e referências Use MiniMaxH3ReferenceToVideo para alimentar imagens de referência reais junto com seu prompt para que identidade e estilo persistam em todos os quadros. ref_image_size de max oferece a identidade mais forte (tokens de referência maiores) a um custo computacional; match é mais rápido e geralmente suficiente para controle de estilo mais solto. Adicione um ramo negativo com as mesmas referências e seu texto negativo para que o guia CFG possa subtrair o que você não quer. Comprimento, tamanho e contagem de quadros seguem as mesmas regras do Gráfico 1.

02 · Amostragem Muda para um CFGGuider para que o condicionamento negativo realmente se aplique; a orientação adiciona custo porque o modelo avalia tanto o positivo quanto o negativo a cada passo. As etapas são configuradas mais altas aqui para dar espaço aos controles encadeados e referências para resolver; você pode reduzir para velocidade uma vez que goste da aparência. O controle de sementes assegura a reprodutibilidade; mantenha-o fixo enquanto equilibra o orçamento de profundidade e pose.

02 · Saída Decodificação e montagem de vídeo espelham o Gráfico 1. Se a saída corresponder à estrutura, mas parecer excessivamente suave, reduza o final da janela de controle para 0.6 ou diminua ligeiramente a força total de controle. Se a identidade escapar, aumente ref_image_size ou adicione uma segunda imagem de referência.

03 · Aceleração Sol-Attn Opcional · IGNORADO POR PADRÃO#

03 · Modelos Este ramo espelha os modelos e controles do Gráfico 2, mas adiciona um patch de aceleração de atenção esparsa. Ele requer a extensão Triton SolAttn. Se você não tiver Triton ou o pacote de nós instalado, deixe este ramo ignorado.

03 · CONTROLE: encadeado, forças SOMAM para cerca de 1.0 A mesma cadeia de profundidade mais pose se aplica; mantenha a força combinada perto de 1.0 para resultados nítidos. Use a mesma abordagem de ajuste do Gráfico 2 para encontrar a divisão que melhor se adapta ao seu plano e tamanho do sujeito.

03 · Condicionamento e referências Idêntico ao Gráfico 2. Mantenha as referências consistentes nos ramos positivo e negativo para que o CFG subtraia os recursos corretos. Se você deseja máxima identidade, combine ref_image_size: max com uma contagem de passos ligeiramente maior.

03 · OPCIONAL: atenção esparsa SolAttnPatch acelera blocos pesados de atenção enquanto preserva a qualidade onde mais importa. Deixe morton desligado, pois reordenar tokens de vídeo em ordem Z desalinham onde o ControlNet aplica seus deslocamentos por linha e efetivamente remove o controle. Manter os primeiros e últimos blocos transformadores exatos é um padrão seguro quando você deseja velocidade sem perder adesão. Espere execuções mais rápidas após o Triton compilar seus kernels; a primeira passagem mede principalmente o tempo de compilação.

03 · Amostragem e Saída A amostragem, decodificação e salvamento seguem o Gráfico 2. Compare SolAttn ligado versus desligado com uma semente fixa para julgar a qualidade e aderência para seu conteúdo. Se o controle parecer mais fraco com SolAttn, verifique se morton está desativado antes de ajustar as forças.

Nós-chave no fluxo de trabalho Comfyui MiniMax H3 Fun Control#

Apply H3 Fun ControlNet (#23) Adiciona um fluxo de controle ao modelo atual e leva um lote de quadros de controle extraídos do seu vídeo de controle. Use strength como um orçamento de adesão: para um único controle, comece em 1.0; ao encadear controles, mantenha a soma perto de 1.0 para evitar detalhes apagados. A janela de cronograma (start_percent, end_percent) determina quando o controle está ativo; terminar perto de 0.6 muitas vezes preserva texturas que o controle não pode descrever.

Prompt + primeiro quadro -> condicionamento (#31) Constrói o condicionamento a partir do seu prompt de texto e um primeiro quadro opcional para que o modelo possa respeitar a composição inicial. Se você omitir o primeiro quadro, apenas o prompt orienta o conteúdo. Largura, altura e comprimento vivem aqui; H3 aceita comprimentos na sua grade 17n + 5 a 24 fps, então planeje edições para essas durações.

Positivo: referências + prompt (#1031) Alimenta referências de imagem persistentes e texto de prompt no H3 para que identidade e estilo carreguem através de cada quadro. ref_image_size de max usa tokens maiores para identidade mais forte a custo mais alto; match é mais rápido com pressão de identidade mais leve. Emparelhe isso com um ramo negativo e CFGGuider se você precisar de exclusões fortes.

CFGGuider: o negativo só funciona aqui (#1040) Habilita orientação livre de classificadores para que o condicionamento negativo tenha efeito. Orientação mais alta fortalece a adesão ao prompt e referência, mas aumenta o cálculo porque cada passo executa tanto o positivo quanto o negativo. Para briefs de estilo longos e específicos, um cfg moderado pode melhorar significativamente a adesão; teste lado a lado com uma semente fixa.

Mudança de Sigma (vídeo 12 / áudio 3) (#24) Ajusta cronogramas de difusão para dar aos caminhos de vídeo e áudio perfis sigma apropriados antes da amostragem. Mantenha isso na cadeia quando planejar decodificar áudio para que o VAE de áudio receba uma distribuição latente compatível.

Sol-Attn (OPCIONAL, precisa do pacote de nós SolAttn + Triton) (#2060) Aplica kernels de atenção esparsa para acelerar H3 sem mudar o gráfico. Deixe morton desativado; ativá-lo reordena tokens e faz com que a contribuição do ControlNet perca as linhas pretendidas, o que parece uma saída perfeita que simplesmente ignora o controle. Para acelerações conservadoras, mantenha os primeiros e últimos blocos transformadores exatos e perfis após a compilação do Triton.

BasicScheduler (#42) Fornece o cronograma sigma e a contagem de passos para amostragem. Para tomadas controladas de perto, alguns passos a mais podem ajudar a estabilizar a estrutura antes que o controle desapareça; para passagens de estilo rápidas, reduza passos para economizar tempo. Combine ajustes de cronograma com a janela de controle para equilibrar adesão e textura.

Extras opcionais#

  • O vídeo de controle deve corresponder exatamente à largura, altura e contagem de quadros da geração; o nó verifica e aumenta ambos os números se diferirem.
  • Use o checkpoint ControlNet no formato de curva; o lançamento original de largura total não será carregado em H3FunControlLoader.
  • Se sua passagem de controle tiver grandes áreas sem características, termine a janela de controle perto de 0.6 para que etapas tardias possam adicionar textura do prompt.
  • Para clipes críticos de identidade, prefira o Gráfico 2 ou Gráfico 3 com MiniMaxH3ReferenceToVideo e considere ref_image_size: max.
  • Precisa de negativos no Gráfico 1? Troque por um CFGGuider ou mude para o Gráfico 2/3 onde o ramo negativo já está conectado.
  • Recursos do projeto: nó personalizado ComfyUI-H3-FunControl, ControlNet no formato de curva MiniMax-H3-Fun-Controlnet-Union, pesos H3 da comunidade MiniMax-H3-experimental, aceleração opcional ComfyUI-SolAttn_triton.

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos sinceramente a wyzborrero pelo nó personalizado ComfyUI-H3-FunControl, alibaba-pai pelo modelo MiniMax H3 Fun ControlNet Union, Kijai pelos arquivos de modelo experimental MiniMax H3, kijai pelo nó opcional de aceleração SolAttn Triton, e RunComfy pelo fluxo de trabalho Cloud Save por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação e repositórios originais vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.