MiniMax H3 Fun Control: geração controlável de imagem de referência para vídeo no ComfyUI#
Esta tela pronta para RunComfy traz MiniMax H3 Fun Control para o ComfyUI para imagem para vídeo precisa e prontamente configurável. Ela segue sua passagem de estrutura (profundidade, canny, pose, HED ou MLSD) enquanto respeita uma referência de primeiro quadro ou referências completas de personagem/estilo. O layout padrão vem com três ramos prontos para executar, para que você possa começar simples e aumentar o controle conforme necessário.
O Gráfico 1 executa um fluxo de controle único e está habilitado por padrão. O Gráfico 2 adiciona uma configuração de profundidade mais pose em cadeia com referências de personagem/estilo e sugestão negativa verdadeira. O Gráfico 3 espelha o Gráfico 2, mas inclui um patch opcional de aceleração SolAttn. Você pode habilitar ou ignorar qualquer ramo preparado após carregar o fluxo de trabalho.
Modelos principais no fluxo de trabalho Comfyui MiniMax H3 Fun Control#
- MiniMax H3 base UNet (fl2va) e UNet de referência para vídeo (ref2va). Estes são os backbones de vídeo que sintetizam o movimento a partir de um prompt e primeiro quadro (fl2va) ou de referências de imagem persistentes (ref2va). Pesos empacotados pela comunidade para ComfyUI estão disponíveis no conjunto experimental MiniMax H3 no Hugging Face: MiniMax-H3-experimental.
- MiniMax H3 Video VAE e Audio VAE. Estes codificam e decodificam os fluxos de vídeo e áudio latentes usados por H3 para que o pipeline possa amostrar eficientemente, e depois transformar os resultados de volta em pixels e som. Veja o mesmo pacote de modelos: MiniMax-H3-experimental.
- Codificador de texto da família Qwen-VL. O fluxo de trabalho usa uma variante ajustada MiniMax da série Qwen-VL para analisar prompts e alimentar o condicionamento de texto no H3. Para informações sobre esta família de modelos, veja o repositório oficial: Qwen2-VL.
- MiniMax H3 Fun ControlNet Union (formato de curva). Este único ControlNet suporta múltiplas passagens de controle (profundidade, canny, HED, pose, MLSD) e permite que você direcione a estrutura da cena através dos quadros. Use o checkpoint no formato de curva do lançamento oficial: MiniMax-H3-Fun-Controlnet-Union.
Como usar o fluxo de trabalho Comfyui MiniMax H3 Fun Control#
A tela contém três ramos preparados. O Gráfico 1 (controle único) está habilitado, o Gráfico 2 (profundidade+pose com referências) e o Gráfico 3 (aceleração SolAttn) estão ignorados. Ative um ramo quando estiver pronto; apenas o ramo habilitado será executado.
01 · Controle Único · HABILITADO POR PADRÃO#
01 · Modelos Este grupo carrega o MiniMax H3 base UNet, o codificador de texto Qwen-VL e os VAEs H3 para vídeo e áudio. Ele também carrega o MiniMax H3 Fun ControlNet Union no formato de curva para que um único fluxo de controle possa guiar a estrutura. Você não precisa alterar nada aqui, a menos que queira trocar pesos de um conjunto de checkpoints diferente.
01 · CONTROLE: este é o nó Carregue um vídeo de controle que corresponda à largura, altura e contagem de quadros de saída desejada; o nó verifica e aumentará ambos os números se eles discordarem. Escolha qualquer uma das passagens suportadas (profundidade, canny, pose, HED, MLSD) com base no que melhor captura seu movimento e silhuetas. A força age como um orçamento de adesão; 1.0 é o ponto de partida certo para um controle único, e empurrar mais tende a saturar o detalhe. A janela de agendamento de controle define quando o controle está ativo durante a amostragem; terminar a janela por volta de 0.6 geralmente bloqueia a estrutura cedo enquanto libera etapas tardias para adicionar textura fina. Use o checkpoint ControlNet no formato de curva; a variante de largura total não será carregada neste nó.
01 · Condicionamento Escreva seu prompt e opcionalmente forneça um primeiro quadro. Com um primeiro quadro, o modelo é inicializado a partir dessa imagem e tende a preservar a composição; sem ele, apenas o prompt orienta a aparência. Defina largura, altura e comprimento aqui; MiniMax H3 ajusta o comprimento à sua grade válida em 24 fps (17n + 5), então planeje sua edição em torno dessas contagens. Manter os primeiros e últimos quadros não definidos usa o início e o fim naturais do modelo; adicionar um último quadro não é necessário para este ramo.
01 · Amostragem O amostrador executa com um guia básico que não tem CFG e nenhuma entrada negativa, o que significa que negativos no seu texto são ignorados aqui; use o Gráfico 2 ou mude para um guia CFG se precisar de negativos. O deslocamento sigma é aplicado para equilibrar os cronogramas de difusão de vídeo e áudio para uma decodificação estável posteriormente. A escolha de cronograma e amostrador neste ramo são ajustadas para trocas sensatas entre qualidade e velocidade; uma vez que você tenha uma linha de base, sinta-se à vontade para experimentar.
01 · Saída Os latentes amostrados são decodificados com o H3 Video VAE e, se presente, o Audio VAE. Quadros e áudio são muxados em um vídeo e salvos em suas saídas. Use o resultado salvo como uma verificação de estilo e retorne à força de controle, janela de agendamento ou prompt conforme necessário.
02 · Referência de Profundidade + Pose · IGNORADO POR PADRÃO#
02 · Modelos Este ramo carrega o H3 UNet de referência para vídeo, que é projetado para manter identidade e estilo de imagens paradas em todos os quadros. Ele compartilha o codificador de texto Qwen-VL e os VAEs H3. O MiniMax H3 Fun ControlNet Union no formato de curva é reutilizado aqui para dirigir a estrutura.
02 · CONTROLE: encadeado, forças SOMAM para cerca de 1.0 Dois nós Aplicar são encadeados para que cada fluxo de controle adicione sua própria contribuição, primeiro profundidade, depois pose. Trate a força como um orçamento: as duas forças somam, e empurrar o total bem acima de 1.0 apagará detalhes e borrará o sujeito. A profundidade é ótima para geometria grosseira e posicionamento de câmera; a pose trava membros e articulação. Ajuste configurando uma força para zero e ouvindo a outra, depois traga-as juntas perto de um total de 1.0.
02 · Condicionamento e referências Use MiniMaxH3ReferenceToVideo para alimentar imagens de referência reais junto com seu prompt para que identidade e estilo persistam em todos os quadros. ref_image_size de max oferece a identidade mais forte (tokens de referência maiores) a um custo computacional; match é mais rápido e geralmente suficiente para controle de estilo mais solto. Adicione um ramo negativo com as mesmas referências e seu texto negativo para que o guia CFG possa subtrair o que você não quer. Comprimento, tamanho e contagem de quadros seguem as mesmas regras do Gráfico 1.
02 · Amostragem Muda para um CFGGuider para que o condicionamento negativo realmente se aplique; a orientação adiciona custo porque o modelo avalia tanto o positivo quanto o negativo a cada passo. As etapas são configuradas mais altas aqui para dar espaço aos controles encadeados e referências para resolver; você pode reduzir para velocidade uma vez que goste da aparência. O controle de sementes assegura a reprodutibilidade; mantenha-o fixo enquanto equilibra o orçamento de profundidade e pose.
02 · Saída Decodificação e montagem de vídeo espelham o Gráfico 1. Se a saída corresponder à estrutura, mas parecer excessivamente suave, reduza o final da janela de controle para 0.6 ou diminua ligeiramente a força total de controle. Se a identidade escapar, aumente ref_image_size ou adicione uma segunda imagem de referência.
03 · Aceleração Sol-Attn Opcional · IGNORADO POR PADRÃO#
03 · Modelos Este ramo espelha os modelos e controles do Gráfico 2, mas adiciona um patch de aceleração de atenção esparsa. Ele requer a extensão Triton SolAttn. Se você não tiver Triton ou o pacote de nós instalado, deixe este ramo ignorado.
03 · CONTROLE: encadeado, forças SOMAM para cerca de 1.0 A mesma cadeia de profundidade mais pose se aplica; mantenha a força combinada perto de 1.0 para resultados nítidos. Use a mesma abordagem de ajuste do Gráfico 2 para encontrar a divisão que melhor se adapta ao seu plano e tamanho do sujeito.
03 · Condicionamento e referências Idêntico ao Gráfico 2. Mantenha as referências consistentes nos ramos positivo e negativo para que o CFG subtraia os recursos corretos. Se você deseja máxima identidade, combine ref_image_size: max com uma contagem de passos ligeiramente maior.
03 · OPCIONAL: atenção esparsa SolAttnPatch acelera blocos pesados de atenção enquanto preserva a qualidade onde mais importa. Deixe morton desligado, pois reordenar tokens de vídeo em ordem Z desalinham onde o ControlNet aplica seus deslocamentos por linha e efetivamente remove o controle. Manter os primeiros e últimos blocos transformadores exatos é um padrão seguro quando você deseja velocidade sem perder adesão. Espere execuções mais rápidas após o Triton compilar seus kernels; a primeira passagem mede principalmente o tempo de compilação.
03 · Amostragem e Saída A amostragem, decodificação e salvamento seguem o Gráfico 2. Compare SolAttn ligado versus desligado com uma semente fixa para julgar a qualidade e aderência para seu conteúdo. Se o controle parecer mais fraco com SolAttn, verifique se morton está desativado antes de ajustar as forças.
Nós-chave no fluxo de trabalho Comfyui MiniMax H3 Fun Control#
Apply H3 Fun ControlNet (#23) Adiciona um fluxo de controle ao modelo atual e leva um lote de quadros de controle extraídos do seu vídeo de controle. Use strength como um orçamento de adesão: para um único controle, comece em 1.0; ao encadear controles, mantenha a soma perto de 1.0 para evitar detalhes apagados. A janela de cronograma (start_percent, end_percent) determina quando o controle está ativo; terminar perto de 0.6 muitas vezes preserva texturas que o controle não pode descrever.
Prompt + primeiro quadro -> condicionamento (#31) Constrói o condicionamento a partir do seu prompt de texto e um primeiro quadro opcional para que o modelo possa respeitar a composição inicial. Se você omitir o primeiro quadro, apenas o prompt orienta o conteúdo. Largura, altura e comprimento vivem aqui; H3 aceita comprimentos na sua grade 17n + 5 a 24 fps, então planeje edições para essas durações.
Positivo: referências + prompt (#1031) Alimenta referências de imagem persistentes e texto de prompt no H3 para que identidade e estilo carreguem através de cada quadro. ref_image_size de max usa tokens maiores para identidade mais forte a custo mais alto; match é mais rápido com pressão de identidade mais leve. Emparelhe isso com um ramo negativo e CFGGuider se você precisar de exclusões fortes.
CFGGuider: o negativo só funciona aqui (#1040) Habilita orientação livre de classificadores para que o condicionamento negativo tenha efeito. Orientação mais alta fortalece a adesão ao prompt e referência, mas aumenta o cálculo porque cada passo executa tanto o positivo quanto o negativo. Para briefs de estilo longos e específicos, um cfg moderado pode melhorar significativamente a adesão; teste lado a lado com uma semente fixa.
Mudança de Sigma (vídeo 12 / áudio 3) (#24) Ajusta cronogramas de difusão para dar aos caminhos de vídeo e áudio perfis sigma apropriados antes da amostragem. Mantenha isso na cadeia quando planejar decodificar áudio para que o VAE de áudio receba uma distribuição latente compatível.
Sol-Attn (OPCIONAL, precisa do pacote de nós SolAttn + Triton) (#2060) Aplica kernels de atenção esparsa para acelerar H3 sem mudar o gráfico. Deixe morton desativado; ativá-lo reordena tokens e faz com que a contribuição do ControlNet perca as linhas pretendidas, o que parece uma saída perfeita que simplesmente ignora o controle. Para acelerações conservadoras, mantenha os primeiros e últimos blocos transformadores exatos e perfis após a compilação do Triton.
BasicScheduler (#42) Fornece o cronograma sigma e a contagem de passos para amostragem. Para tomadas controladas de perto, alguns passos a mais podem ajudar a estabilizar a estrutura antes que o controle desapareça; para passagens de estilo rápidas, reduza passos para economizar tempo. Combine ajustes de cronograma com a janela de controle para equilibrar adesão e textura.
Extras opcionais#
- O vídeo de controle deve corresponder exatamente à largura, altura e contagem de quadros da geração; o nó verifica e aumenta ambos os números se diferirem.
- Use o checkpoint ControlNet no formato de curva; o lançamento original de largura total não será carregado em
H3FunControlLoader. - Se sua passagem de controle tiver grandes áreas sem características, termine a janela de controle perto de 0.6 para que etapas tardias possam adicionar textura do prompt.
- Para clipes críticos de identidade, prefira o Gráfico 2 ou Gráfico 3 com
MiniMaxH3ReferenceToVideoe considereref_image_size: max. - Precisa de negativos no Gráfico 1? Troque por um
CFGGuiderou mude para o Gráfico 2/3 onde o ramo negativo já está conectado. - Recursos do projeto: nó personalizado ComfyUI-H3-FunControl, ControlNet no formato de curva MiniMax-H3-Fun-Controlnet-Union, pesos H3 da comunidade MiniMax-H3-experimental, aceleração opcional ComfyUI-SolAttn_triton.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos sinceramente a wyzborrero pelo nó personalizado ComfyUI-H3-FunControl, alibaba-pai pelo modelo MiniMax H3 Fun ControlNet Union, Kijai pelos arquivos de modelo experimental MiniMax H3, kijai pelo nó opcional de aceleração SolAttn Triton, e RunComfy pelo fluxo de trabalho Cloud Save por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação e repositórios originais vinculados abaixo.
Recursos#
- wyzborrero/ComfyUI-H3-FunControl
- GitHub: wyzborrero/ComfyUI-H3-FunControl
- alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
- Hugging Face: alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
- Kijai/MiniMax-H3-experimental
- Hugging Face: Kijai/MiniMax-H3-experimental
- kijai/ComfyUI-SolAttn_triton
- GitHub: kijai/ComfyUI-SolAttn_triton
- RunComfy/Cloud Save workflow
- Docs / Release Notes: [RunComfy Cloud Save workflow](https://www.runcomfy.com/comfyui-workflows/my-workflows?shared_workflow=4771f265-1e12-d21b-7json
- Docs / Release Notes: RunComfy Cloud Save workflow
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

