MiniMax H3 lançado oficialmente: modelo multimodal universal de vídeo com suporte a saída 2K e áudio estéreo nativo
A MiniMax lançou oficialmente o MiniMax H3, um modelo multimodal universal de geração de vídeo capaz de compreender texto, imagem, vídeo e áudio em um quadro unificado de geração.

Lançamento do MiniMax H3: modelo multimodal universal de vídeo com suporte a saída 2K e áudio estéreo nativo
Introdução
A MiniMax lançou oficialmente o MiniMax H3, um modelo multimodal universal de geração de vídeo capaz de compreender texto, imagem, vídeo e áudio em um mesmo fluxo de trabalho generativo.
Este lançamento marca uma mudança: não se trata mais de tratar geração de vídeo a partir de texto, vídeo a partir de imagem, geração com referência de vídeo, sincronização de áudio e edição como tarefas independentes. Em vez disso, o H3 foi projetado para receber simultaneamente múltiplos tipos de contexto e usar instruções em linguagem natural para descrever como esses conteúdos de referência devem interagir entre si.
Segundo a MiniMax, o H3 oferece suporte a saída de vídeo com áudio estéreo nativo, gerando clipes de até 15 segundos e fornecendo resolução de 2K por meio da API atual.
A empresa posiciona o modelo para o segmento de criação de conteúdo comercial, incluindo publicidade, branding, e-commerce, design de produtos, UI/UX e jogos.

O lançamento também enfatiza o custo de geração. A MiniMax afirma que o H3, mantendo capacidades de referência multimodal e saída em alta resolução, possui custo por segundo de geração inferior ao de muitos sistemas líderes de geração de vídeo.
H3: de tarefas de vídeo especializadas à geração multimodal unificada
Os primeiros modelos de vídeo eram frequentemente organizados em torno de fluxos de trabalho independentes.
Criadores podiam escolher um modelo ou interface para geração de vídeo a partir de texto, outro para animar imagens, e ainda adotar processos distintos para edição com referência de vídeo ou sincronização de áudio.
O H3 busca unificar esses casos de uso em um contexto multimodal compartilhado.
A documentação atual da API da MiniMax descreve três modos principais de geração:
| Modo de geração | Entrada | Uso típico |
|---|---|---|
| Vídeo a partir de texto | Prompt de texto | Gerar novo vídeo a partir de descrição textual |
| Vídeo a partir de imagem (primeiro/último quadro) | Prompt + primeiro e/ou último quadro | Animar imagens ou controlar início e fim do clipe |
| Geração com referência | Prompt + imagens, vídeos e/ou áudios | Preservar sujeito, movimento, estilo de câmera, som ou ritmo de edição |
Portanto, o modelo não se limita a transformar uma frase em vídeo.
Ele também pode usar mídia de referência como parte do contexto de geração.
Para geração com referência, a API da MiniMax suporta as seguintes combinações:
- Até 9 imagens de referência
- Até 3 vídeos de referência
- Até 3 áudios de referência
- Total de até 12 arquivos de mídia
Os vídeos de referência podem ter duração total de até 15 segundos, e o áudio deve estar acompanhado de pelo menos uma referência de imagem ou vídeo.
Essa estrutura permite que criadores descrevam relações entre diferentes entradas sem precisar tratar cada modalidade como uma etapa separada e manual.
Linguagem natural como ponte entre modalidades
Fontes da AIBase descrevem um dos conceitos centrais do H3 como Representação Omnidisciplinar Contextual (Contextual Omni Representation).
A ideia é usar linguagem natural como elo entre diferentes tipos de mídia.
Os usuários podem fornecer múltiplas referências simultaneamente e descrever, em linguagem cotidiana, as relações esperadas entre elas.
Por exemplo, um fluxo de trabalho pode, conceitualmente, pedir que o H3:
- Reutilize o estilo de movimento de câmera de um vídeo de referência
- Preserve a pessoa presente em uma imagem de referência
- Siga o ritmo ou som de uma referência de áudio
- Aplique todas essas restrições simultaneamente a uma nova cena gerada
Isso difere fundamentalmente de um simples prompt de texto para vídeo.
O modelo precisa entender não apenas o conteúdo de cada entrada de mídia, mas também o papel que cada entrada deve desempenhar na geração final.
A API pública da MiniMax reflete esse design por meio de entradas multimodais baseadas em papéis, tais como:
first_frame(primeiro quadro)last_frame(último quadro)reference_image(imagem de referência)reference_video(vídeo de referência)reference_audio(áudio de referência)
Os usuários ainda precisam fornecer um prompt de texto, mas este pode atuar como uma camada de instrução sobre múltiplas fontes de mídia.
H3 suporta áudio estéreo nativo e saída 2K com até 15 segundos
A MiniMax afirma que o H3 pode gerar diretamente vídeos com áudio estéreo nativo, sem necessidade de um fluxo separado de geração de áudio posteriormente.
A documentação atual para desenvolvedores lista:
- Nome do modelo:
MiniMax-H3 - Resolução de saída: 2K
- Duração da saída: até 15 segundos
- Proporções comuns: suportadas
- Proporção adaptativa: disponível para fluxos de referência adequados
A referência da API atualmente aceita durações inteiras de 4 a 15 segundos, enquanto guias mais avançados para desenvolvedores mencionam uma faixa normal de 5 a 15 segundos.
Essa pequena diferença documental merece atenção no desenvolvimento via API: os desenvolvedores devem seguir o padrão atual do endpoint correspondente à sua conta e SDK.
Para geração puramente por texto, é necessário especificar explicitamente a proporção de aspecto.
As proporções suportadas na referência atual da API incluem:
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
Fluxos com referência também podem usar dimensões adaptativas.
Testes iniciais focados em criação de conteúdo comercial
A MiniMax afirma que os primeiros testes demonstraram forte desempenho em diversas áreas de aplicação prática.
Essas áreas incluem:
- Seguimento de instruções
- Apresentação de marca e texto
- Transferência de movimento de vídeo para vídeo
- Geração multimodal
- Edição controlada
- Produção criativa comercial
A empresa destacou especialmente os seguintes casos de uso:
- Publicidade
- Construção de marca
- E-commerce
- Design de produtos
- UI/UX (interface/experiência do usuário)
- Jogos
Essas descrições de desempenho vêm da própria MiniMax e de matérias relacionadas ao lançamento, e não de benchmarks públicos independentes.
Essa distinção é importante.
A qualidade da geração de vídeo dificilmente pode ser resumida em uma única pontuação. Um modelo pode se destacar em transferência de movimento, mas ser relativamente fraco em detalhes finos de rosto, tipografia, consistência de identidade em longo prazo ou interações complexas entre múltiplos objetos.
Portanto, a forma mais confiável de avaliar se o H3 é adequado para produção é testá-lo com o conteúdo que a equipe realmente precisa criar.
H3 adota nova arquitetura tecnológica multimodal
A reportagem da AIBase e os materiais de lançamento da MiniMax descrevem diversas tecnologias por trás do H3:
- Representação Omnidisciplinar Contextual (Contextual Omni Representation)
- H3-VAE
- H3-Omni Transformer (Transformer Omnimodal)
- Regeneração em Contexto (In-Context Regeneration)
A documentação pública da API atualmente foca mais em como usar o H3 do que em publicar detalhes técnicos completos.
Os artigos de pesquisa relacionados a esses componentes ainda não foram divulgados; portanto, descrições detalhadas da arquitetura devem ser vistas como informativos comerciais da MiniMax, a menos que um relatório técnico forneça detalhes adicionais reproduzíveis.
Representação Omnidisciplinar Contextual
Esse componente tem como objetivo representar texto, imagem, vídeo e áudio em um contexto compartilhado.
Sua função é ajudar o H3 a compreender a relação entre múltiplas fontes de referência e instruções em linguagem natural.
H3-VAE
O H3-VAE é descrito como parte da pilha de representação e geração de vídeo do modelo.
Um VAE de vídeo normalmente comprime informações de vídeo de alta dimensão em uma representação latente mais gerenciável, usada para geração e decodificação.
Nos documentos analisados no momento da redação, a MiniMax ainda não publicou detalhes técnicos suficientes para descrever de forma independente o design exato do H3-VAE.
H3-Omni Transformer
O H3-Omni Transformer é posicionado como o componente do modelo responsável pela geração multimodal unificada.
Seu nome reflete o objetivo mais amplo do modelo: um único sistema capaz de raciocinar sobre múltiplos tipos de mídia, em vez de alternar entre diferentes modelos especialistas independentes.
Regeneração em Contexto
A MiniMax também lista a regeneração em contexto como parte da pilha tecnológica do H3.
Sua função pretendida é usar informações já presentes no contexto multimodal para melhorar a qualidade da geração.
Tal como acontece com outros nomes de arquiteturas, o fluxo de treinamento detalhado e os resultados dos experimentos de ablação não foram fornecidos na documentação pública da API no momento do lançamento.
O preço do H3 é baseado na duração do vídeo
O artigo da AIBase destacou o custo-benefício do H3.
Os preços oficiais atuais de pagamento por uso da MiniMax oferecem uma referência numérica mais clara.
| Resolução | Preço oficial da API |
|---|---|
| 2K | US$ 0,13 por segundo gerado |
| 768P | US$ 0,09 por segundo gerado |
Os materiais de referência de entrada possuem regras de cobrança separadas.
A MiniMax lista atualmente:
- Referência de áudio: gratuita
- As primeiras 5 imagens de referência: gratuitas
- Imagens de referência adicionais: US$ 0,04 cada
- Vídeo de referência: cobrado com base na duração do vídeo de entrada e na resolução de saída desejada
A MiniMax afirma que, calculando por segundo, o custo do H3 em resolução 2K é inferior a um terço do custo dos modelos concorrentes mais populares, e em 768P é inferior à metade do preço das alternativas 720P mais comuns.
Essas comparações relativas são declarações do fabricante, pois os resultados dependem em grande parte dos modelos concorrentes incluídos, pacotes, resoluções e métodos de cobrança.
Ao planejar o orçamento, os desenvolvedores devem primeiro considerar as tarifas oficiais publicadas do H3 e, em seguida, fazer uma comparação precisa com as alternativas que realmente utilizam.
Por que o custo por segundo é importante para vídeos de IA
O custo da geração de vídeo cresce linearmente com a duração da saída, portanto, as despesas podem aumentar rapidamente.
Isso muda a economia da iteração por tentativa e erro.
Os criadores raramente geram o segmento perfeito na primeira tentativa.
Um fluxo de produção completo pode envolver:
- Múltiplas experimentações de prompts
- Múltiplas tentativas de consistência de personagem
- Variações de movimento de câmera
- Diferentes proporções de tela
- Correções de marca ou produto
- Geração final em alta resolução
Mesmo uma pequena redução no custo por segundo pode resultar em economias acumuladas consideráveis quando as equipes criam dezenas ou centenas de versões alternativas.
Isso é especialmente importante nos seguintes cenários:
No setor de publicidade e comércio eletrônico, uma campanha de marketing pode exigir:
- Vários produtos
- Vários mercados
- Diferentes idiomas
- Formatos horizontais e verticais
- Múltiplas variações criativas
Portanto, o posicionamento de preço do H3 não considera apenas o custo do vídeo final individual, mas também a economia da iteração.
A geração com referências é uma das capacidades mais importantes do H3
A API atual da MiniMax suporta geração com referências combinando imagem, vídeo e áudio.
Isso permite fluxos de trabalho como:
- Manter a consistência do produto ou personagem a partir de uma imagem
- Seguir o movimento de um vídeo de referência
- Utilizar o comportamento de câmera de outro clipe de vídeo
- Usar uma trilha de áudio de referência para controle temporal ou dublagem
- Combinar múltiplos tipos de materiais de referência em uma única solicitação
A MiniMax afirma que o H3 pode preservar as características do sujeito ou material de referência em toda a saída gerada.
Isso é particularmente importante para trabalhos comerciais.
Prompts de texto genéricos podem gerar clipes visualmente atraentes, mas ainda podem alterar:
- Logotipos
- Proporções do produto
- Roupas
- Identidade do personagem
- Embalagens
- Cores da marca
Fluxos de trabalho orientados por referência oferecem mais controle sobre essas variáveis.
No entanto, isso não garante preservação perfeita da identidade, portanto, as equipes devem revisar cada material gerado antes da publicação.
O controle do primeiro e último quadro adiciona outro fluxo de trabalho de produção
O H3 também suporta o uso do primeiro quadro, do último quadro ou de ambos.
Isso é útil quando os criadores já sabem como o plano deve começar ou terminar.
Os usos típicos incluem:
- Dar movimento a uma imagem estática de produto
- Criar transições entre duas imagens
- Combinar o início de um plano com o final de outro
- Controlar o estado final de uma transformação
- Construir sequências de edição mais previsíveis
A API da MiniMax trata a geração de primeiro/último quadro e a geração com referências como dois modos independentes.
Uma solicitação não pode misturar os papéis first_frame ou last_frame com reference_image, reference_video ou reference_audio na mesma tarefa.
Essa limitação é muito importante para os desenvolvedores que integram a API.
A MiniMax planeja publicar os pesos do modelo H3
Uma das partes mais notáveis do anúncio é o plano da MiniMax de disponibilizar publicamente os pesos do H3.
A empresa afirma que os pesos estão previstos para serem lançados nos próximos dias, sujeitos às leis e regulamentos aplicáveis.
A MiniMax acredita que a publicação dos pesos ajuda a:
- Expandir o ecossistema de modelos abertos
- Apoiar versões personalizadas
- Acelerar a adaptação a diferentes hardwares
- Reduzir a dependência de um único serviço hospedado
- Incentivar experimentação em pesquisa e implantação
A empresa também afirmou que a compatibilidade de hardware foi considerada desde o início do design do H3, incluindo compatibilidade com uma gama mais ampla de hardwares de IA.
No momento da redação deste artigo, as páginas oficiais da MiniMax no GitHub e Hugging Face estão acessíveis publicamente, mas nenhum repositório oficial confirmado dos pesos do H3 foi vinculado na documentação oficial da API revisada aqui.
Isso significa que os desenvolvedores devem aguardar os links oficiais da MiniMax, em vez de baixar pesos de fontes não autorizadas.
Correção sobre a afirmação de "primeiro modelo chinês de vídeo com pesos abertos"
A AIBase
afirma neste artigo que o lançamento do H3 é a primeira vez que um modelo chinês de geração de vídeo de base abre seus pesos para a comunidade.
De forma ampla, essa afirmação é historicamente imprecisa.
A Alibaba publicou os pesos e códigos de inferência de seu modelo de geração de vídeo Wan2.1 em fevereiro de 2025, e variações posteriores do Wan2.1 também foram divulgadas publicamente.
O ponto de diferenciação mais sólido do H3 é sua arquitetura unificada multimodal universal, incluindo texto, imagem, vídeo e áudio de referência, além de saída nativa de áudio e vídeo — e não o fato de ser o primeiro modelo chinês de vídeo a abrir pesos.
Pesos abertos ajudam na adaptação de hardware
Em mercados onde as organizações desejam mais controle sobre a infraestrutura, pesos de modelos abertos são essenciais.
APIs hospedadas são mais fáceis de começar, mas pesos abertos permitem:
- Implantação em infraestrutura privada
- Otimização de kernels para hardware local
- Quantização do modelo
- Construção de runtimes de inferência dedicados
- Ajuste fino ou adaptação de componentes quando permitido pela licença
- Integração com aceleradores nacionais
- Manutenção de dados sensíveis em ambientes controlados
Se o H3 pode ou não ser efetivamente auto-hospedado dependerá de informações ainda não divulgadas no artigo original, incluindo:
- Número de parâmetros
- Requisitos de memória de vídeo
- Precisão de inferência
- Requisitos de paralelização
- Configuração mínima de hardware
- Termos de licenciamento
- Suporte a treinamento ou ajuste fino
Até que os pesos oficiais e a documentação técnica sejam publicados, quaisquer alegações sobre compatibilidade com GPUs de consumo ou custos de auto-hospedagem são especulativas.
A MiniMax reconhece que o H3 ainda tem espaço para melhorias
A MiniMax também afirmou que o modelo não é o ponto final da série H.
A empresa indicou as seguintes direções:
- Detalhes finos de imagem
- Tamanho geral do modelo
- Expansão adicional de capacidades
A MiniMax afirmou que pretende continuar expandindo os modelos da série H e, eventualmente, integrar as capacidades das famílias de modelos H e M.
A família H foca atualmente em geração multimodal, especialmente vídeo.
A família M inclui os modelos de linguagem e agente da MiniMax.
Uma fusão futura pode apontar para um sistema em que uma única família de modelos possa lidar com:
- Raciocínio de linguagem
- Execução de agentes
- Compreensão de imagens
- Compreensão de vídeo
- Áudio
- Criação de vídeo
- Edição
Isso ainda é uma direção visionária, e não um produto unificado já lançado.
Como o H3 muda os fluxos de trabalho de geração de vídeo
A contribuição mais importante do H3 não é apenas a resolução mais alta.
A maior mudança é que várias operações criativas que antes eram independentes agora podem ser realizadas em um único contexto.
Os criadores podem passar de:
Gere um vídeo com base nesta frase.
Para:
Use esta pessoa, siga o movimento deste vídeo, mantenha esta identidade visual,
obtenha dicas de ritmo deste áudio e crie uma nova cena com base neste prompt.
Isso muda o papel do modelo de vídeo.
Ele deixa de ser um gerador de uso único e se torna um motor criativo multimodal.
Para equipes comerciais, o valor dependerá de quão consistentemente o H3 consegue manter a consistência das referências, seguir instruções complexas, renderizar informações de marca e se manter econômico.
Tradição que atravessa gerações.
Perguntas frequentes
O que é o MiniMax H3?
O MiniMax H3 é um modelo multimodal universal de geração de vídeo da MiniMax. Ele pode aceitar texto, imagem, vídeo e áudio como contexto, e suporta geração de vídeo a partir de texto, de imagem, com base em materiais de referência e criação de vídeo controlada.
Quais resoluções o MiniMax H3 suporta?
A documentação atual da API da MiniMax lista 2K como a principal resolução de saída do H3. A página de preços também lista uma faixa de cobrança para 768P.
Qual é a duração máxima de vídeo do MiniMax H3?
A documentação oficial do H3 suporta saídas de vídeo de até 15 segundos. A referência da API atualmente aceita valores inteiros de duração entre 4 e 15 segundos.
O MiniMax H3 gera áudio?
Sim. A MiniMax descreve o H3 como suportando saída de áudio estéreo nativa juntamente com vídeo, portanto, o áudio pode ser gerado como parte do fluxo de trabalho de vídeo, sem depender sempre de um modelo separado de pós-produção.
Quanto custa a API do MiniMax H3?
Atualmente, a MiniMax define o preço do H3 em US$ 0,13 por segundo para geração em resolução 2K e US$ 0,09 por segundo para resolução 768P. De acordo com as regras de cobrança publicadas, vídeos de referência e imagens adicionais podem aumentar os custos de material de entrada.
O H3 pode usar imagens, vídeos e áudio de referência ao mesmo tempo?
Sim. A API oficial suporta imagens, vídeos e áudio de referência no mesmo fluxo de trabalho de geração com referência, sujeito a limites de quantidade de arquivos, duração, tamanho e combinações de entrada.
O MiniMax H3 é de código aberto?
A MiniMax anunciou planos de lançar os pesos do modelo H3 nos próximos dias, sujeitos às regulamentações aplicáveis. No momento em que este texto foi escrito, a API oficial já estava disponível, mas os documentos oficiais consultados nesta ocasião ainda não confirmavam um link para um repositório público de pesos do H3.
O H3 é o primeiro modelo de vídeo com pesos de código aberto da China?
Não, não nesse sentido histórico amplo. A Alibaba lançou os pesos do modelo de geração de vídeo Wan2.1 em 2025. O que torna o H3 mais notável é a combinação de referências multimodais e capacidades nativas de geração de áudio e vídeo em um único modelo de vídeo de propósito geral.
Ferramentas relacionadas
- API MiniMax H3: Documentação oficial para os fluxos de trabalho de texto para vídeo, imagem para vídeo e geração com referência do H3.
- Plataforma aberta MiniMax: Plataforma de desenvolvedores da MiniMax, oferecendo chaves de API, acesso a modelos, cobrança e recursos para desenvolvedores.
- GitHub da MiniMax: Organização oficial da empresa no GitHub, para código público e projetos relacionados a modelos.
- Hugging Face da MiniMax: Organização oficial da MiniMax no Hugging Face, para recursos públicos de modelos.
- Wan2.1: Série de modelos de geração de vídeo de código aberto da Alibaba, servindo como referência histórica para modelos de vídeo com pesos de código aberto.
Links relacionados
- Site oficial da MiniMax: Site oficial da MiniMax, que atualmente lista o H3 como seu novo modelo de geração de vídeo.
- Guia de geração de vídeo MiniMax H3: Documentação oficial sobre especificações do modelo, modos suportados, limites de entrada e fluxos de trabalho.
- Referência da API MiniMax H3: Especificação oficial do endpoint V2 para criar tarefas de geração de vídeo H3.
- Preços da API MiniMax: Preços atuais oficiais de pagamento conforme o uso para o H3 e suas regras de cobrança de mídia de referência.
- GitHub oficial da MiniMax: Organização oficial para acompanhar código publicado e recursos de modelos.
- Alibaba: Modelo de vídeo de código aberto Wan 2.1: Confirmação histórica oficial de que modelos de vídeo com pesos de código aberto da China já estavam disponíveis antes do H3.
- Repositório GitHub do Wan 2.1: Código de inferência público e pesos da família anterior de geração de vídeo de código aberto da Alibaba.
Resumo
O MiniMax H3 integra texto, imagem, vídeo e áudio em um único fluxo de trabalho de geração de vídeo de propósito geral. Ele suporta saídas de até 15 segundos em 2K, áudio estéreo nativo, controle de primeiro/último quadro e geração com referência usando múltiplos tipos de mídia.
Seus diferenciais comerciais concentram-se em dois aspectos: controle e custo. A MiniMax afirma que o H3 tem bom desempenho em seguir instruções, apresentação de marca e transferência de movimento, enquanto sua API oficial atualmente define o preço da geração 2K em US$ 0,13 por segundo e 768P em US$ 0,09 por segundo.
A MiniMax também planeja lançar os pesos do modelo, embora, nos documentos oficiais revisados no momento do lançamento, ainda não houvesse link para um repositório confirmado de pesos do H3.
A mudança mais importante do H3 não é apenas o vídeo 2K — é avançar em direção a um sistema unificado de geração multimodal que entende como texto, imagem, vídeo e áudio devem funcionar juntos.