A MiniMax lançou oficialmente o MiniMax H3, um modelo multimodal universal de geração de vídeo capaz de compreender texto, imagem, vídeo e á...

A MiniMax lançou oficialmente o MiniMax H3, um modelo multimodal universal de geração de vídeo capaz de compreender texto, imagem, vídeo e áudio em um mesmo fluxo de trabalho generativo.
Este lançamento marca uma mudança: não se trata mais de tratar geração de vídeo a partir de texto, vídeo a partir de imagem, geração com referência de vídeo, sincronização de áudio e edição como tarefas independentes. Em vez disso, o H3 foi projetado para receber simultaneamente múltiplos tipos de contexto e usar instruções em linguagem natural para descrever como esses conteúdos de referência devem interagir entre si.
Segundo a MiniMax, o H3 oferece suporte a saída de vídeo com áudio estéreo nativo, gerando clipes de até 15 segundos e fornecendo resolução de 2K por meio da API atual.
A empresa posiciona o modelo para o segmento de criação de conteúdo comercial, incluindo publicidade, branding, e-commerce, design de produtos, UI/UX e jogos.

O lançamento também enfatiza o custo de geração. A MiniMax afirma que o H3, mantendo capacidades de referência multimodal e saída em alta resolução, possui custo por segundo de geração inferior ao de muitos sistemas líderes de geração de vídeo.
Os primeiros modelos de vídeo eram frequentemente organizados em torno de fluxos de trabalho independentes.
Criadores podiam escolher um modelo ou interface para geração de vídeo a partir de texto, outro para animar imagens, e ainda adotar processos distintos para edição com referência de vídeo ou sincronização de áudio.
O H3 busca unificar esses casos de uso em um contexto multimodal compartilhado.
A documentação atual da API da MiniMax descreve três modos principais de geração:
| Modo de geração | Entrada | Uso típico |
|---|---|---|
| Vídeo a partir de texto | Prompt de texto | Gerar novo vídeo a partir de descrição textual |
| Vídeo a partir de imagem (primeiro/último quadro) | Prompt + primeiro e/ou último quadro | Animar imagens ou controlar início e fim do clipe |
| Geração com referência | Prompt + imagens, vídeos e/ou áudios | Preservar sujeito, movimento, estilo de câmera, som ou ritmo de edição |
Portanto, o modelo não se limita a transformar uma frase em vídeo.
Ele também pode usar mídia de referência como parte do contexto de geração.
Para geração com referência, a API da MiniMax suporta as seguintes combinações:
Os vídeos de referência podem ter duração total de até 15 segundos, e o áudio deve estar acompanhado de pelo menos uma referência de imagem ou vídeo.
Essa estrutura permite que criadores descrevam relações entre diferentes entradas sem precisar tratar cada modalidade como uma etapa separada e manual.
Fontes da AIBase descrevem um dos conceitos centrais do H3 como Representação Omnidisciplinar Contextual (Contextual Omni Representation).
A ideia é usar linguagem natural como elo entre diferentes tipos de mídia.
Os usuários podem fornecer múltiplas referências simultaneamente e descrever, em linguagem cotidiana, as relações esperadas entre elas.
Por exemplo, um fluxo de trabalho pode, conceitualmente, pedir que o H3:
Isso difere fundamentalmente de um simples prompt de texto para vídeo.
O modelo precisa entender não apenas o conteúdo de cada entrada de mídia, mas também o papel que cada entrada deve desempenhar na geração final.
A API pública da MiniMax reflete esse design por meio de entradas multimodais baseadas em papéis, tais como:
first_frame (primeiro quadro)last_frame (último quadro)reference_image (imagem de referência)reference_video (vídeo de referência)reference_audio (áudio de referência)Os usuários ainda precisam fornecer um prompt de texto, mas este pode atuar como uma camada de instrução sobre múltiplas fontes de mídia.
A MiniMax afirma que o H3 pode gerar diretamente vídeos com áudio estéreo nativo, sem necessidade de um fluxo separado de geração de áudio posteriormente.
A documentação atual para desenvolvedores lista:
MiniMax-H3A referência da API atualmente aceita durações inteiras de 4 a 15 segundos, enquanto guias mais avançados para desenvolvedores mencionam uma faixa normal de 5 a 15 segundos.
Essa pequena diferença documental merece atenção no desenvolvimento via API: os desenvolvedores devem seguir o padrão atual do endpoint correspondente à sua conta e SDK.
Para geração puramente por texto, é necessário especificar explicitamente a proporção de aspecto.
As proporções suportadas na referência atual da API incluem:
Fluxos com referência também podem usar dimensões adaptativas.
A MiniMax afirma que os primeiros testes demonstraram forte desempenho em diversas áreas de aplicação prática.
Essas áreas incluem:
A empresa destacou especialmente os seguintes casos de uso:
Essas descrições de desempenho vêm da própria MiniMax e de matérias relacionadas ao lançamento, e não de benchmarks públicos independentes.
Essa distinção é importante.
A qualidade da geração de vídeo dificilmente pode ser resumida em uma única pontuação. Um modelo pode se destacar em transferência de movimento, mas ser relativamente fraco em detalhes finos de rosto, tipografia, consistência de identidade em longo prazo ou interações complexas entre múltiplos objetos.
Portanto, a forma mais confiável de avaliar se o H3 é adequado para produção é testá-lo com o conteúdo que a equipe realmente precisa criar.
A reportagem da AIBase e os materiais de lançamento da MiniMax descrevem diversas tecnologias por trás do H3:
A documentação pública da API atualmente foca mais em como usar o H3 do que em publicar detalhes técnicos completos.
Os artigos de pesquisa relacionados a esses componentes ainda não foram divulgados; portanto, descrições detalhadas da arquitetura devem ser vistas como informativos comerciais da MiniMax, a menos que um relatório técnico forneça detalhes adicionais reproduzíveis.
Esse componente tem como objetivo representar texto, imagem, vídeo e áudio em um contexto compartilhado.
Sua função é ajudar o H3 a compreender a relação entre múltiplas fontes de referência e instruções em linguagem natural.
O H3-VAE é descrito como parte da pilha de representação e geração de vídeo do modelo.
Um VAE de vídeo normalmente comprime informações de vídeo de alta dimensão em uma representação latente mais gerenciável, usada para geração e decodificação.
Nos documentos analisados no momento da redação, a MiniMax ainda não publicou detalhes técnicos suficientes para descrever de forma independente o design exato do H3-VAE.
O H3-Omni Transformer é posicionado como o componente do modelo responsável pela geração multimodal unificada.
Seu nome reflete o objetivo mais amplo do modelo: um único sistema capaz de raciocinar sobre múltiplos tipos de mídia, em vez de alternar entre diferentes modelos especialistas independentes.
A MiniMax também lista a regeneração em contexto como parte da pilha tecnológica do H3.
Sua função pretendida é usar informações já presentes no contexto multimodal para melhorar a qualidade da geração.
Tal como acontece com outros nomes de arquiteturas, o fluxo de treinamento detalhado e os resultados dos experimentos de ablação não foram fornecidos na documentação pública da API no momento do lançamento.
O artigo da AIBase destacou o custo-benefício do H3.
Os preços oficiais atuais de pagamento por uso da MiniMax oferecem uma referência numérica mais clara.
| Resolução | Preço oficial da API |
|---|---|
| 2K | US$ 0,13 por segundo gerado |
| 768P | US$ 0,09 por segundo gerado |
Os materiais de referência de entrada possuem regras de cobrança separadas.
A MiniMax lista atualmente:
A MiniMax afirma que, calculando por segundo, o custo do H3 em resolução 2K é inferior a um terço do custo dos modelos concorrentes mais populares, e em 768P é inferior à metade do preço das alternativas 720P mais comuns.
Essas comparações relativas são declarações do fabricante, pois os resultados dependem em grande parte dos modelos concorrentes incluídos, pacotes, resoluções e métodos de cobrança.
Ao planejar o orçamento, os desenvolvedores devem primeiro considerar as tarifas oficiais publicadas do H3 e, em seguida, fazer uma comparação precisa com as alternativas que realmente utilizam.
O custo da geração de vídeo cresce linearmente com a duração da saída, portanto, as despesas podem aumentar rapidamente.
Isso muda a economia da iteração por tentativa e erro.
Os criadores raramente geram o segmento perfeito na primeira tentativa.
Um fluxo de produção completo pode envolver:
Mesmo uma pequena redução no custo por segundo pode resultar em economias acumuladas consideráveis quando as equipes criam dezenas ou centenas de versões alternativas.
Isso é especialmente importante nos seguintes cenários:
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
No setor de publicidade e comércio eletrônico, uma campanha de marketing pode exigir:
Portanto, o posicionamento de preço do H3 não considera apenas o custo do vídeo final individual, mas também a economia da iteração.
A API atual da MiniMax suporta geração com referências combinando imagem, vídeo e áudio.
Isso permite fluxos de trabalho como:
A MiniMax afirma que o H3 pode preservar as características do sujeito ou material de referência em toda a saída gerada.
Isso é particularmente importante para trabalhos comerciais.
Prompts de texto genéricos podem gerar clipes visualmente atraentes, mas ainda podem alterar:
Fluxos de trabalho orientados por referência oferecem mais controle sobre essas variáveis.
No entanto, isso não garante preservação perfeita da identidade, portanto, as equipes devem revisar cada material gerado antes da publicação.
O H3 também suporta o uso do primeiro quadro, do último quadro ou de ambos.
Isso é útil quando os criadores já sabem como o plano deve começar ou terminar.
Os usos típicos incluem:
A API da MiniMax trata a geração de primeiro/último quadro e a geração com referências como dois modos independentes.
Uma solicitação não pode misturar os papéis first_frame ou last_frame com reference_image, reference_video ou reference_audio na mesma tarefa.
Essa limitação é muito importante para os desenvolvedores que integram a API.
Uma das partes mais notáveis do anúncio é o plano da MiniMax de disponibilizar publicamente os pesos do H3.
A empresa afirma que os pesos estão previstos para serem lançados nos próximos dias, sujeitos às leis e regulamentos aplicáveis.
A MiniMax acredita que a publicação dos pesos ajuda a:
A empresa também afirmou que a compatibilidade de hardware foi considerada desde o início do design do H3, incluindo compatibilidade com uma gama mais ampla de hardwares de IA.
No momento da redação deste artigo, as páginas oficiais da MiniMax no GitHub e Hugging Face estão acessíveis publicamente, mas nenhum repositório oficial confirmado dos pesos do H3 foi vinculado na documentação oficial da API revisada aqui.
Isso significa que os desenvolvedores devem aguardar os links oficiais da MiniMax, em vez de baixar pesos de fontes não autorizadas.
A AIBase
afirma neste artigo que o lançamento do H3 é a primeira vez que um modelo chinês de geração de vídeo de base abre seus pesos para a comunidade.
De forma ampla, essa afirmação é historicamente imprecisa.
A Alibaba publicou os pesos e códigos de inferência de seu modelo de geração de vídeo Wan2.1 em fevereiro de 2025, e variações posteriores do Wan2.1 também foram divulgadas publicamente.
O ponto de diferenciação mais sólido do H3 é sua arquitetura unificada multimodal universal, incluindo texto, imagem, vídeo e áudio de referência, além de saída nativa de áudio e vídeo — e não o fato de ser o primeiro modelo chinês de vídeo a abrir pesos.
Em mercados onde as organizações desejam mais controle sobre a infraestrutura, pesos de modelos abertos são essenciais.
APIs hospedadas são mais fáceis de começar, mas pesos abertos permitem:
Se o H3 pode ou não ser efetivamente auto-hospedado dependerá de informações ainda não divulgadas no artigo original, incluindo:
Até que os pesos oficiais e a documentação técnica sejam publicados, quaisquer alegações sobre compatibilidade com GPUs de consumo ou custos de auto-hospedagem são especulativas.
A MiniMax também afirmou que o modelo não é o ponto final da série H.
A empresa indicou as seguintes direções:
A MiniMax afirmou que pretende continuar expandindo os modelos da série H e, eventualmente, integrar as capacidades das famílias de modelos H e M.
A família H foca atualmente em geração multimodal, especialmente vídeo.
A família M inclui os modelos de linguagem e agente da MiniMax.
Uma fusão futura pode apontar para um sistema em que uma única família de modelos possa lidar com:
Isso ainda é uma direção visionária, e não um produto unificado já lançado.
A contribuição mais importante do H3 não é apenas a resolução mais alta.
A maior mudança é que várias operações criativas que antes eram independentes agora podem ser realizadas em um único contexto.
Os criadores podem passar de:
Gere um vídeo com base nesta frase.
Para:
Use esta pessoa, siga o movimento deste vídeo, mantenha esta identidade visual,
obtenha dicas de ritmo deste áudio e crie uma nova cena com base neste prompt.
Isso muda o papel do modelo de vídeo.
Ele deixa de ser um gerador de uso único e se torna um motor criativo multimodal.
Para equipes comerciais, o valor dependerá de quão consistentemente o H3 consegue manter a consistência das referências, seguir instruções complexas, renderizar informações de marca e se manter econômico.
Tradição que atravessa gerações.
O MiniMax H3 é um modelo multimodal universal de geração de vídeo da MiniMax. Ele pode aceitar texto, imagem, vídeo e áudio como contexto, e suporta geração de vídeo a partir de texto, de imagem, com base em materiais de referência e criação de vídeo controlada.
A documentação atual da API da MiniMax lista 2K como a principal resolução de saída do H3. A página de preços também lista uma faixa de cobrança para 768P.
A documentação oficial do H3 suporta saídas de vídeo de até 15 segundos. A referência da API atualmente aceita valores inteiros de duração entre 4 e 15 segundos.
O MiniMax H3 gera áudio?
Sim. A MiniMax descreve o H3 como suportando saída de áudio estéreo nativa juntamente com vídeo, portanto, o áudio pode ser gerado como parte do fluxo de trabalho de vídeo, sem depender sempre de um modelo separado de pós-produção.
Atualmente, a MiniMax define o preço do H3 em US$ 0,13 por segundo para geração em resolução 2K e US$ 0,09 por segundo para resolução 768P. De acordo com as regras de cobrança publicadas, vídeos de referência e imagens adicionais podem aumentar os custos de material de entrada.
Sim. A API oficial suporta imagens, vídeos e áudio de referência no mesmo fluxo de trabalho de geração com referência, sujeito a limites de quantidade de arquivos, duração, tamanho e combinações de entrada.
A MiniMax anunciou planos de lançar os pesos do modelo H3 nos próximos dias, sujeitos às regulamentações aplicáveis. No momento em que este texto foi escrito, a API oficial já estava disponível, mas os documentos oficiais consultados nesta ocasião ainda não confirmavam um link para um repositório público de pesos do H3.
Não, não nesse sentido histórico amplo. A Alibaba lançou os pesos do modelo de geração de vídeo Wan2.1 em 2025. O que torna o H3 mais notável é a combinação de referências multimodais e capacidades nativas de geração de áudio e vídeo em um único modelo de vídeo de propósito geral.
O MiniMax H3 integra texto, imagem, vídeo e áudio em um único fluxo de trabalho de geração de vídeo de propósito geral. Ele suporta saídas de até 15 segundos em 2K, áudio estéreo nativo, controle de primeiro/último quadro e geração com referência usando múltiplos tipos de mídia.
Seus diferenciais comerciais concentram-se em dois aspectos: controle e custo. A MiniMax afirma que o H3 tem bom desempenho em seguir instruções, apresentação de marca e transferência de movimento, enquanto sua API oficial atualmente define o preço da geração 2K em US$ 0,13 por segundo e 768P em US$ 0,09 por segundo.
A MiniMax também planeja lançar os pesos do modelo, embora, nos documentos oficiais revisados no momento do lançamento, ainda não houvesse link para um repositório confirmado de pesos do H3.
A mudança mais importante do H3 não é apenas o vídeo 2K — é avançar em direção a um sistema unificado de geração multimodal que entende como texto, imagem, vídeo e áudio devem funcionar juntos.
Comece com uma frase e tenha um site completo em minutos.