For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/pt/articles/minimax-h3-on-metaso-768p-ai.md.
O MiniMax H3 acaba de ser lançado, e as discussões ao seu redor já passaram da qualidade do modelo para questões mais práticas: a que custo ...

O MiniMax H3 acabou de ser lançado, e as discussões sobre ele já migraram da qualidade do modelo para uma questão mais prática: quão barato e conveniente é realmente usá-lo para criadores comuns?
O modelo chama atenção por controle condicional unificado de texto, imagem, vídeo e áudio, áudio estéreo nativo, edição de vídeo, geração baseada em referências e saída de até 2K. Também é um modelo de pesos abertos, permitindo que desenvolvedores optem pela implantação própria.
No entanto, ser de código aberto não significa que a implantação local seja simples.
Executar um modelo multimodal de vídeo em larga escala ainda exige lidar com arquivos do modelo, frameworks de inferência, memória GPU, dependências, configuração de ambiente e latência de geração. A documentação oficial de código aberto do MiniMax recomenda frameworks como SGLang, vLLM, Diffusers e ComfyUI, e o exemplo de implantação com SGLang usa quatro GPUs.
Para criadores que só querem transformar uma ideia em vídeo, isso não tem nada a ver com "fazer vídeo".
O artigo original destaca um caminho de terceiros: MetaSo (秘塔AI) já integrou o MiniMax H3 em seu produto de geração de vídeo baseado em navegador. Na interface exibida no artigo original, os usuários podem usar o H3 diretamente sem configurar um ambiente local.
O mais chamativo são os preços exclusivos da plataforma exibidos no momento do teste:
Esses são os preços exibidos pelo MetaSo no artigo original, não os preços oficiais universais da API do MiniMax. Preços de terceiros podem envolver promoções, subsídios ou ajustes posteriores, portanto, é essencial verificar novamente antes do uso em produção.

O MiniMax H3 é um modelo de vídeo de pesos abertos com recursos impressionantes, mas "código aberto" e "fácil de executar" não são a mesma coisa.
O repositório oficial do MiniMax descreve o H3 como um sistema generativo omni-modal universal, capaz de entender contextos compostos por:
Ele pode gerar vídeo sincronizado e áudio estéreo nativo para clipes de 4 a 15 segundos.
A versão de código aberto atual oferece duas variantes principais do modelo base:
| Variante do modelo | Uso principal | Entrada |
|---|---|---|
| H3-Base-FL2VA | Geração de vídeo a partir de texto e primeiro/último quadro | Texto mais zero, uma ou duas imagens |
| H3-Base-Ref2VA | Geração de áudio/vídeo multi-referência | Texto mais imagens, vídeos e/ou áudio de referência |
O modelo de referência suporta até:
O MiniMax também documentou um fluxo de trabalho completo de 2K, combinando H3-Base com H3-Context-IR e H3-Regenerate-2K.
O artigo original menciona que o MiniMax H3 lidera o ranking de edição de vídeo da Artificial Analysis pouco tempo após seu lançamento na plataforma.
Essa afirmação pode ser verificada pelo snapshot atual revisado em 7 de agosto de 2026.
A Artificial Analysis lista o MiniMax H3 como o primeiro lugar no ranking atual de edição de vídeo com áudio, superando o Gemini Omni Flash nessa visão. Como esses rankings são em tempo real e baseados em preferências dos usuários, a ordem exata pode mudar conforme mais amostras são submetidas.

Isso é uma evidência forte da competitividade do H3 em qualidade de edição, mas não deve ser exagerado como uma afirmação mais ampla de que o H3 é permanentemente o primeiro em todas as categorias de geração de vídeo.
Geração de vídeo a partir de texto, a partir de imagem, geração com referências e edição de vídeo são tarefas independentes, e os rankings dependem dos filtros selecionados, data, configurações de áudio e votos dos usuários.
O artigo de origem apresenta um ponto que costuma ser ignorado nas discussões sobre modelos abertos: muitos criadores não querem se tornar engenheiros de inferência apenas para testar uma ideia criativa.
O fluxo de trabalho de auto-hospedagem do H3 pode envolver:
O repositório oficial do MiniMax fornece um exemplo SGLang como este:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
A variante de geração com referência usa o mesmo exemplo de quatro GPUs, apenas com variante do modelo e porta diferentes.
Isso não significa que todas as implantações possíveis do H3 precisem exatamente de quatro GPUs. Os requisitos de hardware dependem do framework, precisão, paralelismo, resolução, duração do vídeo e métodos de otimização.
Mas isso mostra claramente que a implantação de referência oficial não é voltada para um notebook consumidor típico.
Os pesos do modelo podem ser obtidos, mas a inferência ainda exige recursos computacionais significativos.
Criadores que usam hardware local precisam considerar:
A fonte inclui uma postagem de comunidade em que um usuário encontrou um erro de memória insuficiente após baixar o H3 localmente.
Essa anedota não deve ser tratada como uma referência universal de hardware, mas o ponto mais importante é válido: conseguir baixar o modelo não significa conseguir executá-lo sem problemas.
A fonte relata que localmente, para gerar um clipe curto de aproximadamente 10 segundos,
em certas configurações de hardware, pode levar de 20 a 40 minutos.
Isso não é uma especificação oficial de latência do MiniMax; o tempo real varia significativamente de acordo com a configuração de hardware e software.
No entanto, para trabalhos criativos, a latência continua sendo fundamental.
A geração de vídeo é um processo iterativo. O usuário pode precisar de várias tentativas para corrigir os seguintes problemas:
Se cada tentativa exigir muito tempo, mesmo que o modelo em si possa ser baixado gratuitamente, a dificuldade de experimentar e explorar aumenta consideravelmente.
O fluxo de trabalho destacado na fonte original elimina a maior parte das etapas de implantação local.
A página inicial do MetaSo atualmente exibe um novo acesso de Geração de Vídeo ao lado dos produtos existentes de busca e produtividade.
De acordo com os testes da fonte original, o fluxo básico é o seguinte:
Não é necessário baixar o repositório do H3 ou configurar o ambiente CUDA antes de produzir o primeiro vídeo.
A interface apresentada no artigo inclui os principais fluxos de trabalho que os criadores esperam obter do H3:
A captura de tela também mostra uma opção chamada H3 Context IR, que está alinhada com a arquitetura oficial da MiniMax.
O H3-Context-IR é um sistema de pré-processamento e orquestração hospedado pela MiniMax, usado para interpretar instruções multimodais de formato livre. Ele analisa a relação entre texto, imagens, áudio e vídeos de referência e, em seguida, converte esse contexto em uma representação que o H3-Base pode utilizar de forma mais eficiente.
A MiniMax não fornece o sistema completo de hospedagem H3-Context-IR nos pesos de código aberto. Ela oferece uma API para reproduzir o fluxo de trabalho oficial.
Essa distinção ajuda a explicar por que um serviço hospedado pode ser mais acessível do que uma instalação puramente local com pesos de código aberto.
O autor da fonte original testou o H3 por meio do MetaSo, usando um breve conceito de caça ao tesouro em estilo faroeste.
O clipe de vídeo gerado inclui:
O autor relatou que, desde abrir a página de geração até receber o resultado final de 15 segundos, o processo inteiro levou aproximadamente três minutos.
Este é um resultado de teste isolado, não uma latência de serviço garantida.
O tempo real de geração pode variar devido aos seguintes fatores:
A diferença real é que o usuário não precisa gerenciar a infraestrutura de inferência por conta própria.
Para muitos criadores, isso é mais importante do que o modelo ser tecnicamente de pesos abertos.
A fonte original afirma que usuários avançados podem conectar o serviço a fluxos de trabalho do ComfyUI.
Isso oferece um intermediário útil entre um gerador tudo-em-um baseado em navegador e um modelo totalmente auto-hospedado.
O ComfyUI é um sistema de fluxo de trabalho de IA generativa de código aberto baseado em nós. O repositório oficial do H3 da MiniMax também lista o ComfyUI como uma das opções recomendadas de inferência/fluxo de trabalho para o H3.
Além do link para os templates do H3.
Os fluxos de trabalho baseados em nós dão aos usuários mais controle sobre:
Na prática, a divisão de responsabilidades é a seguinte:
| Tipo de usuário | Fluxo de trabalho adequado |
|---|---|
| Criadores testando ideias | Interface de prompt no navegador |
| Criadores que usam materiais de referência | Fluxo de múltiplas referências no navegador |
| Usuários avançados | Fluxos no ComfyUI ou via API |
| Equipes de infraestrutura | Implantação local ou em nuvem dos pesos abertos |
Essa também é uma das razões pelas quais o acesso hospedado e os pesos abertos se complementam, em vez de se excluírem.
A segunda metade do artigo original foca nos preços.
No momento dos testes do autor, o MetaSo exibia:
| Resolução | Preço exibido no MetaSo na fonte original |
|---|---|
| 768p | 0,09 yuan/segundo |
| 2K | 0,15 yuan/segundo |

Essas tarifas resultam em custos muito baixos por vídeo individual.
| Duração | Custo calculado a 0,09 yuan/segundo |
|---|---|
| 5 segundos | 0,45 yuan |
| 10 segundos | 0,90 yuan |
| 15 segundos | 1,35 yuan |
| Duração | Custo calculado a 0,15 yuan/segundo |
|---|---|
| 5 segundos | 0,75 yuan |
| 10 segundos | 1,50 yuan |
| 15 segundos | 2,25 yuan |
É por isso que o artigo original descreve a era do vídeo com IA como entrando na fase dos "centavos" quando calculada em yuan.
Mais precisamente, este é o preço de hospedagem de terceiros em um determinado momento, e não deve ser generalizado para todo o ecossistema do H3.
A própria API da MiniMax e outros provedores podem adotar preços, moedas, resoluções, lógicas de cobrança e descontos promocionais diferentes.
A Artificial Analysis atualmente lista, em sua comparação de rankings, o preço da API de criadores do H3 como aproximadamente 7,80 dólares por minuto de vídeo em 1080p nas configurações padrão. Isso difere da base de preços da captura de tela do MetaSo e também explica por que é essencial indicar claramente as tarifas específicas de cada provedor.
A geração de vídeo com IA raramente produz o resultado final na primeira tentativa.
O criador pode gerar um vídeo, identificar problemas, ajustar o prompt e tentar novamente.
Isso significa que o custo real não é:
Preço de um vídeo
mas algo mais próximo de:
Custo por tentativa × Número de tentativas até obter um resultado aceitável
Suponha que um criador precise de 8 tentativas para gerar um vídeo de 10 segundos em 768p antes de escolher uma versão utilizável.
Com base nos preços exibidos no MetaSo na fonte original:
10 segundos × 0,09 yuan × 8 tentativas = 7,20 yuan
Quando o custo por tentativa chega a dezenas de yuan, o mesmo processo criativo básico se torna muito mais difícil.
Preços mais baixos podem mudar o comportamento do usuário.
Os criadores podem se dar ao luxo de testar:
O valor não está apenas na economia do produto final.
Está também na redução do custo psicológico da tentativa.
especialmente crucial para vídeo
O custo da geração de texto é baixo o suficiente para que os usuários raramente hesitem em pedir mais uma versão do rascunho.
Com vídeo, é diferente.
Cada geração consome muito mais poder computacional, e o resultado envolve múltiplas dimensões que podem falhar simultaneamente:
Isso torna a amostragem repetida algo normal.
Portanto, uma métrica prática de produção é:
Custo total
──────────────
Número de entregas utilizáveis
Se um modelo tem baixo custo por segundo gerado, mas também produz resultados utilizáveis em quantidade suficiente para manter o custo por trecho adotado em nível baixo, então ele é valioso.
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
Os criadores devem avaliar tanto o preço quanto a taxa de acerto.
O preço importa porque o H3 não é um modelo simplificado de texto para vídeo.
O repositório oficial da MiniMax confirma suporte ao H3:
A arquitetura também prevê conjuntamente as variáveis latentes de vídeo e áudio por meio do H3-Omni-Transformer.
Isso significa que uma única geração pode conter simultaneamente estrutura visual e de áudio, sem a necessidade de uma etapa separada de dublagem.
O repositório oficial do H3 descreve o sistema completo como:
O H3-Base gera saída em 768p.
Em seguida, o H3-Regenerate-2K recebe o resultado base juntamente com o contexto original para regenerar o clipe em resolução mais alta.
Isso é diferente de um simples upscale de pixels.
APIs gerenciadas podem ocultar essas etapas dos usuários.
O artigo de origem também mostra o painel da API H3 na MetaSo.

A captura de tela fornece um exemplo de requisição usando o host de API próprio da MetaSo e o nome do modelo MiniMax-H3.
Uma versão simplificada da estrutura exibida é a seguinte:
curl --request POST \
--url https://metaso.cn/api/minimax/v2/video_generation \
--header 'Authorization: Bearer ' \
--header 'Content-Type: application/json' \
--data '{
"model": "MiniMax-H3",
"content": [
{
"type": "text",
"text": "Descreva o vídeo que você deseja gerar."
}
],
"resolution": "2K",
"duration": 5,
"ratio": "16:9"
}'
Esse código reflete o formato de requisição visível na captura de tela de origem. Antes de implantar em produção, os desenvolvedores devem consultar a documentação mais recente da MetaSo ou o painel da API dentro do produto, pois endpoints, campos, formatos de autenticação e limites podem mudar.
Para fluxos de trabalho repetitivos
O acesso programático é mais útil que o navegador quando as equipes precisam de:
A inferência gerenciada permite que aplicativos chamem o H3 sem gerenciar a própria pilha de serviço do modelo.
O ecossistema H3 agora oferece várias formas de trabalho para desenvolvedores.
Melhor para:
Vantagens:
Compensações:
Melhor para:
Vantagens:
Compensações:
Melhor para:
Vantagens:
Compensações:
A escolha certa depende mais da economia do fluxo de trabalho do que de ideologia.
Modelos abertos ainda podem atingir máxima conveniência por meio de serviços gerenciados.
Para quem deseja testar o H3 sem implantação local, um processo razoável é:
Use o modo de menor custo ao explorar prompts e cenas.
Não invista em alta resolução antes que o conceito seja viável.
Altere apenas uma variável por vez:
Isso facilita entender o que melhora o resultado.
Guarde as combinações bem-sucedidas.
Um prompt reutilizável pode valer mais do que uma saída de sorte.
Assim que a composição e o movimento estiverem aceitáveis, gere ou regenere em nível de resolução mais alta.
Se o mesmo fluxo de trabalho se repete com frequência, mova-o para um grafo de nós ou pipeline de aplicativo.
Para uso comercial, verifique:
O conteúdo gerado por IA deve ser visto como parte da cadeia de produção, não como a única etapa de revisão.
Desenvolvedores devem separar o acesso ao modelo da lógica de negócio.
Uma arquitetura simples pode ser:
Aplicativo
↓
Serviço de geração
↓
Adaptador do provedor
↓
API MetaSo H3 / API MiniMax / H3 auto-hospedado
↓
Status da tarefa + URL de saída
↓
Armazenamento / Revisão / Publicação
O adaptador do provedor facilita a troca do backend de inferência posteriormente.
Os seguintes campos podem ser armazenados:
Com isso, é possível construir um dataset eficaz para comparar o custo real de cada clipe disponível.
Esse número chamativo é atraente, mas há algumas questões de limite a considerar.
¥0,09/segundo e ¥0,15/segundo são preços da MetaSo exibidos no artigo de origem.
Eles não devem ser citados como preço padrão global da API da MiniMax.
Provedores terceiros podem ajustar os preços por:
Sempre consulte a interface em tempo real.
Um fluxo de trabalho com muitas gerações falhas ainda pode ficar caro.
Meça a taxa de aceitação.
A MetaSo gerencia a infraestrutura para os usuários.
Auto-hospedar oferece mais controle, mas também transfere o custo de computação e operação para o usuário.
A parte mais notável da fonte não é apenas que um provedor específico tem preços baixos.
Mas sim a convergência de duas tendências.
Primeiro, modelos de vídeo de alta qualidade estão se tornando mais abertos.
A MiniMax lançou os pesos do H3 e oferece suporte a vários frameworks de inferência, incluindo ComfyUI.
Segundo, plataformas gerenciadas estão transformando esses modelos abertos em serviços de um clique.
Isso traz uma base de usuários mais ampla:
O interior do modelo não está ficando mais simples.
A infraestrutura está se tornando invisível para o usuário.
O MiniMax H3 é um sistema de geração de vídeo omni-modal com pesos abertos lançado pela MiniMax. Ele pode usar texto, imagens, vídeos e áudio como contexto para gerar clipes de vídeo sincronizados de até 15 segundos com áudio estéreo nativo.
De acordo com o artigo da fonte, durante o período de testes a MetaSo cobrava ¥0,09 por segundo de geração em 768p e ¥0,15 por segundo de geração em 2K. Esses são preços da plataforma MetaSo, não as tarifas oficiais gerais da API da MiniMax, e podem mudar.
Sim, se você usar um serviço gerenciado, como a API/aplicativo da própria MiniMax ou plataformas de terceiros como a MetaSo. O provedor executa o modelo em sua infraestrutura, então seu dispositivo local só precisa acessar o serviço.
A MiniMax lançou os pesos e o código do modelo H3 sob sua licença de comunidade. O sistema completo de orquestração gerenciado H3-Context-IR não está incluído no lançamento aberto, embora a MiniMax forneça API e diretrizes de prompt para essa fase.
Sim. O repositório oficial do H3 da MiniMax lista o ComfyUI como um dos fluxos de trabalho recomendados e fornece links para templates do H3. A MetaSo também afirma que seu acesso gerenciado ao H3 pode ser usado com fluxos de trabalho voltados para o ComfyUI.
Fluxo de trabalho.
Os requisitos específicos dependem do framework de inferência, precisão, duração e metas de desempenho. O comando de referência oficial do SGLang da MiniMax usa quatro GPUs, então os usuários não devem presumir que um laptop de consumo comum execute o modelo completo sem problemas.
Até o snapshot de 7 de agosto de 2026 revisado neste artigo, o H3 estava em primeiro lugar no ranking de edição de vídeo com áudio do Artificial Analysis. Os rankings são dinâmicos e não significam que o H3 seja o primeiro em todas as categorias de geração de vídeo.
Ao fazer experimentos, geralmente é mais sensato começar com resoluções mais baratas, pois a maioria dos conceitos exige várias iterações. Depois que o movimento, a composição e o conteúdo de referência estiverem estáveis, coloque o resultado ideal em um fluxo de trabalho de maior resolução.
O MiniMax H3 usa pesos abertos, mas a implantação local ainda envolve custos consideráveis de hardware e engenharia. O exemplo de serviço de referência oficial da MiniMax usa uma configuração SGLang com múltiplas GPUs, o que ajuda a explicar por que muitos criadores de vídeo preferem a rota gerenciada.
O artigo da fonte mostra como a MetaSo transformou o H3 em um
serviço baseado em navegador, oferecendo texto para vídeo, imagem para vídeo, geração com múltiplas referências, acesso via API e fluxos de trabalho voltados para o ComfyUI. No momento do teste, a MetaSo exibia preços de ¥0,09 por segundo em 768p e ¥0,15 por segundo em 2K.
Essas tarifas baixas de terceiros são importantes porque a geração de vídeo com IA é essencialmente um processo iterativo. Tentativas mais baratas permitem que os criadores testem mais direções de enquadramento, prompts, cenas e edições antes de finalizar resultados em alta resolução.
A verdadeira mudança não é apenas que o H3 é open source — é que modelos de vídeo com pesos abertos estão cada vez mais fáceis de usar como serviços web comuns.
Comece com uma frase e tenha um site completo em minutos.