Introduction
Les modèles de génération vidéo progressent rapidement, mais la plupart restent au niveau de simples générateurs de rushes. Ils produisent un clip, puis laissent le créateur gérer lui-même les sous-titres, le typographie, les transitions, l'étalonnage, la musique, le rythme et les effets visuels dans une autre application de montage.
MiniMax H3 a précisément été conçu pour changer ce flux de travail.
Publié le 31 juillet 2026, H3 est un modèle vidéo multimodal généraliste qui accepte des entrées texte, image, vidéo et audio dans le même contexte. Il peut générer des vidéos synchronisées de 4 à 15 secondes avec son stéréo, avec une résolution de sortie allant jusqu'à 768p ou 2K maximum.
MiniMax indique que le modèle est conçu pour participer à l'ensemble du processus de production de contenu, et pas seulement pour générer des rushes bruts. Ses cas d'usage ciblés incluent la publicité, le branding, le e-commerce, le design produit, l'UI et l'UX, les jeux vidéo, les affiches dynamiques, les séquences de générique et le contenu pour les réseaux sociaux.

MiniMax positionne H3 comme un modèle vidéo multimodal généraliste à poids ouverts.
Le rapport original décrit ce changement comme le « moment de la programmation » de la génération vidéo. Cette métaphore n'est pas à prendre au sens littéral, mais l'idée est précieuse : les créateurs peuvent de plus en plus décrire le résultat souhaité, fournir des références, vérifier la sortie et itérer par instructions en langage naturel, sans avoir à construire manuellement chaque couche.
Statut des poids ouverts : MiniMax a d'abord indiqué que les poids seraient publiés dans les jours suivants. Les points de contrôle officiels H3-Base sont désormais disponibles sur Hugging Face, sous la licence communautaire MiniMax H3. Cependant, H3-Context-IR, H3-Regenerate-2K et l'implémentation de l'attention sparse ne sont pas tous inclus dans la publication initiale des poids.
MiniMax H3 arrive comme un modèle de production vidéo de bout en bout
Les exemples impressionnants publiés initialement ne sont pas de simples plans cinématographiques. Ils incluent de la typographie animée, des effets dessinés à la main, des graphiques produit, des séquences de générique animées, de la musique, des dialogues et des transitions.
Ces éléments sont généralement considérés comme des tâches de post-production distinctes.
Un flux de travail traditionnel pourrait ressembler à ceci :
- Générer ou enregistrer des rushes bruts.
- Importer les clips dans un logiciel de montage.
- Sélectionner les plans utilisables.
- Ajouter les coupes et les transitions.
- Concevoir les titres et les sous-titres.
- Ajouter la musique et les effets sonores.
- Ajuster le rythme et les couleurs.
- Exporter la version finale.
H3 tente de modéliser plusieurs de ces décisions ensemble.
Une invite peut décrire le style visuel, l'ordre des plans, le rythme, le texte à l'écran, les indications de jeu, le paysage sonore et les transitions. Les fichiers de référence peuvent fournir des personnages, des produits, des actions, des styles de caméra, des sons, des bandes originales ou le rythme du montage.

Les premiers testeurs ont utilisé H3 pour créer des vidéos avec des personnages stylisés et des produits soignés.
cette publicité.*
Cela ne signifie pas que les logiciels de montage professionnels sont obsolètes. Les projets plus longs nécessitent toujours un contrôle précis de la timeline, une gestion des assets, des modifications, des validations juridiques et des livraisons dans plusieurs formats.
Le changement important, c'est que le modèle peut désormais produire en une seule génération un contenu vidéo court beaucoup plus proche du produit final.
Test de H3 avec une vidéo promotionnelle et des invites multi-plans rapides
L'auteur original a testé H3 via l'interface Hailuo de MiniMax.
La première expérience était une vidéo de coulisses d'un boys band fictif mettant en scène des personnalités connues de l'industrie de l'IA. L'invite textuelle décrivait le ton et le style de montage attendus, tandis que H3 générait la séquence visuelle.
L'auteur a ensuite testé une vidéo de lancement avec une esthétique de présentation à la Apple. En ajoutant simplement de courts labels de style, le résultat incluait des effets de verre translucide, des dégradés, des graphiques animés et un rythme semblable à une présentation.
Un test plus exigeant utilisait une invite longue décrivant un trailer en six plans. Chaque plan avait sa propre direction émotionnelle, ses indications de jeu et son rythme.
Selon le rapport, H3 a suivi de près l'ordre des plans, générant un montage rapide avec des scènes distinctes, plutôt que de compresser les instructions en un clip générique.
Ce type de tâche met à l'épreuve plusieurs capacités à la fois :
- La planification multi-plans
- La cohérence des personnages et des décors
- Le respect des instructions
- Le jeu émotionnel
- Les mouvements de caméra
- Le rythme du montage
- La conception des transitions
- La synchronisation audio-visuelle
Les résultats restent des démonstrations subjectives, et non des benchmarks contrôlés. Un cas réussi sur les réseaux sociaux ne garantit pas que chaque invite longue fonctionnera du premier coup.
Néanmoins, par rapport aux anciens systèmes vidéo qui ne s'attendaient qu'à de courtes descriptions visuelles, le modèle est clairement plus adapté aux instructions créatives structurées.
Le rendu du texte est l'une des fonctionnalités les plus précieuses de H3 sur le plan commercial
Le texte a toujours été l'un des maillons les plus fragiles de la vidéo générée par IA.
Les modèles d'images n'ont qu'à rendre un mot correctement dans une seule image. Les modèles vidéo doivent maintenir les mêmes glyphes sur des dizaines d'images tandis que les plans, les surfaces, l'éclairage et la scène environnante sont en mouvement constant.
La moindre petite erreur sur une image peut provoquer un scintillement, des fautes d'orthographe ou une typographie instable.
Les tests originaux montrent que H3 a atteint un niveau utilisable pour :
- Les titres animés
- La typographie publicitaire
- Les vidéos de paroles
- Les noms de marques
- Les étiquettes de produits
- Les sous-titres
- Les graphiques de texte animés
- Les visuels UI et web
Les supports de communication officiels de MiniMax présentent également le rendu précis du texte et des marques comme une capacité centrale.
Le modèle ne garantit pas un texte parfait à chaque génération. Les petites tailles de police, les phrases longues, les polices spéciales et les mouvements complexes peuvent encore entraîner des échecs.
Ce qui fait la valeur ajoutée de H3, c'est qu'il semble modéliser la relation entre le texte et la scène.
Dans un exemple, le texte associé à un collier de diamants reflète l'éclairage et la profondeur, plutôt qu'un simple aplat. C'est plus proche de la composition visuelle que du simple placement de sous-titres.
Pour les équipes commerciales, une typographie fiable a souvent plus de valeur qu'un mouvement de caméra spectaculaire. Les publicités, les lancements de
produits, le contenu pour les réseaux sociaux dépendent tous d'informations lisibles.
Audio natif : connecter la voix, les effets sonores et la musique
H3 génère conjointement l'audio et la vidéo.
La fiche officielle du modèle précise :
- Audio stéréo 32 kHz
- Prise en charge stable des dialogues dans 11 langues
- Modélisation native de la voix, de la musique et des effets sonores
- Génération audio-visuelle conjointe, et non une étape de post-production audio distincte
Les langues de dialogue prises en charge listées par MiniMax sont :
- L'arabe
- Le chinois
- L'anglais
- Le français
- L'allemand
- L'italien
- Le japonais
- Le coréen
- Le portugais
- Le russe
- L'espagnol
D'autres langues peuvent également fonctionner, mais avec une qualité variable.
Le rapport original indique également que l'utilisateur peut fournir de l'audio comme référence. H3 peut combiner des extraits vocaux, de la musique ou d'autres éléments audio, en plus des références d'images et de vidéos.
Dans l'API actuelle, l'audio ne peut pas être utilisé comme unique entrée de référence ; une image ou une vidéo doit également être fournie.
Cette intégration est importante car la voix générée doit correspondre au rythme et à l'émotion de la scène. Une voix off ajoutée en post-production peut sembler correcte, tout en restant déconnectée des mouvements du visage, du rythme ou des coupes.
La conception audio-visuelle native de H3 vise à maintenir ces éléments alignés.
Tarification : 0,13 $ par seconde pour une vidéo 2K
MiniMax facture H3 en fonction de la durée de la vidéo générée.
Les tarifs mondiaux actuels à l'usage sont les suivants :
| Sortie | Prix |
|---|---|
| Vidéo 2K | 0,13 $ par seconde |
| Vidéo 768p | 0,08 $ par seconde |
| Régénération 768p vers 2K | 0,05 $ par seconde de sortie |
| Entrée H3-Context-IR | 0,90 $ par million de tokens |
| Sortie H3-Context-IR | 3,60 $ par million de tokens |
Aux tarifs actuels, une génération directe de 10 secondes coûte environ :
| Résolution |
Coût de sortie approximatif |
|-|-|
| 768p | 0,80 $ US |
| 2K | 1,30 $ US |
La facturation des entrées de référence suit des règles distinctes :
- Les références audio sont gratuites.
- Les cinq premières images de référence sont gratuites.
- En génération directe, chaque image au-delà des cinq premières est facturée 0,04 $ US.
- Les vidéos de référence sont facturées selon leur durée et la résolution de sortie choisie.

L'article source a extrait les tarifs initiaux des entrées et des sorties du H3.
La capture d'écran ci-dessus indique un prix de génération de 0,09 $ US par seconde en 768p. La page de tarification mondiale actuelle de MiniMax affiche désormais 0,08 $ US par seconde, il convient donc de se référer à la documentation officielle en temps réel comme source d'information à jour.
MiniMax affirme qu'en résolution 2K, le H3 coûte moins d'un tiers du prix des principaux concurrents ; en résolution 768p, son coût est inférieur à la moitié de celui des modèles 720p dominants.
Cette comparaison repose sur les concurrents et les paramètres choisis par MiniMax. Le coût réel de chaque vidéo valide dépend du nombre de tentatives, des séquences de référence, de la longueur des clips, des régénérations et de la question de savoir si la première sortie est directement exploitable.
Le H3 en tête du classement vidéo d'Artificial Analysis
Artificial Analysis classe actuellement le MiniMax H3 en première position de son classement d'édition vidéo avec audio.
Au moment de la rédaction de ce document, le classement se présentait comme suit :
| Rang | Modèle | Elo | Prix API |
|---|---|---|---|
| 1 | MiniMax H3 | 1 129 | 7,80 $ US/minute |
| 2 | Gemini Omni Flash | 1 122 | 6,00 $ US/minute |
| 3 | HappyHorse-1.0 | 1 096 | 27,04 $ US/minute |
| 4 | Wan 2.7 | 1 080 | 16,90 $ US/minute |
| 5 | Dreamina Seedance 2.0 720p | 1 037 | 5,57 $ US/minute |

L'article source place le H3 en tête du classement d'édition vidéo d'Artificial Analysis.
Le H3 figure également en bonne position dans les tests de génération vidéo à partir de texte et d'images.
Les résultats du classement évoluent avec l'arrivée de nouveaux modèles et de nouveaux votes. Ils mesurent les préférences collectives sur un ensemble de prompts spécifiques et ne doivent pas être considérés comme une preuve qu'un modèle convient à tous les flux de production.
Ce résultat mérite néanmoins l'attention, car le H3 associe un score d'édition élevé à des poids de base publiés, tandis que de nombreux modèles vidéo de premier plan restent fermés.
Un système d'entrées multimodales unifié
Le H3 ne traite pas le texte, les images, les vidéos et l'audio comme des modalités d'entrée indépendantes.
Il les accepte comme un contexte multimodal unifié et tente de comprendre la relation entre ces éléments et la sortie demandée.
Par exemple, un prompt peut demander au H3 de :
- utiliser le mouvement de caméra d'une certaine vidéo
- conserver le personnage affiché dans une image
- utiliser le son d'une référence audio
- suivre le rythme d'un autre clip
- appliquer un style de titre spécifié
- générer une nouvelle scène intégrant toutes ces relations
L'API officielle prend actuellement en charge :
| Type de référence | Limite |
|---|---|
| Images | Jusqu'à 9 |
| Clips vidéo | Jusqu'à 3 |
| Clips audio | Jusqu'à 3 |
| Total des fichiers mixtes | Jusqu'à 12 |
Les clips vidéo et audio de référence doivent durer entre 2 et 15 secondes, avec une durée totale maximale de 15 secondes par type de média.
La limite de caractères du prompt est de 7 000 caractères.

L'interface Hailuo intègre le prompt, les références multimodales, la résolution, la durée et le rapport hauteur/largeur.
Cette conception rend les éléments de référence plus importants que la rédaction de prompts ultra-longs.
Un texte peut décrire l'effet d'éclairage souhaité, mais une image de référence peut transmettre le même effet visuel plus directement. Une description textuelle peut expliquer une action, mais une vidéo de référence peut montrer le timing exact.
La valeur du modèle réside dans sa capacité à interpréter comment ces références doivent être recombinées, plutôt que de simplement les copier.
Une réutilisation facilitée grâce aux éléments récents
L'article source met en avant une fonctionnalité pratique, bien que mineure : les éléments téléversés apparaissent dans le panneau des éléments récents.

Les images et références préalablement téléversées peuvent être réutilisées depuis le panneau des éléments récents.
C'est pratique
pour les flux de travail qui réutilisent régulièrement les mêmes personnages, produits, logos, tons de marque, voix, styles visuels, lieux ou références dynamiques.
Cela réduit le besoin de téléverser et d'organiser les mêmes fichiers à chaque génération.
Comment le H3 comprend l'intention créative
MiniMax décrit le H3 comme un système conçu autour de la généralisation des tâches, plutôt que comme un ensemble de modèles experts indépendants.
Les premiers systèmes de génération avaient tendance à diviser le travail créatif en tâches isolées, telles que le texte-à-vidéo, l'image-à-vidéo, la génération premier/dernier cadre, la référence de personnage, la référence de style, le transfert de mouvement, la référence sonore, l'édition vidéo, la génération d'effets sonores et la génération musicale.
Le H3 est entraîné pour exprimer ces relations en langage naturel au sein d'un système multimodal unique.
Le flux de travail en ligne complet du H3 comprend trois modules principaux :
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
Entrées multimodales
↓
H3-Context-IR
↓
H3-Base (768p)
↓
H3-Regenerate-2K
↓
Vidéo finale (avec audio stéréo)
H3-Context-IR
H3-Context-IR est un système hébergé de prétraitement et d'orchestration.
Il analyse les relations entre le texte, les images, les vidéos et l'audio, puis génère une représentation intermédiaire structurée exploitable par H3-Base.
Ce système est capable d'analyse d'instructions, de corrélation inter-modale, d'analyse temporelle, de décomposition de scènes, de modélisation des relations audiovisuelles, de complétion de prompts pour les détails manquants, ainsi que de raisonnement logique complexe.
Le blog technique de MiniMax indique qu'une partie du matériel source nécessite environ 100 000 jetons de calcul d'inférence avant d'être distillée en une représentation contextuelle moyenne d'environ 4 000 jetons.
H3-Context-IR n'est pas inclus dans la version initiale des poids open source, car il repose sur plusieurs modèles et services hébergés.
MiniMax propose cette fonctionnalité via une API et publie un guide de prompts pour les équipes qui souhaitent construire leur propre système de prétraitement.
H3-Base
H3-Base génère des vidéos et de l'audio stéréo en résolution 768p.
Les différentes modalités d'entrée sont encodées via des encodeurs ou VAE correspondants, regroupées en une séquence multimodale unifiée, puis envoyées au transformateur H3-Omni.
Les modèles publiés proposent deux points de contrôle spécialisés par tâche :
| Point de contrôle | Tâche principale |
|---|---|
| H3-Base-FL2VA | Texte vers vidéo et première/dernière image vers vidéo |
| H3-Base-Ref2VA | Génération audio-vidéo basée sur des références |
Les deux points de contrôle utilisent la précision BF16.
H3-Regenerate-2K
Le flux de travail 2K de H3 n'est pas un outil de suréchantillonnage traditionnel.
Les résultats 768p et le contexte multimodal d'origine sont renvoyés à H3, permettant au modèle de régénérer la sortie à une résolution plus élevée.
MiniMax appelle cela la régénération dans le contexte.
Les systèmes de suréchantillonnage traditionnels tentent de déduire les détails manquants à partir d'une vidéo basse résolution. H3 peut réutiliser le prompt d'origine et les informations de référence, ce qui peut l'aider à restaurer plus précisément les petits textes, les détails produit et les informations de scène.
H3-Regenerate-2K n'est pas inclus dans la version initiale des poids open source. Il est actuellement disponible via les flux de travail hébergés et l'API de MiniMax.
Composants techniques clés de H3
MiniMax a identifié quatre technologies principales derrière le système.
Représentation contextuelle omnimodale
Dans les prompts vidéo traditionnels, une description textuelle décrit le clip cible.
Alors que dans H3,
la légende doit également préciser la relation de chaque référence avec la sortie, les relations entre les références, quelle action doit provenir de quelle vidéo, quel son appartient à quel personnage, comment l'audio varie entre les plans, et ce qui doit être conservé ou édité.
Le langage est le pont qui relie ces relations multimodales.
MiniMax a construit des modèles dédiés et un pipeline de compréhension omnimodale pour générer cette représentation.
H3-VAE
H3 utilise des espaces latents visuels et audio distincts.
Le VAE visuel est un autoencodeur vidéo causal temporel avec une compression spatiale de 16×, une compression temporelle de 4×, 24 canaux latents, et un traitement supplémentaire par blocs avant le transformateur.
MiniMax indique que le nouveau VAE offre une amélioration de 4× en longueur de séquence effective par rapport à ses méthodes précédentes, réduisant les coûts d'entraînement et d'inférence tout en soutenant la génération native en 2K.
Le VAE audio traite d'abord les canaux stéréo gauche et droit indépendamment, puis les recompose. Il compresse l'audio 32 kHz en jetons latents de 40 Hz par canal.
H3-Omni Transformer
Le H3-Omni Transformer est un transformateur monocanal dense.
La fiche officielle du modèle indique :
- 33 milliards de paramètres au total
- Environ 1,3 milliard de paramètres dans les branches liées à AdaLN
- Prédiction conjointe des variables latentes vidéo et audio
- Plongements rotationnels multimodaux 3D
- Mécanisme d'attention unifié et couches feed-forward sans modules spécifiques à une modalité
MiniMax précise que les sorties modulées AdaLN peuvent être précalculées et mises en cache, de sorte que les déploiements en inférence seule n'ont pas besoin de charger ces paramètres.
Le modèle sépare les tâches de compréhension et de génération pendant l'entraînement afin de mieux gérer les grandes variations de longueur des séquences multimodales. MiniMax rapporte que cela améliore le débit d'entraînement de bout en bout de près de 30 %.
Attention sparse
H3 utilise une attention sparse native pendant l'entraînement afin de réduire le coût des longues séquences multimodales.
La version initiale des poids open source utilise actuellement une attention complète pour l'inférence. MiniMax indique que l'implémentation de l'attention sparse sera publiée dans une future mise à jour.
Cette distinction est importante pour le déploiement local, car l'implémentation actuellement disponible peut nécessiter plus de ressources de calcul que la pile de services optimisée en interne par MiniMax.
Poids ouverts : ce qui est réellement publié
MiniMax a publié les poids H3-Base sur Hugging Face sous la licence communautaire MiniMax H3.
Le dépôt comprend H3-Base-FL2VA, H3-Base-Ref2VA, les fichiers du processeur, les fichiers du tokenizer, l'encodeur de texte, les poids du transformateur Omni, les VAE visuels et audio, des scripts d'exemple, des instructions de déploiement et des exemples 768p reproductibles.
Le point de contrôle utilise les poids pré-entraînés complets de Qwen3-VL-32B comme encodeur H3 et fournit ses états cachés de la couche 50 au transformateur H3-Omni.
Le modèle peut être téléchargé avec la commande suivante :
hf download MiniMaxAI/MiniMax-H3 --local-dir MiniMax-H3
MiniMax répertorie SGLang, vLLM, Diffusers et ComfyUI comme frameworks d'inférence pris en charge ou recommandés.
Son exemple SGLang utilise quatre GPU :
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
Il s'agit d'un exemple officiel, et non d'une exigence minimale générale. La mémoire et les performances réelles dépendent du point de contrôle, de la durée, de la résolution, de l'implémentation et du matériel.
L'ensemble du système en ligne n'est pas encore entièrement ouvert
Qualifier simplement H3 d'« entièrement open source » pourrait être trompeur.
Les poids H3-Base publiés sont substantiels et permettent une génération locale en 768p. Cependant :
- H3-Context-IR reste un système hébergé.
- H3-Regenerate-2K n'a pas encore été publié.
- L'inférence à attention sparse n'est pas incluse dans la première version.
- Le modèle utilise la licence communautaire MiniMax, et non une licence permissive standard comme Apache 2.0.
Les équipes doivent examiner attentivement la licence et les notes d'architecture avant de planifier un déploiement commercial.
Pour les actifs de marque privés, cette publication crée néanmoins des options significatives. Les entreprises peuvent rechercher, affiner et déployer le modèle de base dans le cadre des conditions de licence, sans envoyer chaque actif source à une interface de génération tierce.
Utilisation de MiniMax H3 via l'API
L'API officielle prend en charge trois principaux modes de génération :
- Texte vers vidéo
- Première/dernière image vers vidéo
- Génération multimodale basée sur des références
Le flux de génération est de type asynchrone :
- Soumettre la tâche et recevoir un
task_id. - Interroger l'état de la tâche.
- Récupérer l'URL vidéo une fois la tâche réussie.
- Télécharger et enregistrer le résultat.
Les développeurs peuvent également utiliser le CLI officiel de MiniMax :
npm install -g mmx-cli
mmx auth login
mmx video generate \
--model MiniMax-H3 \
--prompt "A polished product commercial with animated typography"
Pour les flux de travail multimodaux avec références :
mmx video generate \
--model MiniMax-H3 \
--prompt "Keep the same character and follow the reference motion" \
--reference-image character.png \
--reference-video motion.mp4
Avant toute utilisation en production, il convient de consulter la documentation CLI et API, car les limites d'entrée, la facturation et les paramètres pris en charge peuvent évoluer.
Ce que H3 signifie pour la production vidéo
H3 n'élimine pas toutes les tâches de post-production.
Un projet marketing professionnel peut encore nécessiter un montage image par image précis, des validations client, de la musique sous licence, des contrôles juridiques et de droits d'auteur, une conformité stricte à la marque, une continuité pour les longs formats, des exports multi-ratios, une direction d'acteurs et une livraison en gestion de la couleur.
Ce que H3 change, c'est le point de départ.
Au lieu de recevoir une séquence muette, le créateur obtient un court actif intégrant montage, son, typographie, voix off, effets et une direction visuelle reconnaissable.
Cela rend le modèle particulièrement adapté pour :
- Les publicités sur les réseaux sociaux
- Les vidéos promotionnelles de produits
- Les vidéos e-commerce
- Les visuels musicaux
- Les affiches dynamiques
- Les tests de concepts de marque
- Les variantes rapides de campagnes
- Le jeu et l'interface utilisateur
Vidéo conceptuelle
Ce modèle montre également que la génération vidéo devient de moins en moins limitée à des tâches spécifiques. Un système unique peut de plus en plus interpréter un ensemble d'actifs créatifs et exécuter un brief créatif plus complet.
FAQ
Qu'est-ce que MiniMax H3 ?
MiniMax H3 est un système universel de génération et d'édition vidéo multimodale. Il accepte des entrées texte, image, vidéo et audio, et peut générer des vidéos de 4 à 15 secondes avec un son stéréo synchronisé.
MiniMax H3 peut-il générer des vidéos 2K ?
Oui. L'API hébergée prend en charge la sortie 2K. Le flux complet génère d'abord un résultat 768p avec H3-Base, puis utilise H3-Regenerate-2K pour régénérer la vidéo à une résolution supérieure tout en préservant le contexte d'origine.
MiniMax H3 est-il open source ?
MiniMax a publié les poids de H3-Base sous sa licence communautaire. Le système en ligne complet n'est pas entièrement open source, car H3-Context-IR, H3-Regenerate-2K et l'inférence à attention sparse ne sont pas tous inclus dans la version initiale.
MiniMax H3 peut-il être exécuté localement ?
Oui, les checkpoints H3-Base publiés peuvent être déployés localement pour une génération en 768p. MiniMax fournit un exemple SGLang ainsi que des liens vers des workflows vLLM, Diffusers et ComfyUI, mais le modèle nécessite d'importantes ressources GPU.
Combien coûte l'API MiniMax H3 ?
Le tarif mondial actuel est de 0,13 $ par seconde de vidéo générée en 2K et de 0,08 $ par seconde en 768p. Les images de référence au-delà des cinq premières, les vidéos de référence, les régénérations et H3-Context-IR peuvent entraîner des frais supplémentaires.
H3 génère-t-il de l'audio avec la vidéo ?
Oui. H3 génère conjointement la vidéo et un audio stéréo natif à 32 kHz, y compris les dialogues, la musique et les effets sonores.
Combien de fichiers de référence H3 peut-il accepter ?
L'API prend en charge jusqu'à neuf images, trois vidéos et trois clips audio, soit un maximum de 12 fichiers mixtes. Des limites de durée et de taille de fichier s'appliquent également.
H3 convient-il à la production vidéo commerciale ?
MiniMax a conçu H3 pour la publicité, l'image de marque, le commerce électronique, la conception de produits, l'UI et l'UX, ainsi que d'autres usages commerciaux. Les équipes doivent néanmoins examiner les sorties, vérifier les droits sur tous les contenus d'entrée et consulter la licence communautaire et les conditions de la plateforme.
Outils associés
- Hailuo AI : l'application Web mondiale de MiniMax pour créer des vidéos avec H3.
- MiniMax H3 sur Hugging Face : poids officiels H3-Base, fiche modèle, description de l'architecture et exemples de déploiement local.
- API MiniMax : plateforme mondiale officielle pour générer des vidéos H3 via l'API.
- MiniMax CLI : outil de ligne de commande officiel pour générer des vidéos, images, voix, musiques et textes.
- SGLang : framework de service d'inférence pris en charge par l'exemple de déploiement local de MiniMax H3.
- ComfyUI : environnement de workflow visuel basé sur des nœuds avec un didacticiel officiel de génération vidéo H3.
- Artificial Analysis Video Arena : classement de vote à l'aveugle pour comparer les modèles d'édition vidéo.
Liens connexes
- Blog technique officiel MiniMax H3 : article de lancement de MiniMax couvrant les fonctionnalités, la philosophie de conception, l'architecture, les propositions tarifaires et la feuille de route.
- Fiche modèle MiniMax H3 : informations officielles détaillées sur les checkpoints publiés, la licence, les tâches prises en charge et les modules système.
- Documentation de génération vidéo MiniMax : modes API officiels, limites d'entrée, flux de travail et exemples de code.
- MiniMax paiement à l'utilisation
Prix : tarification actuelle des générations H3, entrées de référence, régénérations et Context-IR.
- Dépôt GitHub MiniMax CLI : exemples d'installation et de commandes pour la génération H3.
- Didacticiel ComfyUI H3 : workflows ComfyUI officiels pour la génération H3 locale et via API.
- Classement d'édition vidéo Artificial Analysis : classement actuel des résultats d'édition vidéo participatifs et comparaison des prix API.
Résumé
MiniMax H3 fait passer l'IA vidéo au niveau supérieur par rapport à la simple génération de clips, en intégrant dans un seul système la génération visuelle, la logique de montage, le sous-titrage, les dialogues, les effets sonores, la musique et les références multimodales.
La version hébergée peut générer des vidéos de 4 à 15 secondes avec un son stéréo natif et une résolution de sortie allant jusqu'à 2K. Actuellement, elle occupe la première place du classement d'édition vidéo Artificial Analysis et propose une sortie 2K au prix de 0,13 $ par seconde générée via l'API mondiale de MiniMax.
MiniMax a publié les checkpoints H3-Base, permettant une génération locale en 768p et un développement ultérieur. Cependant, comme Context-IR, la régénération 2K et l'inférence à attention sparse ne sont pas encore entièrement open source, le flux de travail hébergé complet reste partiellement fermé.
Le changement essentiel de H3 ne consiste pas seulement à produire de meilleures images, mais à passer de la génération d'un clip à la compréhension et à l'exécution d'un brief complet de création vidéo courte.



