Introduction
MiniMax a officiellement dévoilé MiniMax H3, un modèle génératif vidéo multimodal polyvalent capable de comprendre texte, images, vidéos et audio dans un même flux de travail de génération.
Cette annonce marque une rupture avec l'approche traditionnelle qui traitait la génération texte-vers-vidéo, image-vers-vidéo, la génération à partir de vidéos de référence, la synchronisation audio et l'édition comme des tâches distinctes. Au contraire, H3 est conçu pour recevoir simultanément plusieurs types de contextes et utiliser des instructions en langage naturel pour décrire comment ces contenus de référence doivent interagir.
Selon MiniMax, H3 prend en charge la sortie vidéo avec audio stéréo natif, génère des clips allant jusqu'à 15 secondes et offre une résolution 2K via l'API actuelle.
L'entreprise positionne ce modèle pour la création de contenu commercial, notamment la publicité, le branding, le commerce électronique, la conception de produits, l'UI/UX et les jeux vidéo.

Cette publication met également l'accent sur le coût de génération. MiniMax indique que H3, tout en conservant les références multimodales et la sortie haute résolution, présente un coût de génération par seconde inférieur à celui de nombreux systèmes de génération vidéo populaires.
H3 : des tâches vidéo spécialisées vers une génération multimodale unifiée
Les premiers modèles vidéo étaient souvent organisés autour de flux de travail indépendants.
Les créateurs pouvaient choisir un modèle ou une interface pour la génération texte-vers-vidéo, un autre pour l'animation d'images, et utiliser un processus distinct pour l'édition de vidéos de référence ou la synchronisation audio.
H3 tente d'unifier ces cas d'usage dans un contexte multimodal partagé.
La documentation API actuelle de MiniMax décrit trois principaux modes de génération :
| Mode de génération | Entrée | Utilisation typique |
|---|---|---|
| Texte-vers-vidéo | Invite textuelle | Générer une nouvelle vidéo à partir d'une description textuelle |
| Image-vers-vidéo (première/dernière image) | Invite plus première et/ou dernière image | Animer une image ou contrôler le début et la fin d'un clip vidéo |
| Génération par référence | Invite plus images, vidéos et/ou audio | Préserver le sujet, le mouvement, le style de prise de vue, la voix ou le rythme de montage |
Ainsi, le modèle ne se limite pas à transformer une phrase en vidéo.
Il peut également intégrer des médias de référence dans le contexte de génération.
Pour la génération par référence, l'API de MiniMax prend en charge les combinaisons suivantes :
- Jusqu'à 9 images de référence
- Jusqu'à 3 vidéos de référence
- Jusqu'à 3 fichiers audio de référence
- Un total maximal de 12 fichiers médias
La durée totale des vidéos de référence peut atteindre 15 secondes, et l'audio doit être accompagné d'au moins une image ou une vidéo de référence.
Cette structure permet aux créateurs de décrire les relations entre différentes entrées sans avoir à traiter manuellement chaque modalité comme une étape distincte.
Le langage naturel comme pont entre les modalités
Les sources d'AIBase décrivent l'un des principes fondamentaux de H3 comme la Représentation Omni Contextuelle (Contextual Omni Representation).
Le concept est d'utiliser le langage naturel comme lien entre les différents types de médias.
Les utilisateurs peuvent fournir plusieurs contenus de référence simultanément et décrire en langage courant les relations attendues entre eux.
Par exemple, un flux de travail pourrait demander conceptuellement à H3 de :
- Conserver le mouvement de caméra d'une vidéo de référence
- Préserver le personnage apparaissant dans une image de référence
- Suivre le rythme ou la voix d'une référence audio
- Appliquer toutes ces contraintes simultanément à une nouvelle scène générée
Cela diffère fondamentalement d'une simple invite texte-vers-vidéo.
Le modèle doit non seulement comprendre ce que contient chaque entrée média, mais aussi quel rôle chaque entrée doit jouer dans la génération finale.
L'API publique de MiniMax reflète cette conception à travers des entrées multimodales basées sur des rôles, telles que :
first_frame(première image)last_frame(dernière image)reference_image(image de référence)reference_video(vidéo de référence)reference_audio(audio de référence)
Les utilisateurs doivent toujours fournir une invite textuelle, mais celle-ci peut désormais servir de couche d'instructions au-dessus de multiples sources médias.
H3 prend en charge l'audio stéréo natif et la sortie 2K jusqu'à 15 secondes
MiniMax indique que H3 peut générer directement des vidéos avec audio stéréo natif, sans nécessiter de processus audio séparé en aval.
La documentation actuelle pour les développeurs mentionne :
- Nom du modèle :
MiniMax-H3 - Résolution de sortie : 2K
- Durée de sortie : jusqu'à 15 secondes
- Formats d'image courants : pris en charge
- Format d'image adaptatif : applicable aux flux de travail de référence appropriés
La référence API accepte actuellement des durées entières de 4 à 15 secondes, tandis que les guides avancés pour développeurs décrivent une plage de sortie normale de 5 à 15 secondes.
Cette différence subtile dans la documentation mérite d'être notée lors du développement via l'API : les développeurs doivent suivre le schéma de point de terminaison actuel correspondant à leur compte et à leur SDK.
Pour la génération purement textuelle, le format d'image doit être explicitement spécifié.
Les formats d'image actuellement pris en charge dans la référence API incluent :
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
Les flux de travail par référence peuvent également utiliser des dimensions adaptatives.
Les premiers tests se concentrent sur la création de contenu commercial
MiniMax affirme que les premiers tests montrent de solides performances dans plusieurs domaines d'application pratiques.
Ces domaines incluent :
- Le respect des instructions
- Le branding et la présentation du texte
- Le transfert de mouvement vidéo-vers-vidéo
- La génération multimodale
- L'édition contrôlée
- La production créative commerciale
L'entreprise met particulièrement en avant les scénarios d'application suivants :
- Publicité
- Branding
- Commerce électronique
- Conception de produits
- UI/UX (interface utilisateur / expérience utilisateur)
- Jeux vidéo
Ces descriptions de performance proviennent de MiniMax elle-même et des rapports de lancement associés, et non de benchmarks publics indépendants.
Cette distinction est importante.
La qualité de génération vidéo est difficile à résumer en une simple note. Un modèle peut exceller en transfert de mouvement mais être plus faible sur les détails fins du visage, la typographie, la cohérence d'identité à long terme ou les interactions complexes entre plusieurs objets.
Par conséquent, la manière la plus fiable d'évaluer si H3 est adapté à la production est de le tester sur le contenu que l'équipe doit réellement créer.
H3 adopte une nouvelle architecture technique multimodale
Les rapports d'AIBase et les documents de lancement de MiniMax décrivent plusieurs technologies derrière H3 :
- Représentation Omni Contextuelle (Contextual Omni Representation)
- H3-VAE
- H3-Omni Transformer (Transformateur Omni)
- Régénération dans le contexte (In-Context Regeneration)
La documentation API publique se concentre actuellement davantage sur l'utilisation de H3 que sur la divulgation complète des détails techniques.
Les articles de recherche associés à ces composants n'ont pas encore été publiés ; les descriptions architecturales détaillées doivent donc être considérées comme des indications produit de MiniMax, sauf si un rapport technique fournit des détails supplémentaires reproductibles.
Représentation Omni Contextuelle
Ce composant est conçu pour représenter conjointement texte, images, vidéos et audio dans un contexte partagé.
Son rôle est d'aider H3 à comprendre les associations entre plusieurs sources de référence et les instructions en langage naturel.
H3-VAE
H3-VAE est décrit comme faisant partie de la pile de représentation et de génération vidéo du modèle.
Un VAE vidéo compresse généralement les informations vidéo haute dimension en une représentation latente plus gérable pour la génération et le décodage.
Au moment de la rédaction de cet article, MiniMax n'a pas publié suffisamment de détails techniques publics pour décrire de manière indépendante la conception exacte de H3-VAE.
H3-Omni Transformer
Le H3-Omni Transformer est présenté comme le composant responsable de la génération multimodale unifiée du modèle.
Son nom reflète l'objectif plus large du modèle : un système capable de gérer le raisonnement sur plusieurs types de médias, plutôt que de basculer entre différents modèles experts indépendants.
Régénération dans le contexte
MiniMax liste également la régénération dans le contexte comme faisant partie de la pile technologique de H3.
Son rôle attendu est d'utiliser les informations déjà présentes dans le contexte multimodal pour améliorer la génération.
Comme pour les autres noms d'architectures, le processus de formation détaillé et les résultats des expériences d'ablation n'étaient pas fournis dans la documentation API publique au moment de la publication.
Tarification de H3 basée sur la durée vidéo
L'article d'AIBase a souligné le rapport qualité-prix de H3.
La tarification officielle actuelle à l'usage de MiniMax fournit des références numériques plus claires.
| Résolution | Prix officiel de l'API |
|---|---|
| 2K | 0,13 $ par seconde générée |
| 768P | 0,09 $ par seconde générée |
Les matériaux de référence en entrée ont des règles de facturation distinctes.
MiniMax répertorie actuellement :
- Référence audio : gratuite
- Les 5 premières images de référence : gratuites
- Images de référence supplémentaires : 0,04 $ chacune
- Référence vidéo : facturée selon la durée de la vidéo d'entrée et la résolution de sortie cible
MiniMax indique qu'à la seconde, H3 en résolution 2K coûte moins d'un tiers des principaux modèles concurrents, et moins de la moitié du prix des alternatives 720P dominantes en résolution 768P.
Ces comparaisons relatives relèvent d'affirmations du fabricant, car les résultats dépendent largement des modèles concurrents inclus, des forfaits, des résolutions et des modes de facturation.
Lors de la planification budgétaire, les développeurs devraient d'abord s'appuyer sur les tarifs API H3 publiés, puis effectuer une comparaison précise avec les alternatives qu'ils utilisent réellement.
Pourquoi le coût à la seconde est important pour la vidéo IA
Le coût de génération vidéo augmente linéairement avec la durée de sortie, les dépenses peuvent donc rapidement devenir élevées.
Cela modifie l'économie de l'itération par essais et erreurs.
Les créateurs génèrent rarement une séquence parfaite du premier coup.
Un flux de production complet peut impliquer :
- De multiples expérimentations de prompts
- De multiples tentatives de cohérence des personnages
- Des variations de mouvements de caméra
- Différents ratios d'aspect
- Des corrections de marque ou de produit
- Une génération finale en haute résolution
Même une légère réduction du coût à la seconde peut représenter des économies considérables lorsque les équipes créent des dizaines, voire des centaines de variantes.
Cela est particulièrement important dans les scénarios suivants —
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
Dans les secteurs de la publicité et du commerce électronique, une campagne marketing peut nécessiter :
- Plusieurs produits
- Plusieurs marchés
- Différentes langues
- Formats paysage et portrait
- De multiples variantes créatives
Ainsi, le positionnement tarifaire de H3 ne considère pas seulement le coût d'une vidéo individuelle finale, mais vise davantage l'économie d'itération.
La génération par référence est l'une des capacités les plus importantes de H3
L'API MiniMax actuelle prend en charge la génération par référence utilisant un mélange d'images, de vidéos et d'audio.
Cela prend en charge des flux de travail tels que :
- Maintenir la cohérence du produit ou du personnage à partir d'une image
- Suivre le mouvement d'une vidéo de référence
- Emprunter le comportement de caméra d'un autre clip vidéo
- Utiliser une piste audio de référence pour le contrôle temporel ou la synchronisation
- Combiner plusieurs formes de matériaux de référence dans une seule requête
MiniMax indique que H3 peut préserver les caractéristiques du sujet ou du matériau de référence dans l'intégralité de la sortie générée.
Cela est particulièrement important pour le travail commercial.
Les prompts textuels généraux peuvent créer des clips vidéo visuellement attrayants, mais peuvent toujours modifier :
- Les logos
- Les proportions du produit
- Les vêtements
- L'identité des personnages
- L'emballage
- Les couleurs de la marque
Les flux de travail pilotés par référence offrent un meilleur contrôle sur ces variables.
Cependant, cela ne garantit pas une conservation parfaite de l'identité, les équipes doivent donc toujours examiner chaque matériau généré avant sa publication.
Le contrôle de la première et de la dernière image ajoute un autre flux de production
H3 prend également en charge le contrôle en utilisant la première image, la dernière image, ou les deux.
C'est utile lorsque les créateurs savent déjà comment la séquence doit commencer ou se terminer.
Les usages typiques incluent :
- Animer une image fixe de produit
- Créer des transitions entre deux images
- Faire correspondre le début d'un plan avec la fin d'un autre
- Contrôler l'état final d'une transformation
- Construire des séquences de montage plus prévisibles
L'API de MiniMax traite la génération première/dernière image et la génération par référence comme deux modes distincts.
Une requête ne peut pas mélanger les rôles first_frame ou last_frame avec les rôles reference_image, reference_video ou reference_audio dans la même tâche.
Cette limitation est très importante pour les développeurs qui intègrent cette API.
MiniMax prévoit de publier les poids du modèle H3
L'une des parties les plus remarquables de cette annonce est le projet de MiniMax de rendre publics les poids du modèle H3.
La société indique que les poids devraient être publiés dans les prochains jours, sous réserve des lois et réglementations applicables.
MiniMax estime que la publication des poids contribuera à :
- Étendre l'écosystème des modèles ouverts
- Soutenir les versions personnalisées
- Accélérer l'adaptation à différents matériels
- Réduire la dépendance à un service hébergé unique
- Encourager la recherche et l'expérimentation de déploiement
La société a également indiqué que la compatibilité matérielle a été prise en compte dès la conception de H3, y compris la compatibilité avec un plus large éventail de matériel IA.
Au moment de la rédaction de cet article, les pages GitHub et Hugging Face officielles de MiniMax sont publiquement accessibles, mais aucun dépôt public confirmé des poids H3 n'est lié dans la documentation API H3 officielle examinée ici.
Cela signifie que les développeurs devraient attendre les liens officiels de MiniMax plutôt que de télécharger les poids depuis des miroirs non autorisés.
Correction concernant l'affirmation du « premier modèle vidéo chinois à poids ouverts »
AIBase
Cet article affirme que le plan de publication de H3 marque la première fois qu'un modèle de base de génération vidéo chinois ouvre ses poids à la communauté.
Au sens large, cette affirmation n'est pas historiquement exacte.
Alibaba a publié les poids et le code d'inférence de son modèle de génération vidéo Wan2.1 en février 2025, et des variantes ultérieures de Wan2.1 ont également été rendues publiques.
Le point de différenciation plus solide de H3 réside dans son architecture vidéo multimodale unifiée générale, incluant les références texte, image, vidéo et audio, ainsi que la sortie audio-vidéo native — plutôt que d'être le premier modèle vidéo chinois à poids ouverts.
Les poids ouverts facilitent l'adaptation matérielle
Les poids de modèles ouverts sont cruciaux sur les marchés où les organisations souhaitent un plus grand contrôle de leur infrastructure.
Les API hébergées sont plus faciles à démarrer, mais les poids ouverts permettent :
- Le déploiement sur une infrastructure privée
- L'optimisation des kernels pour le matériel local
- La quantification du modèle
- La construction de runtimes d'inférence dédiés
- Le fine-tuning ou l'adaptation de composants dans les limites des licences
- L'intégration avec des accélérateurs nationaux
- Le maintien des données sensibles dans des environnements contrôlés
La possibilité réelle d'auto-hébergement de H3 dépendra d'informations non encore publiées dans les articles sources, notamment :
- Le nombre de paramètres
- Les besoins en mémoire vidéo
- La précision d'inférence
- Les exigences de parallélisation
- La configuration matérielle minimale
- Les termes de la licence
- Le support de l'entraînement ou du fine-tuning
Tant que les poids officiels et la documentation technique ne sont pas publiés, toute affirmation concernant la compatibilité avec les GPU grand public ou les coûts d'auto-hébergement reste spéculative.
MiniMax reconnaît que H3 a encore une marge d'amélioration
MiniMax a également indiqué que ce modèle n'est pas le point final de la série H.
La société a identifié les axes suivants :
- Détails fins des images
- Taille globale du modèle
- Extension supplémentaire des capacités
MiniMax a déclaré son intention de continuer à étendre la famille de modèles H et, à terme, d'intégrer les capacités des familles H et M.
La famille H se concentre actuellement sur la génération multimodale, en particulier la vidéo.
La famille M comprend les modèles de langage et d'agent de MiniMax.
Une future fusion pourrait viser un système où une seule famille de modèles peut gérer :
- Le raisonnement linguistique
- L'exécution d'agents
- La compréhension d'images
- La compréhension vidéo
- L'audio
- La création vidéo
- L'édition
Cela reste une direction prospective, plutôt qu'un produit unifié déjà publié.
Le changement de H3 dans les flux de travail de génération vidéo
La contribution la plus importante de H3 n'est pas simplement une résolution plus élevée.
Le changement majeur réside dans le fait que des opérations de création auparavant distinctes peuvent désormais être réalisées dans un seul contexte.
Les créateurs peuvent passer de :
Générer une vidéo à partir de cette phrase.
à :
Utilisez cette personne, suivez le mouvement de cette vidéo, conservez cette identité visuelle,
prenez les indices rythmiques de cet audio, et créez une nouvelle scène basée sur ce prompt.
Cela change le rôle du modèle vidéo.
Il ne ressemble plus à un générateur à usage unique, mais davantage à un moteur créatif multimodal.
Pour les équipes commerciales, la valeur dépendra de la mesure dans laquelle H3 peut maintenir de manière cohérente la cohérence des références, suivre des instructions complexes, rendre les informations de marque et rester économiquement efficace.
À travers plusieurs générations.
FAQ
Qu'est-ce que MiniMax H3 ?
MiniMax H3 est un modèle de génération vidéo multimodal généraliste développé par MiniMax. Il accepte du texte, des images, des vidéos et de l'audio comme contexte, et prend en charge la génération texte-vers-vidéo, image-vers-vidéo, la génération basée sur des matériaux de référence et la création vidéo contrôlée.
Quelles résolutions MiniMax H3 prend-il en charge ?
La documentation API actuelle de MiniMax répertorie la résolution 2K comme résolution de sortie principale pour H3. Sa page de tarification répertorie également un palier de facturation 768P.
Quelle est la durée maximale des vidéos MiniMax H3 ?
La documentation officielle H3 prend en charge des sorties vidéo allant jusqu'à 15 secondes. La référence API accepte actuellement des valeurs de durée entières comprises entre 4 et 15 secondes.
MiniMax H3 génère-t-il de l’audio ?
Oui. MiniMax décrit H3 comme prenant en charge la sortie vidéo stéréo native avec audio, ce qui signifie que l’audio peut être généré dans le cadre du flux de travail vidéo, sans dépendre systématiquement d’un modèle de post-production séparé.
Combien coûte l’API MiniMax H3 ?
MiniMax facture actuellement H3 à 0,13 $ par seconde pour la génération en résolution 2K et à 0,09 $ par seconde pour la résolution 768P. Selon les règles de facturation publiées, les vidéos de référence et les images supplémentaires peuvent augmenter les coûts liés aux matériaux d’entrée.
H3 peut-il utiliser simultanément des images, des vidéos et de l’audio de référence ?
Oui. L’API officielle prend en charge les images, vidéos et audio de référence dans le même flux de travail de génération par référence, sous réserve des limites concernant le nombre de fichiers, la durée, la taille et les combinaisons d’entrées.
MiniMax H3 est-il open source ?
MiniMax a annoncé son intention de publier les poids du modèle H3 dans les prochains jours, sous réserve des réglementations applicables. Au moment de la rédaction de cet article, l’API officielle est en ligne, mais aucun dépôt public de poids H3 n’a été confirmé dans la documentation officielle consultée.
H3 est-il le premier modèle vidéo chinois à poids ouverts ?
Non, pas au sens historique large. Alibaba a publié les poids du modèle de génération vidéo Wan2.1 en
2025. Ce qui distingue H3, c’est la combinaison de références multimodales et de capacités natives de génération audio-vidéo dans un modèle vidéo universel.
Outils associés
- API MiniMax H3 : Documentation officielle des flux texte-vers-vidéo, image-vers-vidéo et génération par référence de H3.
- Plateforme ouverte MiniMax : Plateforme développeur MiniMax proposant clés API, accès aux modèles, facturation et ressources développeur.
- GitHub MiniMax : Organisation GitHub officielle de l’entreprise pour les projets open source et modèles.
- Hugging Face MiniMax : Organisation Hugging Face officielle de MiniMax pour les ressources publiques de modèles.
- Wan2.1 : Série de modèles de génération vidéo open source d’Alibaba, utile comme contexte historique des modèles vidéo à poids ouverts.
Liens associés
- Site officiel MiniMax : Site officiel de MiniMax, qui liste actuellement H3 comme nouveau modèle de génération vidéo.
- Guide de génération vidéo MiniMax H3 : Documentation officielle sur les spécifications, les modes pris en charge, les limites d’entrée et les flux de travail.
- Référence API MiniMax H3 : Spécifications officielles de l’endpoint V2 pour créer des tâches de génération vidéo H3.
- Tarifs API MiniMax : Tarifs officiels actuels à la consommation pour H3 et rules de facturation des médias de référence.
- GitHub officiel MiniMax : Organisation officielle pour suivre les codes et ressources de modèles publiés.
- Alibaba : modèle vidéo open source Wan 2.1 : Confirmation historique officielle que des modèles vidéo chinois à poids ouverts existaient avant H3.
- Dépôt GitHub Wan 2.1 : Code d’inférence publique et poids de la première famille open source de génération vidéo d’Alibaba.
Résumé
MiniMax H3 intègre texte, image, vidéo et audio dans un flux unifié de génération vidéo. Il prend en charge des sorties jusqu’à 2K en 15 secondes, l’audio stéréo natif, le contrôle première/dernière image, ainsi que la génération par référence utilisant plusieurs types de médias.
Son argument commercial repose sur deux piliers : le contrôle et le coût. MiniMax indique que H3 excelle dans le respect des instructions, la présentation de marque et le transfert de mouvement, tandis que son API officielle est actuellement tarifée à 0,13 $ par seconde pour la génération 2K et à 0,09 $ par seconde pour la 768P.
MiniMax prévoit également de publier les poids du modèle, bien que la documentation officielle consultée au moment de la publication ne référence pas encore de dépôt de poids H3 confirmé.
Le changement le plus important de H3 n’est pas seulement la vidéo 2K — c’est l’évolution vers un système de génération multimodale unifié capable de comprendre comment le texte, l’image, la vidéo et l’audio doivent fonctionner ensemble.



