MiniMax lance officiellement MiniMax H3, un modèle de génération vidéo multimodal polyvalent, capable de comprendre le texte, les images, le...

MiniMax a officiellement dévoilé MiniMax H3, un modèle génératif vidéo multimodal polyvalent capable de comprendre texte, images, vidéos et audio dans un même flux de travail de génération.
Cette annonce marque une rupture avec l'approche traditionnelle qui traitait la génération texte-vers-vidéo, image-vers-vidéo, la génération à partir de vidéos de référence, la synchronisation audio et l'édition comme des tâches distinctes. Au contraire, H3 est conçu pour recevoir simultanément plusieurs types de contextes et utiliser des instructions en langage naturel pour décrire comment ces contenus de référence doivent interagir.
Selon MiniMax, H3 prend en charge la sortie vidéo avec audio stéréo natif, génère des clips allant jusqu'à 15 secondes et offre une résolution 2K via l'API actuelle.
L'entreprise positionne ce modèle pour la création de contenu commercial, notamment la publicité, le branding, le commerce électronique, la conception de produits, l'UI/UX et les jeux vidéo.

Cette publication met également l'accent sur le coût de génération. MiniMax indique que H3, tout en conservant les références multimodales et la sortie haute résolution, présente un coût de génération par seconde inférieur à celui de nombreux systèmes de génération vidéo populaires.
Les premiers modèles vidéo étaient souvent organisés autour de flux de travail indépendants.
Les créateurs pouvaient choisir un modèle ou une interface pour la génération texte-vers-vidéo, un autre pour l'animation d'images, et utiliser un processus distinct pour l'édition de vidéos de référence ou la synchronisation audio.
H3 tente d'unifier ces cas d'usage dans un contexte multimodal partagé.
La documentation API actuelle de MiniMax décrit trois principaux modes de génération :
| Mode de génération | Entrée | Utilisation typique |
|---|---|---|
| Texte-vers-vidéo | Invite textuelle | Générer une nouvelle vidéo à partir d'une description textuelle |
| Image-vers-vidéo (première/dernière image) | Invite plus première et/ou dernière image | Animer une image ou contrôler le début et la fin d'un clip vidéo |
| Génération par référence | Invite plus images, vidéos et/ou audio | Préserver le sujet, le mouvement, le style de prise de vue, la voix ou le rythme de montage |
Ainsi, le modèle ne se limite pas à transformer une phrase en vidéo.
Il peut également intégrer des médias de référence dans le contexte de génération.
Pour la génération par référence, l'API de MiniMax prend en charge les combinaisons suivantes :
La durée totale des vidéos de référence peut atteindre 15 secondes, et l'audio doit être accompagné d'au moins une image ou une vidéo de référence.
Cette structure permet aux créateurs de décrire les relations entre différentes entrées sans avoir à traiter manuellement chaque modalité comme une étape distincte.
Les sources d'AIBase décrivent l'un des principes fondamentaux de H3 comme la Représentation Omni Contextuelle (Contextual Omni Representation).
Le concept est d'utiliser le langage naturel comme lien entre les différents types de médias.
Les utilisateurs peuvent fournir plusieurs contenus de référence simultanément et décrire en langage courant les relations attendues entre eux.
Par exemple, un flux de travail pourrait demander conceptuellement à H3 de :
Cela diffère fondamentalement d'une simple invite texte-vers-vidéo.
Le modèle doit non seulement comprendre ce que contient chaque entrée média, mais aussi quel rôle chaque entrée doit jouer dans la génération finale.
L'API publique de MiniMax reflète cette conception à travers des entrées multimodales basées sur des rôles, telles que :
first_frame (première image)last_frame (dernière image)reference_image (image de référence)reference_video (vidéo de référence)reference_audio (audio de référence)Les utilisateurs doivent toujours fournir une invite textuelle, mais celle-ci peut désormais servir de couche d'instructions au-dessus de multiples sources médias.
MiniMax indique que H3 peut générer directement des vidéos avec audio stéréo natif, sans nécessiter de processus audio séparé en aval.
La documentation actuelle pour les développeurs mentionne :
MiniMax-H3La référence API accepte actuellement des durées entières de 4 à 15 secondes, tandis que les guides avancés pour développeurs décrivent une plage de sortie normale de 5 à 15 secondes.
Cette différence subtile dans la documentation mérite d'être notée lors du développement via l'API : les développeurs doivent suivre le schéma de point de terminaison actuel correspondant à leur compte et à leur SDK.
Pour la génération purement textuelle, le format d'image doit être explicitement spécifié.
Les formats d'image actuellement pris en charge dans la référence API incluent :
Les flux de travail par référence peuvent également utiliser des dimensions adaptatives.
MiniMax affirme que les premiers tests montrent de solides performances dans plusieurs domaines d'application pratiques.
Ces domaines incluent :
L'entreprise met particulièrement en avant les scénarios d'application suivants :
Ces descriptions de performance proviennent de MiniMax elle-même et des rapports de lancement associés, et non de benchmarks publics indépendants.
Cette distinction est importante.
La qualité de génération vidéo est difficile à résumer en une simple note. Un modèle peut exceller en transfert de mouvement mais être plus faible sur les détails fins du visage, la typographie, la cohérence d'identité à long terme ou les interactions complexes entre plusieurs objets.
Par conséquent, la manière la plus fiable d'évaluer si H3 est adapté à la production est de le tester sur le contenu que l'équipe doit réellement créer.
Les rapports d'AIBase et les documents de lancement de MiniMax décrivent plusieurs technologies derrière H3 :
La documentation API publique se concentre actuellement davantage sur l'utilisation de H3 que sur la divulgation complète des détails techniques.
Les articles de recherche associés à ces composants n'ont pas encore été publiés ; les descriptions architecturales détaillées doivent donc être considérées comme des indications produit de MiniMax, sauf si un rapport technique fournit des détails supplémentaires reproductibles.
Ce composant est conçu pour représenter conjointement texte, images, vidéos et audio dans un contexte partagé.
Son rôle est d'aider H3 à comprendre les associations entre plusieurs sources de référence et les instructions en langage naturel.
H3-VAE est décrit comme faisant partie de la pile de représentation et de génération vidéo du modèle.
Un VAE vidéo compresse généralement les informations vidéo haute dimension en une représentation latente plus gérable pour la génération et le décodage.
Au moment de la rédaction de cet article, MiniMax n'a pas publié suffisamment de détails techniques publics pour décrire de manière indépendante la conception exacte de H3-VAE.
Le H3-Omni Transformer est présenté comme le composant responsable de la génération multimodale unifiée du modèle.
Son nom reflète l'objectif plus large du modèle : un système capable de gérer le raisonnement sur plusieurs types de médias, plutôt que de basculer entre différents modèles experts indépendants.
MiniMax liste également la régénération dans le contexte comme faisant partie de la pile technologique de H3.
Son rôle attendu est d'utiliser les informations déjà présentes dans le contexte multimodal pour améliorer la génération.
Comme pour les autres noms d'architectures, le processus de formation détaillé et les résultats des expériences d'ablation n'étaient pas fournis dans la documentation API publique au moment de la publication.
L'article d'AIBase a souligné le rapport qualité-prix de H3.
La tarification officielle actuelle à l'usage de MiniMax fournit des références numériques plus claires.
| Résolution | Prix officiel de l'API |
|---|---|
| 2K | 0,13 $ par seconde générée |
| 768P | 0,09 $ par seconde générée |
Les matériaux de référence en entrée ont des règles de facturation distinctes.
MiniMax répertorie actuellement :
MiniMax indique qu'à la seconde, H3 en résolution 2K coûte moins d'un tiers des principaux modèles concurrents, et moins de la moitié du prix des alternatives 720P dominantes en résolution 768P.
Ces comparaisons relatives relèvent d'affirmations du fabricant, car les résultats dépendent largement des modèles concurrents inclus, des forfaits, des résolutions et des modes de facturation.
Lors de la planification budgétaire, les développeurs devraient d'abord s'appuyer sur les tarifs API H3 publiés, puis effectuer une comparaison précise avec les alternatives qu'ils utilisent réellement.
Le coût de génération vidéo augmente linéairement avec la durée de sortie, les dépenses peuvent donc rapidement devenir élevées.
Cela modifie l'économie de l'itération par essais et erreurs.
Les créateurs génèrent rarement une séquence parfaite du premier coup.
Un flux de production complet peut impliquer :
Même une légère réduction du coût à la seconde peut représenter des économies considérables lorsque les équipes créent des dizaines, voire des centaines de variantes.
Cela est particulièrement important dans les scénarios suivants —
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
Dans les secteurs de la publicité et du commerce électronique, une campagne marketing peut nécessiter :
Ainsi, le positionnement tarifaire de H3 ne considère pas seulement le coût d'une vidéo individuelle finale, mais vise davantage l'économie d'itération.
L'API MiniMax actuelle prend en charge la génération par référence utilisant un mélange d'images, de vidéos et d'audio.
Cela prend en charge des flux de travail tels que :
MiniMax indique que H3 peut préserver les caractéristiques du sujet ou du matériau de référence dans l'intégralité de la sortie générée.
Cela est particulièrement important pour le travail commercial.
Les prompts textuels généraux peuvent créer des clips vidéo visuellement attrayants, mais peuvent toujours modifier :
Les flux de travail pilotés par référence offrent un meilleur contrôle sur ces variables.
Cependant, cela ne garantit pas une conservation parfaite de l'identité, les équipes doivent donc toujours examiner chaque matériau généré avant sa publication.
H3 prend également en charge le contrôle en utilisant la première image, la dernière image, ou les deux.
C'est utile lorsque les créateurs savent déjà comment la séquence doit commencer ou se terminer.
Les usages typiques incluent :
L'API de MiniMax traite la génération première/dernière image et la génération par référence comme deux modes distincts.
Une requête ne peut pas mélanger les rôles first_frame ou last_frame avec les rôles reference_image, reference_video ou reference_audio dans la même tâche.
Cette limitation est très importante pour les développeurs qui intègrent cette API.
L'une des parties les plus remarquables de cette annonce est le projet de MiniMax de rendre publics les poids du modèle H3.
La société indique que les poids devraient être publiés dans les prochains jours, sous réserve des lois et réglementations applicables.
MiniMax estime que la publication des poids contribuera à :
La société a également indiqué que la compatibilité matérielle a été prise en compte dès la conception de H3, y compris la compatibilité avec un plus large éventail de matériel IA.
Au moment de la rédaction de cet article, les pages GitHub et Hugging Face officielles de MiniMax sont publiquement accessibles, mais aucun dépôt public confirmé des poids H3 n'est lié dans la documentation API H3 officielle examinée ici.
Cela signifie que les développeurs devraient attendre les liens officiels de MiniMax plutôt que de télécharger les poids depuis des miroirs non autorisés.
AIBase
Cet article affirme que le plan de publication de H3 marque la première fois qu'un modèle de base de génération vidéo chinois ouvre ses poids à la communauté.
Au sens large, cette affirmation n'est pas historiquement exacte.
Alibaba a publié les poids et le code d'inférence de son modèle de génération vidéo Wan2.1 en février 2025, et des variantes ultérieures de Wan2.1 ont également été rendues publiques.
Le point de différenciation plus solide de H3 réside dans son architecture vidéo multimodale unifiée générale, incluant les références texte, image, vidéo et audio, ainsi que la sortie audio-vidéo native — plutôt que d'être le premier modèle vidéo chinois à poids ouverts.
Les poids de modèles ouverts sont cruciaux sur les marchés où les organisations souhaitent un plus grand contrôle de leur infrastructure.
Les API hébergées sont plus faciles à démarrer, mais les poids ouverts permettent :
La possibilité réelle d'auto-hébergement de H3 dépendra d'informations non encore publiées dans les articles sources, notamment :
Tant que les poids officiels et la documentation technique ne sont pas publiés, toute affirmation concernant la compatibilité avec les GPU grand public ou les coûts d'auto-hébergement reste spéculative.
MiniMax a également indiqué que ce modèle n'est pas le point final de la série H.
La société a identifié les axes suivants :
MiniMax a déclaré son intention de continuer à étendre la famille de modèles H et, à terme, d'intégrer les capacités des familles H et M.
La famille H se concentre actuellement sur la génération multimodale, en particulier la vidéo.
La famille M comprend les modèles de langage et d'agent de MiniMax.
Une future fusion pourrait viser un système où une seule famille de modèles peut gérer :
Cela reste une direction prospective, plutôt qu'un produit unifié déjà publié.
La contribution la plus importante de H3 n'est pas simplement une résolution plus élevée.
Le changement majeur réside dans le fait que des opérations de création auparavant distinctes peuvent désormais être réalisées dans un seul contexte.
Les créateurs peuvent passer de :
Générer une vidéo à partir de cette phrase.
à :
Utilisez cette personne, suivez le mouvement de cette vidéo, conservez cette identité visuelle,
prenez les indices rythmiques de cet audio, et créez une nouvelle scène basée sur ce prompt.
Cela change le rôle du modèle vidéo.
Il ne ressemble plus à un générateur à usage unique, mais davantage à un moteur créatif multimodal.
Pour les équipes commerciales, la valeur dépendra de la mesure dans laquelle H3 peut maintenir de manière cohérente la cohérence des références, suivre des instructions complexes, rendre les informations de marque et rester économiquement efficace.
À travers plusieurs générations.
MiniMax H3 est un modèle de génération vidéo multimodal généraliste développé par MiniMax. Il accepte du texte, des images, des vidéos et de l'audio comme contexte, et prend en charge la génération texte-vers-vidéo, image-vers-vidéo, la génération basée sur des matériaux de référence et la création vidéo contrôlée.
La documentation API actuelle de MiniMax répertorie la résolution 2K comme résolution de sortie principale pour H3. Sa page de tarification répertorie également un palier de facturation 768P.
La documentation officielle H3 prend en charge des sorties vidéo allant jusqu'à 15 secondes. La référence API accepte actuellement des valeurs de durée entières comprises entre 4 et 15 secondes.
MiniMax H3 génère-t-il de l’audio ?
Oui. MiniMax décrit H3 comme prenant en charge la sortie vidéo stéréo native avec audio, ce qui signifie que l’audio peut être généré dans le cadre du flux de travail vidéo, sans dépendre systématiquement d’un modèle de post-production séparé.
MiniMax facture actuellement H3 à 0,13 $ par seconde pour la génération en résolution 2K et à 0,09 $ par seconde pour la résolution 768P. Selon les règles de facturation publiées, les vidéos de référence et les images supplémentaires peuvent augmenter les coûts liés aux matériaux d’entrée.
Oui. L’API officielle prend en charge les images, vidéos et audio de référence dans le même flux de travail de génération par référence, sous réserve des limites concernant le nombre de fichiers, la durée, la taille et les combinaisons d’entrées.
MiniMax a annoncé son intention de publier les poids du modèle H3 dans les prochains jours, sous réserve des réglementations applicables. Au moment de la rédaction de cet article, l’API officielle est en ligne, mais aucun dépôt public de poids H3 n’a été confirmé dans la documentation officielle consultée.
Non, pas au sens historique large. Alibaba a publié les poids du modèle de génération vidéo Wan2.1 en 2025. Ce qui distingue H3, c’est la combinaison de références multimodales et de capacités natives de génération audio-vidéo dans un modèle vidéo universel.
MiniMax H3 intègre texte, image, vidéo et audio dans un flux unifié de génération vidéo. Il prend en charge des sorties jusqu’à 2K en 15 secondes, l’audio stéréo natif, le contrôle première/dernière image, ainsi que la génération par référence utilisant plusieurs types de médias.
Son argument commercial repose sur deux piliers : le contrôle et le coût. MiniMax indique que H3 excelle dans le respect des instructions, la présentation de marque et le transfert de mouvement, tandis que son API officielle est actuellement tarifée à 0,13 $ par seconde pour la génération 2K et à 0,09 $ par seconde pour la 768P.
MiniMax prévoit également de publier les poids du modèle, bien que la documentation officielle consultée au moment de la publication ne référence pas encore de dépôt de poids H3 confirmé.
Le changement le plus important de H3 n’est pas seulement la vidéo 2K — c’est l’évolution vers un système de génération multimodale unifié capable de comprendre comment le texte, l’image, la vidéo et l’audio doivent fonctionner ensemble.
Partez d’une phrase et obtenez un site complet en quelques minutes.