MiniMax H3 officiellement lancé : modèle vidéo multimodal polyvalent, prend en charge la sortie 2K et le son stéréo natif

MiniMax lance officiellement MiniMax H3, un modèle de génération vidéo multimodal polyvalent, capable de comprendre le texte, les images, les vidéos et l'audio dans un cadre de génération unifié.

发布于 2026年7月31日generalGEO 评分: 04 次阅读
MiniMax H3 officiellement lancé : modèle vidéo multimodal polyvalent, prend en charge la sortie 2K et le son stéréo natif

Publication de MiniMax H3 : un modèle vidéo multimodal polyvalent avec sortie 2K et audio stéréo natif

Introduction

MiniMax a officiellement dévoilé MiniMax H3, un modèle génératif vidéo multimodal polyvalent capable de comprendre texte, images, vidéos et audio dans un même flux de travail de génération.

Cette annonce marque une rupture avec l'approche traditionnelle qui traitait la génération texte-vers-vidéo, image-vers-vidéo, la génération à partir de vidéos de référence, la synchronisation audio et l'édition comme des tâches distinctes. Au contraire, H3 est conçu pour recevoir simultanément plusieurs types de contextes et utiliser des instructions en langage naturel pour décrire comment ces contenus de référence doivent interagir.

Selon MiniMax, H3 prend en charge la sortie vidéo avec audio stéréo natif, génère des clips allant jusqu'à 15 secondes et offre une résolution 2K via l'API actuelle.

L'entreprise positionne ce modèle pour la création de contenu commercial, notamment la publicité, le branding, le commerce électronique, la conception de produits, l'UI/UX et les jeux vidéo.

Image montrant une jeune femme assise à l'extérieur d'un café, avec des cheveux noirs bouclés et une peau brune, portant un haut blanc et un tablier bleu, des bracelets colorés au poignet, tenant une tasse de café. Un café avec l'enseigne « CAFE » est visible en arrière-plan, avec d'autres clients à l'intérieur ou en terrasse. Cette image est liée à la présentation du modèle MiniMax H3 dans le document et peut illustrer ses applications dans la création de contenu commercial, comme la publicité et le branding.

Cette publication met également l'accent sur le coût de génération. MiniMax indique que H3, tout en conservant les références multimodales et la sortie haute résolution, présente un coût de génération par seconde inférieur à celui de nombreux systèmes de génération vidéo populaires.

H3 : des tâches vidéo spécialisées vers une génération multimodale unifiée

Les premiers modèles vidéo étaient souvent organisés autour de flux de travail indépendants.

Les créateurs pouvaient choisir un modèle ou une interface pour la génération texte-vers-vidéo, un autre pour l'animation d'images, et utiliser un processus distinct pour l'édition de vidéos de référence ou la synchronisation audio.

H3 tente d'unifier ces cas d'usage dans un contexte multimodal partagé.

La documentation API actuelle de MiniMax décrit trois principaux modes de génération :

Mode de génération Entrée Utilisation typique
Texte-vers-vidéo Invite textuelle Générer une nouvelle vidéo à partir d'une description textuelle
Image-vers-vidéo (première/dernière image) Invite plus première et/ou dernière image Animer une image ou contrôler le début et la fin d'un clip vidéo
Génération par référence Invite plus images, vidéos et/ou audio Préserver le sujet, le mouvement, le style de prise de vue, la voix ou le rythme de montage

Ainsi, le modèle ne se limite pas à transformer une phrase en vidéo.

Il peut également intégrer des médias de référence dans le contexte de génération.

Pour la génération par référence, l'API de MiniMax prend en charge les combinaisons suivantes :

  • Jusqu'à 9 images de référence
  • Jusqu'à 3 vidéos de référence
  • Jusqu'à 3 fichiers audio de référence
  • Un total maximal de 12 fichiers médias

La durée totale des vidéos de référence peut atteindre 15 secondes, et l'audio doit être accompagné d'au moins une image ou une vidéo de référence.

Cette structure permet aux créateurs de décrire les relations entre différentes entrées sans avoir à traiter manuellement chaque modalité comme une étape distincte.

Le langage naturel comme pont entre les modalités

Les sources d'AIBase décrivent l'un des principes fondamentaux de H3 comme la Représentation Omni Contextuelle (Contextual Omni Representation).

Le concept est d'utiliser le langage naturel comme lien entre les différents types de médias.

Les utilisateurs peuvent fournir plusieurs contenus de référence simultanément et décrire en langage courant les relations attendues entre eux.

Par exemple, un flux de travail pourrait demander conceptuellement à H3 de :

  • Conserver le mouvement de caméra d'une vidéo de référence
  • Préserver le personnage apparaissant dans une image de référence
  • Suivre le rythme ou la voix d'une référence audio
  • Appliquer toutes ces contraintes simultanément à une nouvelle scène générée

Cela diffère fondamentalement d'une simple invite texte-vers-vidéo.

Le modèle doit non seulement comprendre ce que contient chaque entrée média, mais aussi quel rôle chaque entrée doit jouer dans la génération finale.

L'API publique de MiniMax reflète cette conception à travers des entrées multimodales basées sur des rôles, telles que :

  • first_frame (première image)
  • last_frame (dernière image)
  • reference_image (image de référence)
  • reference_video (vidéo de référence)
  • reference_audio (audio de référence)

Les utilisateurs doivent toujours fournir une invite textuelle, mais celle-ci peut désormais servir de couche d'instructions au-dessus de multiples sources médias.

H3 prend en charge l'audio stéréo natif et la sortie 2K jusqu'à 15 secondes

MiniMax indique que H3 peut générer directement des vidéos avec audio stéréo natif, sans nécessiter de processus audio séparé en aval.

La documentation actuelle pour les développeurs mentionne :

  • Nom du modèle : MiniMax-H3
  • Résolution de sortie : 2K
  • Durée de sortie : jusqu'à 15 secondes
  • Formats d'image courants : pris en charge
  • Format d'image adaptatif : applicable aux flux de travail de référence appropriés

La référence API accepte actuellement des durées entières de 4 à 15 secondes, tandis que les guides avancés pour développeurs décrivent une plage de sortie normale de 5 à 15 secondes.

Cette différence subtile dans la documentation mérite d'être notée lors du développement via l'API : les développeurs doivent suivre le schéma de point de terminaison actuel correspondant à leur compte et à leur SDK.

Pour la génération purement textuelle, le format d'image doit être explicitement spécifié.

Les formats d'image actuellement pris en charge dans la référence API incluent :

  • 21:9
  • 16:9
  • 4:3
  • 1:1
  • 3:4
  • 9:16

Les flux de travail par référence peuvent également utiliser des dimensions adaptatives.

Les premiers tests se concentrent sur la création de contenu commercial

MiniMax affirme que les premiers tests montrent de solides performances dans plusieurs domaines d'application pratiques.

Ces domaines incluent :

  • Le respect des instructions
  • Le branding et la présentation du texte
  • Le transfert de mouvement vidéo-vers-vidéo
  • La génération multimodale
  • L'édition contrôlée
  • La production créative commerciale

L'entreprise met particulièrement en avant les scénarios d'application suivants :

  • Publicité
  • Branding
  • Commerce électronique
  • Conception de produits
  • UI/UX (interface utilisateur / expérience utilisateur)
  • Jeux vidéo

Ces descriptions de performance proviennent de MiniMax elle-même et des rapports de lancement associés, et non de benchmarks publics indépendants.

Cette distinction est importante.

La qualité de génération vidéo est difficile à résumer en une simple note. Un modèle peut exceller en transfert de mouvement mais être plus faible sur les détails fins du visage, la typographie, la cohérence d'identité à long terme ou les interactions complexes entre plusieurs objets.

Par conséquent, la manière la plus fiable d'évaluer si H3 est adapté à la production est de le tester sur le contenu que l'équipe doit réellement créer.

H3 adopte une nouvelle architecture technique multimodale

Les rapports d'AIBase et les documents de lancement de MiniMax décrivent plusieurs technologies derrière H3 :

  • Représentation Omni Contextuelle (Contextual Omni Representation)
  • H3-VAE
  • H3-Omni Transformer (Transformateur Omni)
  • Régénération dans le contexte (In-Context Regeneration)

La documentation API publique se concentre actuellement davantage sur l'utilisation de H3 que sur la divulgation complète des détails techniques.

Les articles de recherche associés à ces composants n'ont pas encore été publiés ; les descriptions architecturales détaillées doivent donc être considérées comme des indications produit de MiniMax, sauf si un rapport technique fournit des détails supplémentaires reproductibles.

Représentation Omni Contextuelle

Ce composant est conçu pour représenter conjointement texte, images, vidéos et audio dans un contexte partagé.

Son rôle est d'aider H3 à comprendre les associations entre plusieurs sources de référence et les instructions en langage naturel.

H3-VAE

H3-VAE est décrit comme faisant partie de la pile de représentation et de génération vidéo du modèle.

Un VAE vidéo compresse généralement les informations vidéo haute dimension en une représentation latente plus gérable pour la génération et le décodage.

Au moment de la rédaction de cet article, MiniMax n'a pas publié suffisamment de détails techniques publics pour décrire de manière indépendante la conception exacte de H3-VAE.

H3-Omni Transformer

Le H3-Omni Transformer est présenté comme le composant responsable de la génération multimodale unifiée du modèle.

Son nom reflète l'objectif plus large du modèle : un système capable de gérer le raisonnement sur plusieurs types de médias, plutôt que de basculer entre différents modèles experts indépendants.

Régénération dans le contexte

MiniMax liste également la régénération dans le contexte comme faisant partie de la pile technologique de H3.

Son rôle attendu est d'utiliser les informations déjà présentes dans le contexte multimodal pour améliorer la génération.

Comme pour les autres noms d'architectures, le processus de formation détaillé et les résultats des expériences d'ablation n'étaient pas fournis dans la documentation API publique au moment de la publication.

Tarification de H3 basée sur la durée vidéo

L'article d'AIBase a souligné le rapport qualité-prix de H3.

La tarification officielle actuelle à l'usage de MiniMax fournit des références numériques plus claires.

Résolution Prix officiel de l'API
2K 0,13 $ par seconde générée
768P 0,09 $ par seconde générée

Les matériaux de référence en entrée ont des règles de facturation distinctes.

MiniMax répertorie actuellement :

  • Référence audio : gratuite
  • Les 5 premières images de référence : gratuites
  • Images de référence supplémentaires : 0,04 $ chacune
  • Référence vidéo : facturée selon la durée de la vidéo d'entrée et la résolution de sortie cible

MiniMax indique qu'à la seconde, H3 en résolution 2K coûte moins d'un tiers des principaux modèles concurrents, et moins de la moitié du prix des alternatives 720P dominantes en résolution 768P.

Ces comparaisons relatives relèvent d'affirmations du fabricant, car les résultats dépendent largement des modèles concurrents inclus, des forfaits, des résolutions et des modes de facturation.

Lors de la planification budgétaire, les développeurs devraient d'abord s'appuyer sur les tarifs API H3 publiés, puis effectuer une comparaison précise avec les alternatives qu'ils utilisent réellement.

Pourquoi le coût à la seconde est important pour la vidéo IA

Le coût de génération vidéo augmente linéairement avec la durée de sortie, les dépenses peuvent donc rapidement devenir élevées.

Cela modifie l'économie de l'itération par essais et erreurs.

Les créateurs génèrent rarement une séquence parfaite du premier coup.

Un flux de production complet peut impliquer :

  1. De multiples expérimentations de prompts
  2. De multiples tentatives de cohérence des personnages
  3. Des variations de mouvements de caméra
  4. Différents ratios d'aspect
  5. Des corrections de marque ou de produit
  6. Une génération finale en haute résolution

Même une légère réduction du coût à la seconde peut représenter des économies considérables lorsque les équipes créent des dizaines, voire des centaines de variantes.

Cela est particulièrement important dans les scénarios suivants —

Dans les secteurs de la publicité et du commerce électronique, une campagne marketing peut nécessiter :

  • Plusieurs produits
  • Plusieurs marchés
  • Différentes langues
  • Formats paysage et portrait
  • De multiples variantes créatives

Ainsi, le positionnement tarifaire de H3 ne considère pas seulement le coût d'une vidéo individuelle finale, mais vise davantage l'économie d'itération.

La génération par référence est l'une des capacités les plus importantes de H3

L'API MiniMax actuelle prend en charge la génération par référence utilisant un mélange d'images, de vidéos et d'audio.

Cela prend en charge des flux de travail tels que :

  • Maintenir la cohérence du produit ou du personnage à partir d'une image
  • Suivre le mouvement d'une vidéo de référence
  • Emprunter le comportement de caméra d'un autre clip vidéo
  • Utiliser une piste audio de référence pour le contrôle temporel ou la synchronisation
  • Combiner plusieurs formes de matériaux de référence dans une seule requête

MiniMax indique que H3 peut préserver les caractéristiques du sujet ou du matériau de référence dans l'intégralité de la sortie générée.

Cela est particulièrement important pour le travail commercial.

Les prompts textuels généraux peuvent créer des clips vidéo visuellement attrayants, mais peuvent toujours modifier :

  • Les logos
  • Les proportions du produit
  • Les vêtements
  • L'identité des personnages
  • L'emballage
  • Les couleurs de la marque

Les flux de travail pilotés par référence offrent un meilleur contrôle sur ces variables.

Cependant, cela ne garantit pas une conservation parfaite de l'identité, les équipes doivent donc toujours examiner chaque matériau généré avant sa publication.

Le contrôle de la première et de la dernière image ajoute un autre flux de production

H3 prend également en charge le contrôle en utilisant la première image, la dernière image, ou les deux.

C'est utile lorsque les créateurs savent déjà comment la séquence doit commencer ou se terminer.

Les usages typiques incluent :

  • Animer une image fixe de produit
  • Créer des transitions entre deux images
  • Faire correspondre le début d'un plan avec la fin d'un autre
  • Contrôler l'état final d'une transformation
  • Construire des séquences de montage plus prévisibles

L'API de MiniMax traite la génération première/dernière image et la génération par référence comme deux modes distincts.

Une requête ne peut pas mélanger les rôles first_frame ou last_frame avec les rôles reference_image, reference_video ou reference_audio dans la même tâche.

Cette limitation est très importante pour les développeurs qui intègrent cette API.

MiniMax prévoit de publier les poids du modèle H3

L'une des parties les plus remarquables de cette annonce est le projet de MiniMax de rendre publics les poids du modèle H3.

La société indique que les poids devraient être publiés dans les prochains jours, sous réserve des lois et réglementations applicables.

MiniMax estime que la publication des poids contribuera à :

  • Étendre l'écosystème des modèles ouverts
  • Soutenir les versions personnalisées
  • Accélérer l'adaptation à différents matériels
  • Réduire la dépendance à un service hébergé unique
  • Encourager la recherche et l'expérimentation de déploiement

La société a également indiqué que la compatibilité matérielle a été prise en compte dès la conception de H3, y compris la compatibilité avec un plus large éventail de matériel IA.

Au moment de la rédaction de cet article, les pages GitHub et Hugging Face officielles de MiniMax sont publiquement accessibles, mais aucun dépôt public confirmé des poids H3 n'est lié dans la documentation API H3 officielle examinée ici.

Cela signifie que les développeurs devraient attendre les liens officiels de MiniMax plutôt que de télécharger les poids depuis des miroirs non autorisés.

Correction concernant l'affirmation du « premier modèle vidéo chinois à poids ouverts »

AIBase

Cet article affirme que le plan de publication de H3 marque la première fois qu'un modèle de base de génération vidéo chinois ouvre ses poids à la communauté.

Au sens large, cette affirmation n'est pas historiquement exacte.

Alibaba a publié les poids et le code d'inférence de son modèle de génération vidéo Wan2.1 en février 2025, et des variantes ultérieures de Wan2.1 ont également été rendues publiques.

Le point de différenciation plus solide de H3 réside dans son architecture vidéo multimodale unifiée générale, incluant les références texte, image, vidéo et audio, ainsi que la sortie audio-vidéo native — plutôt que d'être le premier modèle vidéo chinois à poids ouverts.

Les poids ouverts facilitent l'adaptation matérielle

Les poids de modèles ouverts sont cruciaux sur les marchés où les organisations souhaitent un plus grand contrôle de leur infrastructure.

Les API hébergées sont plus faciles à démarrer, mais les poids ouverts permettent :

  • Le déploiement sur une infrastructure privée
  • L'optimisation des kernels pour le matériel local
  • La quantification du modèle
  • La construction de runtimes d'inférence dédiés
  • Le fine-tuning ou l'adaptation de composants dans les limites des licences
  • L'intégration avec des accélérateurs nationaux
  • Le maintien des données sensibles dans des environnements contrôlés

La possibilité réelle d'auto-hébergement de H3 dépendra d'informations non encore publiées dans les articles sources, notamment :

  • Le nombre de paramètres
  • Les besoins en mémoire vidéo
  • La précision d'inférence
  • Les exigences de parallélisation
  • La configuration matérielle minimale
  • Les termes de la licence
  • Le support de l'entraînement ou du fine-tuning

Tant que les poids officiels et la documentation technique ne sont pas publiés, toute affirmation concernant la compatibilité avec les GPU grand public ou les coûts d'auto-hébergement reste spéculative.

MiniMax reconnaît que H3 a encore une marge d'amélioration

MiniMax a également indiqué que ce modèle n'est pas le point final de la série H.

La société a identifié les axes suivants :

  • Détails fins des images
  • Taille globale du modèle
  • Extension supplémentaire des capacités

MiniMax a déclaré son intention de continuer à étendre la famille de modèles H et, à terme, d'intégrer les capacités des familles H et M.

La famille H se concentre actuellement sur la génération multimodale, en particulier la vidéo.

La famille M comprend les modèles de langage et d'agent de MiniMax.

Une future fusion pourrait viser un système où une seule famille de modèles peut gérer :

  • Le raisonnement linguistique
  • L'exécution d'agents
  • La compréhension d'images
  • La compréhension vidéo
  • L'audio
  • La création vidéo
  • L'édition

Cela reste une direction prospective, plutôt qu'un produit unifié déjà publié.

Le changement de H3 dans les flux de travail de génération vidéo

La contribution la plus importante de H3 n'est pas simplement une résolution plus élevée.

Le changement majeur réside dans le fait que des opérations de création auparavant distinctes peuvent désormais être réalisées dans un seul contexte.

Les créateurs peuvent passer de :

Générer une vidéo à partir de cette phrase.

à :

Utilisez cette personne, suivez le mouvement de cette vidéo, conservez cette identité visuelle,
prenez les indices rythmiques de cet audio, et créez une nouvelle scène basée sur ce prompt.

Cela change le rôle du modèle vidéo.

Il ne ressemble plus à un générateur à usage unique, mais davantage à un moteur créatif multimodal.

Pour les équipes commerciales, la valeur dépendra de la mesure dans laquelle H3 peut maintenir de manière cohérente la cohérence des références, suivre des instructions complexes, rendre les informations de marque et rester économiquement efficace.

À travers plusieurs générations.

FAQ

Qu'est-ce que MiniMax H3 ?

MiniMax H3 est un modèle de génération vidéo multimodal généraliste développé par MiniMax. Il accepte du texte, des images, des vidéos et de l'audio comme contexte, et prend en charge la génération texte-vers-vidéo, image-vers-vidéo, la génération basée sur des matériaux de référence et la création vidéo contrôlée.

Quelles résolutions MiniMax H3 prend-il en charge ?

La documentation API actuelle de MiniMax répertorie la résolution 2K comme résolution de sortie principale pour H3. Sa page de tarification répertorie également un palier de facturation 768P.

Quelle est la durée maximale des vidéos MiniMax H3 ?

La documentation officielle H3 prend en charge des sorties vidéo allant jusqu'à 15 secondes. La référence API accepte actuellement des valeurs de durée entières comprises entre 4 et 15 secondes.

MiniMax H3 génère-t-il de l’audio ?

Oui. MiniMax décrit H3 comme prenant en charge la sortie vidéo stéréo native avec audio, ce qui signifie que l’audio peut être généré dans le cadre du flux de travail vidéo, sans dépendre systématiquement d’un modèle de post-production séparé.

Combien coûte l’API MiniMax H3 ?

MiniMax facture actuellement H3 à 0,13 $ par seconde pour la génération en résolution 2K et à 0,09 $ par seconde pour la résolution 768P. Selon les règles de facturation publiées, les vidéos de référence et les images supplémentaires peuvent augmenter les coûts liés aux matériaux d’entrée.

H3 peut-il utiliser simultanément des images, des vidéos et de l’audio de référence ?

Oui. L’API officielle prend en charge les images, vidéos et audio de référence dans le même flux de travail de génération par référence, sous réserve des limites concernant le nombre de fichiers, la durée, la taille et les combinaisons d’entrées.

MiniMax H3 est-il open source ?

MiniMax a annoncé son intention de publier les poids du modèle H3 dans les prochains jours, sous réserve des réglementations applicables. Au moment de la rédaction de cet article, l’API officielle est en ligne, mais aucun dépôt public de poids H3 n’a été confirmé dans la documentation officielle consultée.

H3 est-il le premier modèle vidéo chinois à poids ouverts ?

Non, pas au sens historique large. Alibaba a publié les poids du modèle de génération vidéo Wan2.1 en 2025. Ce qui distingue H3, c’est la combinaison de références multimodales et de capacités natives de génération audio-vidéo dans un modèle vidéo universel.

Outils associés

  • API MiniMax H3 : Documentation officielle des flux texte-vers-vidéo, image-vers-vidéo et génération par référence de H3.
  • Plateforme ouverte MiniMax : Plateforme développeur MiniMax proposant clés API, accès aux modèles, facturation et ressources développeur.
  • GitHub MiniMax : Organisation GitHub officielle de l’entreprise pour les projets open source et modèles.
  • Hugging Face MiniMax : Organisation Hugging Face officielle de MiniMax pour les ressources publiques de modèles.
  • Wan2.1 : Série de modèles de génération vidéo open source d’Alibaba, utile comme contexte historique des modèles vidéo à poids ouverts.

Liens associés

Résumé

MiniMax H3 intègre texte, image, vidéo et audio dans un flux unifié de génération vidéo. Il prend en charge des sorties jusqu’à 2K en 15 secondes, l’audio stéréo natif, le contrôle première/dernière image, ainsi que la génération par référence utilisant plusieurs types de médias.

Son argument commercial repose sur deux piliers : le contrôle et le coût. MiniMax indique que H3 excelle dans le respect des instructions, la présentation de marque et le transfert de mouvement, tandis que son API officielle est actuellement tarifée à 0,13 $ par seconde pour la génération 2K et à 0,09 $ par seconde pour la 768P.

MiniMax prévoit également de publier les poids du modèle, bien que la documentation officielle consultée au moment de la publication ne référence pas encore de dépôt de poids H3 confirmé.

Le changement le plus important de H3 n’est pas seulement la vidéo 2K — c’est l’évolution vers un système de génération multimodale unifié capable de comprendre comment le texte, l’image, la vidéo et l’audio doivent fonctionner ensemble.