MiniMax H3 offiziell veröffentlicht: Universelles multimodales Videomodell mit 2K-Ausgabe und nativem Stereoton
MiniMax hat offiziell MiniMax H3 veröffentlicht, ein universelles multimodales Videogenerierungsmodell, das Texte, Bilder, Videos und Audio in einem einheitlichen Generierungsrahmen versteht.

MiniMax H3 Veröffentlichung: Universelles multimodales Videomodell mit 2K-Ausgabe und nativem Stereoton
Einleitung
MiniMax hat offiziell MiniMax H3 vorgestellt – ein universelles multimodales Videogenerierungsmodell, das Text, Bilder, Videos und Audio innerhalb eines einzigen Generierungs-Workflows versteht.
Diese Veröffentlichung markiert einen Schritt weg von der Behandlung von Text-zu-Video, Bild-zu-Video, Referenzvideo-Generierung, Audiosynchronisation und Bearbeitung als voneinander getrennte Aufgaben. Stattdessen ist H3 darauf ausgelegt, gleichzeitig mehrere Arten von Kontext zu empfangen und natürliche Sprachbefehle zu verwenden, um zu beschreiben, wie diese Referenzinhalte miteinander interagieren sollen.
Laut MiniMax unterstützt H3 native Stereoton-Videoausgabe, kann Clips von bis zu 15 Sekunden Länge erzeugen und bietet über die aktuelle API eine 2K-Auflösung an.
Das Unternehmen positioniert das Modell im Bereich der kommerziellen Inhaltserstellung, einschließlich Werbung, Markenbildung, E-Commerce, Produktdesign, UI/UX und Gaming.

Die Veröffentlichung betont außerdem die Generierungskosten. MiniMax gibt an, dass H3 bei Beibehaltung multimodaler Referenz- und Hochauflösungsfunktionen geringere Kosten pro Sekunde aufweist als viele gängige Videogenerierungssysteme.
H3: Von spezialisierten Videoaufgaben zur vereinheitlichten multimodalen Generierung
Frühere Videomodelle waren oft um unabhängige Workflows organisiert.
Ersteller wählten möglicherweise ein Modell oder eine Schnittstelle für Text-zu-Video, ein anderes für Bildanimation und nutzten wiederum andere Abläufe für Referenzvideo-Bearbeitung oder Audiosynchronisation.
H3 versucht, diese Anwendungsfälle in einem gemeinsamen multimodalen Kontext zu vereinen.
Die aktuelle API-Dokumentation von MiniMax beschreibt drei Hauptgenerierungsmodi:
| Generierungsmodus | Eingaben | Typische Verwendung |
|---|---|---|
| Text-zu-Video | Text-Prompt | Generierung neuer Videos basierend auf Textbeschreibungen |
| Bild-zu-Video mit Erst-/Letztbild | Prompt plus Erst- und/oder Letztbild | Bilder animieren oder Anfang und Ende von Videoclips steuern |
| Referenzgenerierung | Prompt plus Bilder, Videos und/oder Audio | Beibehaltung von Subjekt, Bewegung, Kamera-Stil, Ton oder Schnittrhythmus |
Das Modell ist daher nicht darauf beschränkt, einen einzelnen Satz in ein Video zu verwandeln.
Es kann auch Referenzmedien als Teil des Generierungskontexts einbeziehen.
Für die Referenzgenerierung unterstützt die MiniMax-API folgende Kombinationen:
- Bis zu 9 Referenzbilder
- Bis zu 3 Referenzvideos
- Bis zu 3 Referenz-Audiodateien
- Insgesamt bis zu 12 Mediendateien
Referenzvideos können insgesamt bis zu 15 Sekunden lang sein, während Audio mindestens eine Bild- oder Videoreferenz erfordert.
Diese Struktur ermöglicht es Erstellern, Beziehungen zwischen verschiedenen Eingaben zu beschreiben, ohne jede Modalität als separate manuelle Phase behandeln zu müssen.
Natürliche Sprache als Brücke zwischen Modalitäten
AIBase-Quellen beschreiben eines der Kernkonzepte von H3 als Contextual Omni Representation.
Die Idee besteht darin, natürliche Sprache als Verbindung zwischen verschiedenen Medientypen zu verwenden.
Benutzer können gleichzeitig mehrere Referenzmaterialien bereitstellen und mit alltäglicher Sprache beschreiben, welche Beziehungen zwischen ihnen erwartet werden.
Ein Workflow könnte konzeptionell von H3 verlangen:
- Die Kameraführung aus einem Referenzvideo zu übernehmen
- Die in einem Referenzbild erscheinende Person beizubehalten
- Dem Rhythmus oder Klang einer Audio-Referenz zu folgen
- Alle diese Einschränkungen gleichzeitig auf eine neu generierte Szene anzuwenden
Dies unterscheidet sich grundlegend von einfachen Text-zu-Video-Prompts.
Das Modell muss nicht nur verstehen, was jede Medieneingabe enthält, sondern auch, welche Rolle jede Eingabe in der endgültigen Generierung spielen soll.
Die öffentliche API von MiniMax spiegelt dieses Design durch rollenbasierte multimodale Eingaben wider, wie zum Beispiel:
first_frame(Erstbild)last_frame(Letztbild)reference_image(Referenzbild)reference_video(Referenzvideo)reference_audio(Referenzaudio)
Benutzer müssen weiterhin einen Text-Prompt angeben, aber dieser Prompt kann als Instruktionsebene über mehreren Medienquellen fungieren.
H3 unterstützt nativen Stereoton und 2K-Ausgabe für bis zu 15 Sekunden
MiniMax gibt an, dass H3 Videos direkt mit nativem Stereoton generieren kann, ohne dass später ein separater Audio-Generierungsprozess erforderlich ist.
Die aktuellen Entwicklerdokumente listen folgende Informationen auf:
- Modellname:
MiniMax-H3 - Ausgabeauflösung: 2K
- Ausgabedauer: bis zu 15 Sekunden
- Gängige Seitenverhältnisse: unterstützt
- Adaptive Seitenverhältnisse: für geeignete Referenz-Workflows
Die API-Referenz akzeptiert derzeit ganzzahlige Dauern von 4 bis 15 Sekunden, während erweiterte Entwicklerhandbücher einen normalen Ausgabebereich von 5 bis 15 Sekunden beschreiben.
Diese dokumentarische Abweichung ist bei der API-Entwicklung zu beachten: Entwickler sollten den aktuellen Endpunktmustern folgen, die zu ihrem Konto und SDK gehören.
Für reine Textgenerierung muss das Seitenverhältnis explizit angegeben werden.
Die in der aktuellen API-Referenz unterstützten Seitenverhältnisse umfassen:
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
Referenz-Workflows können zusätzlich adaptive Größen verwenden.
Frühe Tests konzentrieren sich auf kommerzielle Inhaltserstellung
MiniMax gibt an, dass frühe Tests in mehreren praktischen Anwendungsbereichen eine starke Leistung gezeigt haben.
Diese Bereiche umfassen:
- Befehlsbefolgung
- Marken- und Textdarstellung
- Video-zu-Video-Bewegungsübertragung
- Multimodale Generierung
- Kontrollierte Bearbeitung
- Kommerzielle Kreativproduktion
Das Unternehmen betont insbesondere folgende Anwendungsszenarien:
- Werbung
- Markenaufbau
- E-Commerce
- Produktdesign
- UI/UX (Benutzeroberfläche/Benutzererfahrung)
- Gaming
Diese Leistungsbeschreibungen stammen von MiniMax selbst sowie aus zugehörigen Veröffentlichungsberichten und nicht aus unabhängigen öffentlichen Benchmark-Tests.
Diese Unterscheidung ist wichtig.
Die Qualität der Videogenerierung lässt sich schwer mit einer einzigen Zahl zusammenfassen. Ein Modell könnte bei der Bewegungsübertragung herausragend sein, aber bei feinen Gesichtsdetails, Typografie, langfristiger Identitätskonsistenz oder komplexen Multi-Objekt-Interaktionen schwächer abschneiden.
Daher ist der zuverlässigste Weg zur Bewertung, ob H3 für die Produktion geeignet ist, es an den tatsächlichen Inhalten zu testen, die ein Team erstellen muss.
H3 nutzt eine neue multimodale Technologiearchitektur
AIBase-Berichte und MiniMax-Veröffentlichungsmaterialien beschreiben mehrere Technologien hinter H3:
- Contextual Omni Representation
- H3-VAE
- H3-Omni Transformer
- In-Context Regeneration
Die öffentliche API-Dokumentation konzentriert sich derzeit eher auf die Nutzung von H3 als auf die Veröffentlichung vollständiger technischer Details.
Forschungspapiere zu diesen Komponenten sind noch nicht öffentlich verfügbar, daher sollten detaillierte Architekturbeschreibungen als Produktangaben von MiniMax betrachtet werden, sofern kein technischer Bericht zusätzliche reproduzierbare Details liefert.
Contextual Omni Representation
Diese Komponente soll Text, Bilder, Videos und Audio gemeinsam in einem geteilten Kontext darstellen.
Ihre Funktion besteht darin, H3 dabei zu helfen, die Beziehung zwischen mehreren Referenzquellen und natürlichen Sprachbefehlen zu verstehen.
H3-VAE
H3-VAE wird als Teil des Video-Repräsentations- und Generierungs-Stacks des Modells beschrieben.
Video-VAEs komprimieren typischerweise hochdimensionale Videoinformationen in besser handhabbare latente Repräsentationen für Generierung und Dekodierung.
Zum Zeitpunkt der Erstellung dieses Texts hatten die geprüften Dokumente von MiniMax noch nicht genügend öffentliche technische Details veröffentlicht, um das genaue Design des H3-VAE unabhängig zu beschreiben.
H3-Omni Transformer
Der H3-Omni Transformer wird als die Modellkomponente positioniert, die für die vereinheitlichte multimodale Generierung verantwortlich ist.
Der Name spiegelt das breitere Ziel des Modells wider: Ein System, das Inferenz über mehrere Medientypen verarbeiten kann, anstatt zwischen verschiedenen unabhängigen Expertenmodellen zu wechseln.
In-Context Regeneration
MiniMax listet außerdem In-Context Regeneration als Teil des H3-Technologie-Stacks auf.
Ihre beabsichtigte Funktion besteht darin, die Generierung mithilfe der bereits im multimodalen Kontext vorhandenen Informationen zu verbessern.
Wie bei anderen Architekturnamen auch, wurden die detaillierten Trainingsabläufe und Ablationsstudien in der öffentlichen API-Dokumentation zum Veröffentlichungszeitpunkt nicht bereitgestellt.
H3-Preise basierend auf Videolänge
Der AIBase-Artikel hob das Preis-Leistungs-Verhältnis von H3 hervor.
Die aktuellen nutzungsbasierten Preise von MiniMax bieten klarere Zahlenwerte als Referenz.
| Auflösung | Offizieller API-Listenpreis |
|---|---|
| 2K | 0,13 USD pro generierter Sekunde |
| 768P | 0,09 USD pro generierter Sekunde |
Referenzmaterialien unterliegen separaten Abrechnungsregeln.
MiniMax listet derzeit auf:
- Audio-Referenz: kostenlos
- Die ersten 5 Bildreferenzen: kostenlos
- Zusätzliche Bildreferenzen: 0,04 USD pro Bild
- Video-Referenz: Abrechnung basierend auf der Länge des Eingangsvideos und der Zielausgabeauflösung
MiniMax gibt an, dass H3 pro Sekunde bei 2K-Auflösung weniger als ein Drittel der Kosten führender Konkurrenzmodelle verursacht und bei 768P-Auflösung weniger als die Hälfte des Preises gängiger 720P-Alternativen.
Diese Relativvergleiche sind Herstellerangaben, da die Ergebnisse stark von den einbezogenen Konkurrenzmodellen, Paketen, Auflösungen und Abrechnungsmethoden abhängen.
Bei der Budgetplanung sollten Entwickler zunächst von den veröffentlichten H3-API-Tarifen ausgehen und diese dann präzise mit den tatsächlich verwendeten Alternativen vergleichen.
Warum Kosten pro Sekunde für KI-Videos wichtig sind
Die Videogenerierungskosten steigen linear mit der Ausgabelänge, sodass Kosten schnell hoch werden können.
Dies verändert die Wirtschaftlichkeit iterativer Versuche.
Ersteller erzeugen selten beim ersten Versuch perfekte Clips.
Ein vollständiger Produktionsablauf kann Folgendes umfassen:
- Mehrere Prompt-Experimente
- Mehrere Versuche zur Charakterkonsistenz
- Kamerabewegungsvariationen
- Unterschiedliche Seitenverhältnisse
- Marken- oder Produktkorrekturen
- Finale High-Resolution-Generierung
Selbst eine kleine Senkung der Kosten pro generierter Sekunde summiert sich zu erheblichen Einsparungen, wenn Teams dutzende oder hunderte Alternativversionen erstellen.
Dies ist besonders in folgenden Szenarien wichtig—
In Werbung und E-Commerce kann eine Marketingkampagne erfordern:
- Mehrere Produkte
- Mehrere Märkte
- Verschiedene Sprachen
- Horizontale und vertikale Formate
- Mehrere kreative Varianten
Daher betrifft die Preispositionierung von H3 nicht nur die Kosten eines einzelnen Endvideos, sondern zielt auf die Iterationsökonomie ab.
Referenzgenerierung ist eine der wichtigsten Fähigkeiten von H3
Die aktuelle MiniMax-API unterstützt Referenzgenerierung mit einer Mischung aus Bildern, Videos und Audios.
Dies unterstützt Workflows wie:
- Konsistenz von Produkten oder Charakteren aus Bildern wahren
- Bewegung aus Referenzvideos folgen
- Kameraführung aus anderen Videoclips übernehmen
- Referenz-Audiospuren für Timing-Kontrolle oder Vertonung verwenden
- Kombination mehrerer Referenzmedien in einer einzigen Anfrage
MiniMax gibt an, dass H3 Merkmale des Referenzsubjekts oder -materials über die gesamte generierte Ausgabe hinweg beibehalten kann.
Dies ist besonders wichtig für kommerzielle Arbeiten.
Allgemeine Text-Prompts können visuell ansprechende Videoclips erzeugen, können jedoch Folgendes verändern:
- Logos
- Produktproportionen
- Kleidung
- Charakteridentität
- Verpackung
- Markenfarben
Referenzgesteuerte Workflows bieten mehr Kontrolle über diese Variablen.
Dies garantiert jedoch keine perfekte Identitätswahrung, daher sollten Teams jedes generierte Material vor der Veröffentlichung weiterhin prüfen.
Steuerung von Erst- und Endframe ergänzt einen weiteren Produktionsworkflow
H3 unterstützt außerdem die Verwendung des ersten Frames, des letzten Frames oder beider.
Dies ist nützlich, wenn Ersteller bereits wissen, wie eine Aufnahme beginnen oder enden soll.
Typische Anwendungen umfassen:
- Produkt-Standbilder animieren
- Übergänge zwischen zwei Bildern erstellen
- Den Anfang einer Aufnahme an das Ende einer anderen anpassen
- Den Endzustand einer Transformation steuern
- Vorhersehbarere Schnittsequenzen aufbauen
Die MiniMax-API behandelt Erst-/Letztframe-Generierung und Referenzgenerierung als zwei separate Modi.
Eine Anfrage kann in derselben Aufgabe nicht die Rollen first_frame oder last_frame mit reference_image, reference_video oder reference_audio mischen.
Diese Einschränkung ist für Entwickler, die diese API integrieren, sehr wichtig.
MiniMax plant die Veröffentlichung der H3-Modellgewichte
Einer der auffälligsten Teile der Ankündigung ist der Plan von MiniMax, die H3-Modellgewichte öffentlich zu veröffentlichen.
Das Unternehmen gab an, dass die Gewichte voraussichtlich in den nächsten Tagen unter Beachtung geltender Gesetze und Vorschriften veröffentlicht werden.
MiniMax glaubt, dass die Veröffentlichung der Gewichte hilft:
- Das Ökosystem offener Modelle zu erweitern
- Angepasste Versionen zu unterstützen
- Die Anpassung an verschiedene Hardware zu beschleunigen
- Die Abhängigkeit von einem einzigen gehosteten Dienst zu verringern
- Forschung und Bereitstellungsexperimente zu fördern
Das Unternehmen erklärte außerdem, dass Hardware-Kompatibilität, einschließlich einer breiteren KI-Hardware-Kompatibilität, von Anfang an in das Design von H3 einbezogen wurde.
Zum Zeitpunkt der Erstellung dieses Artikels sind die offiziellen GitHub- und Hugging-Face-Organisationsseiten von MiniMax öffentlich zugänglich, aber in der hier überprüften offiziellen H3-API-Dokumentation wurde kein bestätigtes öffentliches H3-Gewichts-Repository verlinkt.
Dies bedeutet, dass Entwickler auf offizielle Veröffentlichungslinks von MiniMax warten sollten, anstatt Gewichte aus nicht autorisierten Spiegeln herunterzuladen.
Korrektur zur Behauptung des „ersten chinesischen Videomodells mit offenen Gewichten“
AIBase
Dieser Artikel behauptete, dass H3s Veröffentlichungsplan das erste Mal sei, dass ein chinesisches Videogenerierungs-Basismodell seine Gewichte der Community öffne.
Im weiteren Sinne ist diese Behauptung historisch nicht korrekt.
Alibaba veröffentlichte im Februar 2025 die Gewichte und Inferenzcodes seines Wan2.1-Videogenerierungsmodells, und nachfolgende Wan2.1-Varianten wurden ebenfalls öffentlich freigegeben.
Das haltbarere Unterscheidungsmerkmal von H3 liegt in seiner universellen vereinheitlichten multimodalen Videoarchitektur, einschließlich Text-, Bild-, Video- und Audio-Referenzen sowie nativer Audio-Video-Ausgabe – nicht darin, das erste chinesische Videomodell mit offenen Gewichten zu sein.
Offene Gewichte erleichtern Hardware-Anpassung
Offene Modellgewichte sind in Märkten entscheidend, in denen Organisationen mehr Kontrolle über ihre Infrastruktur wünschen.
Gehostete APIs sind einfacher zu starten, aber offene Gewichte ermöglichen:
- Bereitstellung auf privater Infrastruktur
- Optimierte Kernel für lokale Hardware
- Quantisierung des Modells
- Aufbau spezieller Inferenz-Laufzeiten
- Feintuning oder Anpassung von Komponenten im Rahmen der Lizenz
- Integration mit einheimischen Beschleunigern
- Sensible Daten in kontrollierten Umgebungen zu halten
Ob H3 tatsächlich selbst gehostet werden kann, hängt von Informationen ab, die im Quellartikel noch nicht öffentlich sind, einschließlich:
- Parameteranzahl
- Grafikspeicherbedarf
- Inferenzgenauigkeit
- Parallelisierungsanforderungen
- Minimale Hardwarekonfiguration
- Lizenzbedingungen
- Trainings- oder Feintuning-Unterstützung
Bis zur offiziellen Veröffentlichung von Gewichten und technischer Dokumentation sind Behauptungen über Kompatibilität mit Verbraucher-GPUs oder Kosten des Selbsthostings reine Spekulation.
MiniMax räumt ein, dass H3 noch Verbesserungspotenzial hat
MiniMax gab außerdem an, dass das Modell nicht das Ende der H-Serie darstellt.
Das Unternehmen wies auf folgende Richtungen hin:
- Feinere Bilddetails
- Gesamtmodellumfang
- Weitere Fähigkeitserweiterungen
MiniMax erklärte, die Erweiterung der H-Serie-Modelle fortzusetzen und schließlich die Fähigkeiten der H- und M-Modellfamilien zu integrieren.
Die H-Familie konzentriert sich derzeit auf multimodale Generierung, insbesondere Video.
Die M-Familie umfasst die Sprach- und Agentenmodelle von MiniMax.
Eine zukünftige Fusion könnte auf ein System hindeuten, in dem eine einzige Modellfamilie Folgendes abdeckt:
- Sprachlogik
- Agentenausführung
- Bildverständnis
- Videoverständnis
- Audio
- Videocreation
- Bearbeitung
Dies bleibt eine zukunftsorientierte Richtung, kein bereits veröffentlichtes einheitliches Produkt.
Wie H3 Video-Generierungs-Workflows verändert
Der wichtigste Beitrag von H3 ist nicht nur die höhere Auflösung.
Der größere Wandel besteht darin, dass zuvor getrennte kreative Operationen nun in einem einzigen Kontext durchgeführt werden können.
Ersteller können von:
Generiere ein Video basierend auf diesem Satz.
zu Folgendem übergehen:
Verwende diese Person, folge den Bewegungen in diesem Video, behalte diese visuelle Identität bei,
übernehme Timing-Hinweise aus dieser Audiodatei und erstelle eine neue Szene nach diesem Prompt.
Dies verändert die Rolle des Videomodells.
Es agiert weniger wie ein Einzweckgenerator, sondern eher wie eine multimodale kreative Engine.
Für kommerzielle Teams hängt der Wert davon ab, inwieweit H3 Referenzkonsistenz beibehalten, komplexe Anweisungen befolgen, Markenbotschaften rendern und wirtschaftlich effizient bleiben kann.
Über Generationen hinweg weitergegeben.
Häufig gestellte Fragen
Was ist MiniMax H3?
MiniMax H3 ist ein universelles multimodales Videogenerierungsmodell von MiniMax. Es akzeptiert Text, Bilder, Videos und Audio als Kontext und unterstützt Text-zu-Video, Bild-zu-Video, Generierung basierend auf Referenzmaterial sowie kontrollierte Videoerstellung.
Welche Auflösungen unterstützt MiniMax H3?
Die aktuelle MiniMax-API-Dokumentation listet 2K als primäre Ausgabeauflösung von H3 auf. Die Preisseite listet außerdem einen Abrechnungstarif für 768P auf.
Wie lang können MiniMax H3-Videos maximal sein?
Die offizielle H3-Dokumentation unterstützt Videoausgaben von bis zu 15 Sekunden. Die API-Referenz akzeptiert aktuell ganzzahlige Dauerwerte zwischen 4 und 15 Sekunden.
Erzeugt MiniMax H3 Audio?
Ja. MiniMax beschreibt H3 als Unterstützung für native stereoskopische Audio- und Videoausgabe, sodass Audio als Teil des Video-Workflows generiert werden kann, ohne dass man sich immer auf separate Postproduktionsmodelle verlassen muss.
Wie hoch sind die Kosten für die MiniMax H3 API?
MiniMax hat H3 derzeit mit 0,13 $ pro Sekunde für die 2K-Auflösung und 0,09 $ pro Sekunde für die 768P-Auflösung bepreist. Gemäß den veröffentlichten Abrechnungsregeln können Referenzvideos und zusätzliche Bilder Eingabematerialkosten verursachen.
Kann H3 gleichzeitig Referenzbilder, Videos und Audio verwenden?
Ja. Die offizielle API unterstützt Referenzbilder, Videos und Audio im selben Referenzgenerierungs-Workflow, vorbehaltlich der Einschränkungen bei Dateianzahl, Dauer, Größe und Eingabekombinationen.
Ist MiniMax H3 Open Source?
MiniMax hat angekündigt, in den kommenden Tagen die Gewichte des H3-Modells zu veröffentlichen, vorbehaltlich geltender Vorschriften. Zum Zeitpunkt der Erstellung dieses Artikels ist die offizielle API live, aber in den bei dieser Recherche geprüften offiziellen Dokumenten wurde noch kein Link zu einem öffentlichen H3-Gewichts-Repository bestätigt.
Ist H3 das erste chinesische Video-Sprachmodell mit offenen Gewichten?
Nein, im weiteren historischen Sinne nicht. Alibaba hat im Jahr 2025 die Gewichte des Video-Generierungsmodells Wan2.1 veröffentlicht. H3 ist bemerkenswerter, weil es multimodale Referenzen und native Audio-Video-Generierungsfähigkeiten in einem universellen Videomodell kombiniert.
Verwandte Tools
- MiniMax H3 API: Offizielle Dokumentation für H3 Text-zu-Video, Bild-zu-Video und Referenzgenerierungs-Workflows.
- MiniMax Open Platform: MiniMax-Entwicklerplattform mit API-Schlüsseln, Modellzugriff, Abrechnung und Entwicklerressourcen.
- MiniMax GitHub: Die offizielle GitHub-Organisation des Unternehmens für veröffentlichten Code und modellbezogene Projekte.
- MiniMax Hugging Face: Die offizielle Hugging-Face-Organisation von MiniMax für öffentliche Modellressourcen.
- Wan2.1: Die Open-Source-Video-Generierungsmodellreihe von Alibaba, die als historischer Hintergrund für Video-Sprachmodelle mit offenen Gewichten dient.
Verwandte Links
- MiniMax Offizielle Website: Offizielle MiniMax-Website, die H3 derzeit als ihr neues Video-Generierungsmodell auflistet.
- MiniMax H3 Video-Generierungsleitfaden: Offizielle Dokumentation zu Modellspezifikationen, unterstützten Modi, Eingabebeschränkungen und Workflows.
- MiniMax H3 API-Referenz: Offizielle V2-Endpunkt-Spezifikation zum Erstellen von H3-Videogenerierungsaufgaben.
- MiniMax API-Preise: Aktuelle offizielle Pay-as-you-go-Preise für H3 und dessen Referenzmedien-Abrechnungsregeln.
- MiniMax Offizielles GitHub: Offizielle Organisation zur Verfolgung veröffentlichten Codes und von Modellressourcen.
- Alibaba: Wan 2.1 Open-Source-Videomodell: Offizielle historische Bestätigung, dass chinesische Video-Sprachmodelle mit offenen Gewichten vor H3 verfügbar waren.
- Wan 2.1 GitHub-Repository: Öffentlicher Inferenzcode und Gewichte der früheren Open-Source-Videogenerierungsfamilie von Alibaba.
Zusammenfassung
MiniMax H3 integriert Text, Bilder, Videos und Audio in einen universellen Videogenerierungs-Workflow. Es unterstützt bis zu 15 Sekunden 2K-Ausgabe, natives Stereoaudio, Start-/Endbild-Steuerung und Referenzgenerierung mit mehreren Medientypen.
Seine kommerziellen Verkaufsargumente konzentrieren sich auf zwei Bereiche: Kontrolle und Kosten. MiniMax gibt an, dass H3 bei der Befehlsbefolgung, der Markendarstellung und der Bewegungsübertragung gut abschneidet, während seine offizielle API 2K-Generierung derzeit mit 0,13 $ pro Sekunde und 768P mit 0,09 $ pro Sekunde bepreist.
MiniMax plant außerdem die Veröffentlichung der Modellgewichte, allerdings wurde zum Zeitpunkt der Veröffentlichung in den geprüften offiziellen Dokumenten noch kein Link zu einem bestätigten H3-Gewichts-Repository bereitgestellt.
Der wichtigste Wandel bei H3 ist nicht nur 2K-Video – sondern der Schritt hin zu einem einheitlichen multimodalen Generierungssystem, das versteht, wie Text, Bilder, Videos und Audio zusammenarbeiten sollten.