MiniMax H3 ufficialmente rilasciato: modello video multimodale universale con output 2K e audio stereo nativo

MiniMax ha ufficialmente rilasciato MiniMax H3, un modello universale di generazione video multimodale in grado di comprendere testo, immagini, video e audio all'interno di un framework generativo unificato.

发布于 2026年7月31日generalGEO 评分: 03 次阅读
MiniMax H3 ufficialmente rilasciato: modello video multimodale universale con output 2K e audio stereo nativo

Rilascio di MiniMax H3: modello video multimodale generale con output 2K e audio stereo nativo

Introduzione

MiniMax ha ufficialmente rilasciato MiniMax H3, un modello multimodale generale di generazione video in grado di comprendere testo, immagini, video e audio all'interno dello stesso flusso di lavoro generativo.

Questo rilascio segna un cambiamento rispetto alla concezione che considerava la generazione testo-video, immagine-video, generazione con video di riferimento, sincronizzazione audio e editing come compiti separati e indipendenti. Al contrario, H3 è progettato per ricevere simultaneamente molteplici tipi di contesto e utilizzare istruzioni in linguaggio naturale per descrivere come questi contenuti di riferimento dovrebbero interagire tra loro.

Secondo MiniMax, H3 supporta output video con audio stereo nativo, può generare clip fino a 15 secondi e offre output a risoluzione 2K tramite l'attuale API.

L'azienda posiziona il modello nel campo della creazione di contenuti commerciali, inclusi pubblicità, branding, e-commerce, design di prodotto, UI/UX e gaming.

Immagine che mostra una giovane donna seduta fuori da un bar, con capelli neri e ricci, carnagione scura, maglietta bianca e grembiule blu, braccialetti colorati al polso, mentre tiene in mano una tazza di caffè. Sullo sfondo si vede un bar con l'insegna "CAFE", e altri clienti all'interno o all'esterno del locale. Questa immagine è correlata alla presentazione del modello MiniMax H3 nel documento e potrebbe essere utilizzata per mostrare i suoi scenari applicativi nella creazione di contenuti commerciali, come pubblicità e branding.

Questo rilascio pone inoltre un forte accento sui costi di generazione. MiniMax afferma che H3, pur mantenendo capacità di riferimento multimodale e output ad alta risoluzione, ha un costo al secondo di generazione inferiore rispetto a molti sistemi di generazione video mainstream.

H3: dai compiti video dedicati alla generazione multimodale unificata

I primi modelli video erano spesso organizzati attorno a flussi di lavoro indipendenti.

I creatori potevano scegliere un modello o un'interfaccia per la generazione testo-video, un'altra per l'animazione di immagini, e ancora processi diversi per l'editing di video di riferimento o la sincronizzazione audio.

H3 cerca di unificare questi casi d'uso in un contesto multimodale condiviso.

La documentazione API attuale di MiniMax descrive tre principali modalità di generazione:

Modalità di generazione Input Utilizzo tipico
Testo-video Prompt testuale Generare nuovi video da descrizioni testuali
Immagine primo/ultimo frame Prompt più primo e/o ultimo frame Animare immagini o controllare inizio e fine di clip video
Generazione con riferimento Prompt più immagini, video e/o audio Preservare soggetti, movimenti, stile della ripresa, voci o ritmo di montaggio

Pertanto, il modello non si limita a trasformare una frase in un video.

Può anche incorporare media di riferimento come parte del contesto di generazione.

Per la generazione con riferimento, l'API di MiniMax supporta le seguenti combinazioni:

  • Fino a 9 immagini di riferimento
  • Fino a 3 video di riferimento
  • Fino a 3 tracce audio di riferimento
  • Fino a 12 file multimediali in totale

I video di riferimento possono avere una durata complessiva fino a 15 secondi, mentre l'audio deve essere accompagnato da almeno un riferimento immagine o video.

Questa struttura consente ai creatori di descrivere le relazioni tra diversi input senza dover gestire manualmente ogni modalità come fase separata.

Il linguaggio naturale come ponte tra le modalità

Le fonti di AIBase descrivono uno dei concetti fondamentali di H3 come Rappresentazione Omni Contestuale (Contextual Omni Representation).

L'idea è utilizzare il linguaggio naturale come collante per collegare

diversi tipi di media.

Gli utenti possono fornire simultaneamente più materiali di riferimento e descrivere con linguaggio quotidiano le relazioni previste tra di essi.

Ad esempio, un flusso di lavoro potrebbe concettualmente richiedere a H3 di:

  • Riprendere il movimento della telecamera da un video di riferimento
  • Mantenere il soggetto presente in un'immagine di riferimento
  • Seguire il ritmo o il suono di una traccia audio di riferimento
  • Applicare tutti questi vincoli contemporaneamente a una scena completamente nuova

Questo è sostanzialmente diverso da un semplice prompt testo-video.

Il modello deve comprendere non solo cosa contiene ciascun input multimediale, ma anche quale ruolo ogni input dovrebbe svolgere nella generazione finale.

L'API pubblica di MiniMax riflette questa progettazione attraverso input multimodali basati su ruoli, come ad esempio:

  • first_frame (primo frame)
  • last_frame (ultimo frame)
  • reference_image (immagine di riferimento)
  • reference_video (video di riferimento)
  • reference_audio (audio di riferimento)

Gli utenti devono comunque fornire un prompt testuale, ma in questo caso il prompt può fungere da strato di istruzioni sopra molteplici sorgenti multimediali.

H3 supporta audio stereo nativo e output 2K fino a 15 secondi

MiniMax afferma che H3 può generare direttamente video con audio stereo nativo, senza necessità di un flusso di generazione audio separato successivo.

La documentazione per sviluppatori attualmente elenca:

  • Nome del modello: MiniMax-H3
  • Risoluzione output: 2K
  • Durata output: fino a 15 secondi
  • Rapporti d'aspetto comuni: supportati
  • Rapporto d'aspetto adattivo: disponibile per flussi di lavoro con riferimento appropriati

Il riferimento API accetta attualmente durate intere da 4 a 15 secondi, mentre le guide avanzate per sviluppatori indicano un intervallo normale di output da 5 a 15 secondi.

Questa piccola discrepanza documentale è degna di nota quando si sviluppa tramite API: gli sviluppatori dovrebbero seguire lo schema dell'endpoint corrente corrispondente al proprio account e SDK.

Per la generazione puramente testuale, il rapporto d'aspetto deve essere specificato esplicitamente.

I rapporti d'aspetto supportati nel riferimento API attuale includono:

  • 21:9
  • 16:9
  • 4:3
  • 1:1
  • 3:4
  • 9:16

I flussi di lavoro con riferimento possono inoltre utilizzare dimensioni adattive.

Test iniziali focalizzati sulla creazione di contenuti commerciali

MiniMax afferma che i test iniziali mostrano prestazioni solide in diversi ambiti applicativi reali.

Questi includono:

  • Seguimento delle istruzioni
  • Presentazione di marchi e testo
  • Trasferimento del movimento video-to-video
  • Generazione multimodale
  • Editing controllato
  • Produzione creativa commerciale

L'azienda evidenzia in particolare i seguenti scenari applicativi:

  • Pubblicità
  • Branding
  • E-commerce
  • Design di prodotto
  • UI/UX (interfaccia utente/esperienza utente)
  • Gaming

Queste descrizioni delle prestazioni provengono da MiniMax stessa e dai relativi comunicati di lancio, non da benchmark pubblici indipendenti.

Questa distinzione è importante.

La qualità della generazione video è difficile da riassumere con un singolo punteggio. Un modello potrebbe eccellere nel trasferimento del movimento ma essere relativamente debole nei dettagli fini del viso, nella tipografia, nella coerenza dell'identità a lungo termine o nelle interazioni complesse tra più oggetti.

Pertanto, il modo più affidabile per valutare se H3 è adatto alla produzione è testarlo sui contenuti che il team deve effettivamente creare.

H3 adotta una nuova architettura tecnica multimodale

I report di AIBase e i materiali di lancio di MiniMax descrivono diverse tecnologie alla base di H3:

  • Rappresentazione Omni Contestuale (Contextual Omni Representation)
  • H3-VAE
  • H3-Omni Transformer
  • Rigenerazione nel contesto (In-Context Regeneration)

La documentazione API pubblica si concentra attualmente più su come utilizzare H3 che sul rilascio di dettagli tecnici completi.

I paper di ricerca relativi a questi componenti non sono ancora stati pubblicati, pertanto le descrizioni architetturali dettagliate dovrebbero essere considerate come dichiarazioni di prodotto di MiniMax, a meno che un report tecnico non fornisca ulteriori dettagli riproducibili.

Rappresentazione Omni Contestuale

Questo componente è progettato per rappresentare congiuntamente testo, immagini, video e audio in un contesto condiviso.

La sua funzione è aiutare H3 a comprendere le correlazioni tra molteplici fonti di riferimento e le istruzioni in linguaggio naturale.

H3-VAE

H3-VAE è descritto come parte dello stack di rappresentazione e generazione video del modello.

Un VAE video tipicamente comprime le informazioni video ad alta dimensionalità in rappresentazioni latenti più gestibili, utilizzate per la generazione e la decodifica.

Al momento della stesura di questa analisi, MiniMax non ha ancora rilasciato sufficienti dettagli tecnici pubblici per descrivere in modo indipendente il design esatto di H3-VAE.

H3-Omni Transformer

H3-Omni Transformer è posizionato come il componente del modello responsabile della generazione multimodale unificata.

Il nome riflette l'obiettivo più ampio del modello: un unico sistema in grado di gestire il ragionamento su molteplici tipi di media, anziché passare da un esperto modello indipendente all'altro.

Rigenerazione nel contesto

MiniMax elenca inoltre la rigenerazione nel contesto come parte dello stack tecnologico di H3.

La sua funzione prevista è quella di utilizzare le informazioni già presenti nel contesto multimodale per migliorare i risultati di generazione.

Come per altri nomi di architetture, il flusso di addestramento dettagliato e i risultati degli esperimenti di ablazione non sono stati forniti nella documentazione API pubblica al momento del rilascio.

I prezzi H3 si basano sulla durata del video

L'articolo di AIBase ha evidenziato il rapporto qualità-prezzo di H3.

I prezzi attuali a consumo ufficiali di MiniMax forniscono un riferimento numerico più chiaro.

Risoluzione Prezzo ufficiale API
2K $0,13 al secondo
768P $0,09 al secondo

I materiali di riferimento inseriti hanno regole di fatturazione separate.

MiniMax elenca attualmente:

  • Riferimento audio: gratuito
  • Prime 5 immagini di riferimento: gratuite
  • Immagini di riferimento aggiuntive: $0,04 ciascuna
  • Video di riferimento: fatturato in base alla durata del video di input e alla risoluzione di output desiderata

MiniMax afferma che, calcolato al secondo, il costo di H3 a risoluzione 2K è inferiore a un terzo di quello dei modelli concorrenti mainstream, e a 768P è inferiore alla metà del prezzo delle alternative 720P mainstream.

Queste affermazioni relative sono dichiarazioni del produttore, poiché i risultati dipendono in larga misura dai modelli concorrenti inclusi, dai piani tariffari, dalle risoluzioni e dalle modalità di fatturazione.

Nella pianificazione del budget, gli sviluppatori dovrebbero prima fare riferimento alle tariffe API pubblicate di H3 e poi confrontarle con precisione con le alternative effettivamente utilizzate.

Perché il costo al secondo è importante per i video AI

Il costo della generazione video cresce linearmente con la durata dell'output, quindi le spese possono diventare rapidamente elevate.

Ciò cambia l'economia della sperimentazione iterativa.

I creatori raramente generano un clip perfetto al primo tentativo.

Un flusso di produzione completo può comportare:

  1. Molteplici esperimenti con i prompt
  2. Molteplici tentativi di coerenza del personaggio
  3. Variazioni di movimento della telecamera
  4. Diversi rapporti d'aspetto
  5. Correzioni di marchio o prodotto
  6. Generazione finale ad alta risoluzione

Anche una piccola riduzione del costo al secondo può portare a risparmi notevoli quando i team creano decine o centinaia di versioni alternative.

Ciò è particolarmente importante negli scenari seguenti:

Nella pubblicità e nell'e-commerce, una campagna di marketing può richiedere:

  • Molteplici prodotti
  • Molteplici mercati
  • Diverse lingue
  • Formati orizzontali e verticali
  • Molteplici varianti creative

Pertanto, il posizionamento dei prezzi di H3 non considera solo il costo dell'output finale singolo, ma si concentra sull'economia dell'iterazione.

La generazione con riferimento è una delle capacità più importanti di H3

L'attuale API MiniMax supporta la generazione con riferimenti misti utilizzando immagini, video e audio.

Ciò supporta flussi di lavoro come:

  • Mantenere la coerenza del prodotto o del personaggio a partire da un'immagine
  • Seguire il movimento di un video di riferimento
  • Riprendere il comportamento della telecamera da un altro clip video
  • Usare una traccia audio di riferimento per il controllo temporale o la sincronizzazione
  • Combinare più forme di materiale di riferimento in una singola richiesta

MiniMax afferma che H3 può preservare le caratteristiche del soggetto o del materiale di riferimento in tutto l'output generato.

Ciò è particolarmente importante per il lavoro commerciale.

I normali prompt testuali possono generare clip video visivamente accattivanti ma che potrebbero comunque alterare:

  • Loghi
  • Proporzioni del prodotto
  • Abbigliamento
  • Identità del personaggio
  • Confezionamento
  • Colori del marchio

I flussi di lavoro guidati da riferimenti offrono maggiore controllo su queste variabili.

Ma ciò non garantisce una perfetta preservazione dell'identità, quindi i team dovrebbero comunque rivedere ogni materiale generato prima della pubblicazione.

Il controllo del primo e ultimo fotogramma aggiunge un altro flusso di produzione

H3 supporta anche l'uso del primo fotogramma, dell'ultimo fotogramma o di entrambi.

Ciò è utile quando i creatori sanno già come il clip dovrebbe iniziare o finire.

Gli usi tipici includono:

  • Animare un'immagine fissa di un prodotto
  • Creare transizioni tra due immagini
  • Abbinare l'inizio di un clip alla fine di un altro
  • Controllare lo stato finale di una trasformazione
  • Costruire sequenze di montaggio più prevedibili

L'API di MiniMax tratta la generazione con primo/ultimo fotogramma e la generazione con riferimenti come due modalità separate.

Una richiesta non può mescolare i ruoli first_frame o last_frame con reference_image, reference_video o reference_audio nello stesso task.

Questa limitazione è molto importante per gli sviluppatori che integrano questa API.

MiniMax prevede di pubblicare i pesi del modello H3

Una delle parti più interessanti dell'annuncio è che MiniMax prevede di rendere pubblici i pesi del modello H3.

L'azienda afferma che i pesi saranno pubblicati nei prossimi giorni, nel rispetto delle leggi e dei regolamenti applicabili.

MiniMax ritiene che la pubblicazione dei pesi aiuti a:

  • Espandere l'ecosistema dei modelli aperti
  • Supportare versioni personalizzate
  • Accelerare l'adattamento a hardware diverso
  • Ridurre la dipendenza da un unico servizio gestito
  • Incoraggiare la sperimentazione nella ricerca e nella distribuzione

L'azienda ha inoltre dichiarato che H3 è stato progettato fin dall'inizio tenendo conto della compatibilità hardware, inclusa una più ampia compatibilità con hardware AI.

Al momento della stesura di questo articolo, le pagine ufficiali GitHub e Hugging Face di MiniMax sono accessibili pubblicamente, ma non è stato ancora confermato alcun repository pubblico dei pesi H3 nei documenti API ufficiali H3 qui esaminati.

Ciò significa che gli sviluppatori dovrebbero attendere i link ufficiali di pubblicazione di MiniMax, anziché scaricare pesi da mirror non autorizzati.

Correzione dell'affermazione sul "primo modello video cinese con pesi aperti"

AIBase

L'articolo afferma che il piano di pubblicazione di H3 rappresenta la prima volta che un modello di base di generazione video cinese apre i propri pesi alla community.

In senso lato, questa affermazione non è storicamente accurata.

Alibaba ha pubblicato i pesi e il codice di inferenza del suo modello di generazione video Wan2.1 nel febbraio 2025, e le successive varianti Wan2.1 sono state anche rilasciate pubblicamente.

Il punto di differenziazione più solido di H3 risiede nella sua architettura video multimodale unificata generale, inclusi riferimenti a testo, immagini, video e audio, oltre all'output nativo audiovisivo, piuttosto che essere il primo modello video cinese con pesi aperti.

I pesi aperti favoriscono l'adattamento hardware

I pesi dei modelli aperti sono fondamentali nei mercati in cui le organizzazioni desiderano un maggiore controllo sull'infrastruttura.

Le API gestite sono più facili da adottare, ma i pesi aperti consentono:

  • Distribuzione su infrastrutture private
  • Ottimizzazione dei kernel per hardware locale
  • Quantizzazione del modello
  • Creazione di runtime di inferenza dedicati
  • Fine-tuning o adattamento dei componenti laddove la licenza lo consente
  • Integrazione con acceleratori nazionali
  • Mantenere i dati sensibili in ambienti controllati

Se H3 possa essere realmente auto-ospitato dipenderà da informazioni non ancora rese pubbliche nell'articolo originale, tra cui:

  • Numero di parametri
  • Requisiti di memoria VRAM
  • Precisione di inferenza
  • Requisiti di parallelizzazione
  • Configurazione hardware minima
  • Termini di licenza
  • Supporto per l'addestramento o il fine-tuning

Fino alla pubblicazione dei pesi ufficiali e della documentazione tecnica, qualsiasi dichiarazione su compatibilità con GPU consumer o costi di auto-hosting è puramente speculativa.

MiniMax riconosce che H3 ha ancora margini di miglioramento

MiniMax ha inoltre dichiarato che il modello non rappresenta il punto finale della serie H.

L'azienda ha indicato le seguenti direzioni:

  • Dettagli raffinati delle immagini
  • Scala complessiva del modello
  • Ulteriore espansione delle capacità

MiniMax ha dichiarato che intende continuare ad espandere i modelli della serie H e, infine, integrare le capacità delle famiglie di modelli H e M.

La famiglia H si concentra attualmente sulla generazione multimodale, in particolare video.

La famiglia M include i modelli linguistici e agente di MiniMax.

Una futura fusione potrebbe puntare a un sistema in cui una singola famiglia di modelli gestisca:

  • Ragionamento linguistico
  • Esecuzione agente
  • Comprensione delle immagini
  • Comprensione video
  • Audio
  • Creazione video
  • Modifica

Questa è ancora una direzione proiettata nel futuro, non un prodotto unificato già rilasciato.

Ciò che H3 cambia nei flussi di lavoro di generazione video

Il contributo più importante di H3 non è solo la risoluzione più alta.

La trasformazione più grande è che diverse operazioni creative, prima indipendenti, ora possono essere eseguite in un unico contesto.

I creatori possono passare da:

Genera un video basato su questa frase.

a:

Usa questa persona, segui il movimento di questo video, mantieni questa identità visiva,
prendi spunto dal ritmo di questo audio e crea una nuova scena basata su questo prompt.

Questo cambia il ruolo del modello video.

Non è più un generatore monouso, ma un motore creativo multimodale.

Per i team commerciali, il valore dipenderà da quanto H3 riuscirà a mantenere coerenza con i riferimenti, seguire istruzioni complesse, renderizzare i messaggi del marchio e rimanere economicamente efficiente.

Tramandata attraverso generazioni.

Domande frequenti

Cos'è MiniMax H3?

MiniMax H3 è un modello di generazione video multimodale generale sviluppato da MiniMax. Accetta testo, immagini, video e audio come contesto e supporta text-to-video, image-to-video, generazione basata su materiali di riferimento e creazione video controllata.

Quali risoluzioni supporta MiniMax H3?

L'attuale documentazione API di MiniMax elenca 2K come risoluzione di output principale per H3. La pagina dei prezzi elenca anche il livello di fatturazione 768P.

Qual è la durata massima dei video MiniMax H3?

La documentazione ufficiale H3 supporta output video fino a 15 secondi. Il riferimento API accetta attualmente valori interi di durata compresi tra 4 e 15 secondi.

MiniMax H3 genera audio?

Sì. MiniMax descrive H3 come un modello che supporta l'uscita audio-video stereo nativa, quindi l'audio può essere generato come parte del flusso di lavoro video, senza dover sempre fare affidamento su modelli di post-produzione separati.

Quanto costa l'API MiniMax H3?

Attualmente MiniMax ha fissato il prezzo di H3 a $0,13 al secondo per la generazione a risoluzione 2K e $0,09 al secondo per la risoluzione 768P. Secondo le regole di fatturazione pubblicate, i video di riferimento e le immagini aggiuntive possono aumentare i costi dei materiali di input.

H3 può utilizzare contemporaneamente immagini di riferimento, video e audio?

Sì. L'API ufficiale supporta immagini di riferimento, video e audio nello stesso flusso di lavoro di generazione con riferimento, fatte salve le limitazioni relative al numero di file, alla durata, alle dimensioni e alle combinazioni di input.

MiniMax H3 è open source?

MiniMax ha annunciato l'intenzione di rilasciare i pesi del modello H3 nei prossimi giorni, in conformità con le normative applicabili. Al momento della stesura di questo articolo, l'API ufficiale è già online, ma nella documentazione ufficiale esaminata non è ancora stato confermato un collegamento a un repository pubblico dei pesi H3.

H3 è il primo modello video open source con pesi pubblicati in Cina?

No, non in senso storico generale. Alibaba ha rilasciato i pesi del modello di generazione video Wan2.1 nel 2025. Ciò che rende H3 più degno di nota è la combinazione di riferimenti multimodali e capacità native di generazione audio-video in un unico modello video generalista.

Strumenti correlati

  • API MiniMax H3: documentazione ufficiale per i flussi di lavoro testo-video, immagine-video e generazione con riferimento di H3.
  • Piattaforma aperta MiniMax: piattaforma per sviluppatori MiniMax, che offre chiavi API, accesso ai modelli, fatturazione e risorse per sviluppatori.
  • GitHub MiniMax: organizzazione GitHub ufficiale dell'azienda per progetti di codice e modelli pubblici.
  • Hugging Face MiniMax: organizzazione Hugging Face ufficiale di MiniMax per risorse di modelli pubblici.
  • Wan2.1: serie di modelli video open source di Alibaba, utile come riferimento storico per modelli video con pesi open source.

Collegamenti correlati

Riepilogo

MiniMax H3 integra testo, immagini, video e audio in un unico flusso di generazione video generalista. Supporta output 2K fino a 15 secondi, audio stereo nativo, controllo del primo/ultimo fotogramma e generazione con riferimento utilizzando più tipi di media.

I suoi punti di forza commerciali si concentrano su due aspetti: controllo e costo. MiniMax afferma che H3 funziona bene nell'aderenza alle istruzioni, nella presentazione del marchio e nel trasferimento del movimento, mentre la sua API ufficiale attualmente fissa il prezzo della generazione 2K a $0,13 al secondo e della 768P a $0,09 al secondo.

MiniMax prevede inoltre di rilasciare i pesi del modello, sebbene al momento del rilascio, nella documentazione ufficiale esaminata, non fosse ancora presente un collegamento a un repository confermato dei pesi H3.

Il cambiamento più importante di H3 non è solo il video 2K: è il passaggio a un sistema di generazione multimodale unificato in grado di comprendere come testo, immagini, video e audio debbano funzionare insieme.