ByteDance secondo quanto riportato prevede di lanciare un modello AI con oltre 5 trilioni di parametri, con notizie successive che indicano fino a 10 trilioni
La corsa ai modelli all'avanguardia in Cina sta entrando nell'era dei trilioni di parametri. Il Qwen3.8-Max di Alibaba ha già raggiunto 2,4 trilioni di parametri, mentre il Kimi K3 di Moonshot AI è stato spinto a

Secondo quanto riportato, ByteDance prevede di addestrare un modello AI con oltre 5 trilioni di parametri; successivi report indicano fino a 10 trilioni
Introduzione
La competizione sui modelli all'avanguardia in Cina sta entrando nell'era dei trilioni di parametri.
Il Qwen3.8-Max di Alibaba ha raggiunto 2,4 trilioni di parametri, mentre il Kimi K3 di Moonshot AI ha spinto la scala dichiarata pubblicamente a 2,8 trilioni di parametri.
ByteDance potrebbe prepararsi al prossimo salto.
AIBase, citando un report di LatePost, ha riferito che ByteDance, il 7 agosto 2026, stava discutendo l'addestramento di un modello fondamentale con oltre 5 trilioni di parametri. Secondo il report, il progetto è ancora in fase iniziale e non vi è alcuna garanzia che il modello finale venga rilasciato.

Solo in termini di scala, questo progetto diventerebbe uno dei più grandi progetti di modelli AI mai riportati pubblicamente in Cina.
Tuttavia, lo stesso giorno c'è stato anche un importante aggiornamento.
Nella sera del 7 agosto, Reuters, citando il Financial Times e fonti vicine alla questione, ha riportato che ByteDance sta addestrando un modello con fino a 10 trilioni di parametri, e che il modello è già entrato nella fase di pre-addestramento. ByteDance non ha ancora risposto pubblicamente a questo report.
I due report non sono necessariamente contraddittori. Un progetto inizialmente discusso come "oltre 5 trilioni" potrebbe puntare a una configurazione più grande. Tuttavia, poiché ByteDance non ha ancora divulgato ufficialmente l'architettura del modello o il numero di parametri, tutte le cifre in questo articolo devono essere considerate come piani riportati, non come specifiche confermate del modello.
Secondo quanto riportato, ByteDance si avvicina alla soglia dei 5 trilioni di parametri
Il report originale di LatePost afferma che ByteDance sta discutendo un modello con oltre 5 trilioni di parametri.
Questo lo collocherebbe ben oltre le dimensioni attualmente dichiarate da molti modelli all'avanguardia cinesi.
| Modello | Parametri totali riportati pubblicamente | Stato |
|---|---|---|
| Qwen3.8-Max | 2,4 trilioni | Pubblicato da Alibaba |
| Kimi K3 | 2,8 trilioni | Pubblicato da Moonshot AI |
| Modello ByteDance riportato | Oltre 5 trilioni | Piano riportato |
| Dati successivi FT/Reuters | Fino a 10 trilioni | Riportato, non confermato ufficialmente |
Moonshot AI ha descritto ufficialmente Kimi K3 come un modello misto di esperti con 2,8 trilioni di parametri, attivando 104 miliardi di parametri per token.
Reuters ha riportato il 3 agosto che il Qwen3.8-Max di Alibaba contiene 2,4 trilioni di parametri totali.
Se ByteDance dovesse eventualmente addestrare e distribuire un modello da 5 a 10 trilioni di parametri, ciò rappresenterebbe un aumento significativo delle dimensioni totali del modello.
Ma questo non significa automaticamente che le capacità del modello sarebbero due o tre volte superiori.
Il numero di parametri non equivale al livello di intelligenza
Le fonti di AIBase descrivono il modello da 5 trilioni di parametri come appartenente alla stessa categoria di scala dei sistemi all'avanguardia americani, come GPT-5.6 o i modelli di fascia alta più recenti di Anthropic.
Questo confronto richiede un'importante precisazione.
OpenAI e Anthropic non hanno divulgato pubblicamente il numero esatto di parametri di GPT-5.6, Claude Fable 5 o Claude Mythos 5.
Reuters ha sollevato lo stesso punto nel suo report del 7 agosto: il confronto diretto di scala con i sistemi leader americani è difficile perché questi laboratori non pubblicano il numero di parametri dei loro modelli.
Il numero di parametri è solo una dimensione per misurare le capacità di un modello.
Le prestazioni dipendono anche da:
- Architettura del modello
- Numero di parametri attivati per token
- Qualità dei dati di addestramento
- Numero di token di addestramento
- Filtraggio dei dati
- Progettazione dell'ottimizzatore
- Apprendimento per rinforzo
- Post-addestramento
- Uso di strumenti
- Calcolo al momento del test
- Architettura per contesto lungo
- Efficienza dell'inferenza
Questo è particolarmente importante per i modelli misti di esperti (MoE).
Un modello MoE sparso può contenere trilioni di parametri totali, ma attivare solo un piccolo sottoinsieme per ogni token.
Kimi K3 è un ottimo esempio.
Le sue specifiche ufficiali elencano:
- 2,8 trilioni di parametri totali
- 10,4 miliardi di parametri attivati
- 896 esperti instradati
- 16 esperti selezionati per ogni token
Pertanto, il numero totale di pesi non è la stessa cosa della quantità di calcolo utilizzata per ogni passo di inferenza.
ByteDance non ha ancora divulgato pubblicamente se il modello riportato utilizzi un'architettura sparsa simile, né quanti parametri verrebbero attivati per token.
Un modello da 5 trilioni di parametri richiederebbe un'enorme potenza di calcolo per l'addestramento
Il report originale ha utilizzato come esempio le GPU NVIDIA H100 per illustrare la scala.
Le sue stime suggeriscono che addestrare un modello da 5 trilioni di parametri richiederebbe circa:
- 100.000 GPU di classe H100 per 347 giorni, oppure
- 1.000.000 di GPU per circa 35 giorni
Entrambi gli scenari hanno un tempo di accelerazione totale approssimativamente nello stesso ordine di grandezza:
| Scenario | Numero di GPU | Durata | Giorni GPU approssimativi |
|---|---|---|---|
| Cluster a lungo termine | 100.000 | 347 giorni | 34,7 milioni |
| Cluster su larga scala a breve termine | 1.000.000 | 35 giorni | 35 milioni |
Queste cifre dovrebbero essere intese come stime approssimative di scenario fornite dalle fonti, non come formule ingegneristiche universali.
I requisiti effettivi di addestramento dipendono in gran parte da:
- Architettura
- Attivazione sparsa rispetto a densa
- Numero di token
- Precisione
- Utilizzo dei FLOP del modello
- Salvataggio dei checkpoint
- Efficienza della rete
- Generazione hardware
- Stabilità dell'addestramento
- Prestazioni della pipeline dei dati
- Esecuzioni fallite e riavvii
Le specifiche ufficiali NVIDIA H100 indicano che la versione SXM ha un TDP massimo fino a 700W e supporta l'addestramento di transformer su larga scala grazie al Transformer Engine di Hopper e all'infrastruttura NVLink.
Alla scala di centinaia di migliaia di acceleratori, il solo cluster di GPU raggiunge un livello in cui energia elettrica, rete, raffreddamento e capacità dei data center diventano vincoli primari.
Perché "1 milione di GPU" non significa che ByteDance si addestrerà in questo modo
Le fonti di AIBase hanno correttamente sottolineato che eseguire 1 milione di acceleratori di classe H100 simultaneamente sarebbe una configurazione infrastrutturale estrema.
Un progetto più realistico potrebbe distribuire l'addestramento su un cluster più piccolo ma comunque enorme.
Le fonti suggeriscono uno scenario più vicino a:
- Da 200.000 a 300.000 acceleratori
- Funzionamento per circa tre o quattro mesi
Questo sarebbe comunque uno dei cluster di addestramento più grandi mai realizzati.
Uno dei progetti di addestramento di modelli più ambiziosi nella storia dell'umanità.
E il pre-addestramento è solo una fase.
Un modello all'avanguardia richiede anche tempo e potenza di calcolo per i seguenti passaggi:
- Preparazione dei dati
- Sperimentazione sull'architettura
- Ricerca sull'estensione della scala
- Pre-addestramento
- Valutazione dei checkpoint
- Post-addestramento supervisionato
- Apprendimento per rinforzo
- Test di sicurezza
- Addestramento per strumenti e agenti
- Ottimizzazione del servizio
Pertanto, l'articolo originale di AIBase stima che l'intero processo richieda almeno sei mesi, con un tempo totale potenzialmente vicino a un anno prima che un modello maturo venga rilasciato.
Successivamente, il report del Financial Times (sintetizzato da Reuters) ha affermato che il modello è già entrato nella fase di pre-addestramento, indicando che questa fase richiede tipicamente circa tre-sei mesi, prima delle fasi di ottimizzazione e rilascio.
Entrambe le descrizioni portano alla stessa conclusione pratica: un progetto di questa portata è un'infrastruttura a lungo termine, non un modello che appare immediatamente dopo che il primo cluster di addestramento viene messo online.
ByteDance ha la capacità di tentare
Un addestramento di questa scala non è solo un problema di ricerca.
È anche un problema di infrastruttura e capitale.
ByteDance è una delle poche aziende tecnologiche cinesi con le risorse finanziarie, i canali di distribuzione verso i consumatori, l'infrastruttura cloud, la capacità dei data center e i team di ingegneria AI sufficienti per tentare seriamente un progetto di questa portata.
L'organizzazione Seed ufficiale dell'azienda copre i seguenti ambiti:
- Pre-addestramento di modelli fondamentali
- Post-addestramento
- Apprendimento per rinforzo
- Inferenza ad alte prestazioni
- Addestramento distribuito
- Compilazione per hardware eterogeneo
- Modelli multimodali
- Sistemi agente
Il team infrastrutturale di ByteDance descrive esplicitamente il proprio lavoro come comprendente addestramento distribuito, sistemi di apprendimento per rinforzo, inferenza ad alte prestazioni e tecnologie di compilazione orientate ai modelli fondamentali.
Anche nei suoi materiali di reclutamento vengono menzionati esplicitamente i seguenti contenuti lavorativi:
- Addestramento su scala ultra-massiccia
- Stabilità dell'addestramento
- Utilizzo dei FLOP del modello
- Progettazione congiunta software-hardware
- Inferenza multi-nodo
- Parallelizzazione
- Ottimizzazione della pianificazione
Questi sono esattamente i problemi di ingegneria dei sistemi che diventano cruciali quando si addestrano modelli con parametri su scala di trilioni.
Il numero di GPU della fonte è solo una stima, non un dato divulgato pubblicamente
AIBase ha inoltre citato stime di terze parti sull'entità della potenza di calcolo AI disponibile presso diversi laboratori all'avanguardia.
I numeri approssimativi menzionati nell'articolo sono:
- OpenAI: circa 2 milioni di GPU
- Anthropic: circa 620.000 GPU
- DeepSeek: circa 60.000 GPU
Questi numeri non dovrebbero essere considerati dati di inventario verificati.
OpenAI e Anthropic non pubblicano in tempo reale il numero esatto di tutti gli acceleratori disponibili nelle proprie strutture, nei partner cloud e nella capacità riservata.
La cifra di circa 60.000 acceleratori per DeepSeek proviene originariamente da una stima di SemiAnalysis ed è stata poi ampiamente citata in vari report. Queste stime includono un mix eterogeneo di acceleratori come A100, H100, H800 e H20, non una flotta omogenea.
Più affidabile di qualsiasi numero di inventario esatto è il punto chiave più generale:
Lo sviluppo di modelli all'avanguardia dipende sempre più dall'accesso a potenza di calcolo accelerata su scala ultra-massiccia, e quando la scala dei modelli continua ad aumentare, il divario tra le aziende con infrastrutture su scala ultra-massiccia e i laboratori più piccoli potrebbe diventare estremamente pronunciato.
Salendo verso trilioni di parametri.
Il confronto con H100 è solo una linea di base
Utilizzare la potenza di calcolo equivalente H100 rende più comprensibile la discussione sui calcoli, ma ByteDance non si affida necessariamente a un unico tipo di acceleratore.
Le grandi aziende AI possono combinare:
- H100
- H200
- Sistemi NVIDIA di generazione Blackwell
- Chip NVIDIA versione Cina
- Acceleratori AI nazionali cinesi
- Hardware personalizzato
- Più regioni cloud e data center
Acceleratori più recenti possono modificare il numero fisico di GPU necessarie per completare la stessa quantità di calcolo di addestramento.
Anche il software è ugualmente importante.
Miglioramenti nei seguenti ambiti:
- Efficienza del kernel
- Grado di parallelismo
- Instradamento degli esperti
- Gestione della memoria
- Comunicazione
- Salvataggio dei checkpoint
- Quantizzazione
- Caricamento dei dati
Possono modificare significativamente la relazione tra la scala complessiva del modello e i costi di addestramento.
Pertanto, "il modello X richiede esattamente Y GPU" dovrebbe essere sempre considerato un'ipotesi di scenario, non una legge fissa.
Perché ByteDance potrebbe aver bisogno di un modello così grande
La fonte inquadra principalmente il progetto come un tentativo di spingere il livello di intelligenza di Doubao verso la frontiera globale.
Questo è probabilmente solo una parte della motivazione.
Modelli fondamentali più grandi potrebbero sostenere diverse parti dell'ecosistema AI di ByteDance.
Doubao
Doubao è uno dei principali prodotti AI consumer di ByteDance nel mercato cinese.
Un modello base più forte può migliorare:
- Ragionamento generale
- Lavoro basato sulla conoscenza
- Programmazione
- Ricerca
- Attività con contesto lungo
- Comportamento agente
- Interazioni multimodali
Ricerca Seed
I modelli su scala ultra-massiccia forniranno inoltre al team Seed una nuova piattaforma di ricerca per esplorare:
- Leggi di scaling
- Architetture sparse
- Apprendimento per rinforzo
- Addestramento di agenti
- Efficienza dei modelli
- Memoria
- Ragionamento su lunghi orizzonti temporali
Volcano Engine
ByteDance può inoltre commercializzare le capacità dei modelli attraverso servizi enterprise e servizi cloud.
Pertanto, i modelli all'avanguardia hanno valore potenziale anche al di là dei chatbot consumer.
I modelli più grandi devono comunque generare ritorni economici
L'ultima questione nell'articolo di AIBase è la più critica.
Un modello dal costo di addestramento estremamente elevato può generare ritorni corrispondenti?
I laboratori all'avanguardia non devono pagare solo per l'esecuzione finale dell'addestramento.
La spesa totale può includere:
- GPU
- Data center
- Energia elettrica
- Rete
- Storage
- Stipendi dei ricercatori
- Preparazione dei dati
- Esperimenti falliti
- Post-addestramento
- Inferenza
- Lavori legati alla sicurezza
- Integrazione del prodotto
Successivamente, il modello deve creare valore attraverso una combinazione di:
- Abbonamenti consumer
- Pubblicità
- E-commerce
- API enterprise
- Servizi cloud
- Prodotti per strumenti di efficienza
- Strumenti di programmazione
- Agenti
- Miglioramenti dell'efficienza interna
La scala dei parametri ha senso economicamente solo se si traduce in capacità utili a costi di inferenza accettabili.
Questo è il motivo per cui l'attuale generazione di modelli all'avanguardia enfatizza sempre più l'efficienza di scaling, non solo il numero totale di parametri.
Ad esempio, Kimi K3 ha 2,8 trilioni di parametri totali, ma attiva solo 104 miliardi di parametri per token. Moonshot AI ha dichiarato che la sua architettura ha migliorato l'efficienza di scaling rispetto alla generazione precedente.
Pertanto, la vera competizione non è:
Chi ha più parametri?
Ma piuttosto:
Chi riesce a trasformare le migliori capacità con meno risorse?
Convertire nell'intelligenza più utile con costi sostenibili di addestramento e inferenza?
Cosa è confermato e cosa è ancora solo segnalato
Confermato
- Secondo le informazioni di Moonshot AI, Kimi K3 ha 2,8 trilioni di parametri totali.
- Secondo i report di Alibaba e Reuters, Qwen3.8-Max ha 2,4 trilioni di parametri totali.
- Il team Seed di ByteDance lavora su pre-addestramento su larga scala, post-addestramento, inferenza e infrastruttura dei modelli.
- Doubao è il prodotto AI consumer di ByteDance.
- La NVIDIA H100 è progettata specificamente per l'addestramento di Transformer su larga scala e carichi di lavoro AI con trilioni di parametri.
Segnalato ma non confermato ufficialmente da ByteDance
- ByteDance sta costruendo un modello con oltre 5 trilioni di parametri.
- L'obiettivo finale potrebbe arrivare fino a 10 trilioni di parametri.
- La dimensione esatta del cluster di addestramento.
- La quantità totale di potenza di calcolo equivalente H100 richiesta.
- La data di rilascio finale.
- Se il modello verrà infine rilasciato pubblicamente.
- L'architettura del modello e il numero di parametri attivi.
Non verificabile dalle specifiche pubbliche del modello
- Un modello da 5 trilioni di parametri appartiene automaticamente al "livello GPT-5.6".
- Il solo numero di parametri può prevedere il livello di intelligenza del modello.
- Il numero esatto di parametri dei modelli di livello GPT-5.6 o Fable/Mythos di Anthropic.
- L'inventario GPU esatto attuale di OpenAI o Anthropic.
Domande frequenti
ByteDance sta davvero addestrando un modello da 5 trilioni di parametri?
AIBase, citando LatePost, ha riportato che ByteDance sta discutendo di un modello con oltre 5 trilioni di parametri. Più tardi lo stesso giorno, Reuters, citando il Financial Times, ha riportato che ByteDance sta già pre-addestrando un modello che potrebbe arrivare fino a 10 trilioni di parametri. ByteDance non ha confermato pubblicamente la cifra esatta.
Questo modello supporterà Doubao?
Le fonti prevedono che il modello rafforzerà l'ecosistema Doubao di ByteDance, ma ByteDance non ha ancora annunciato ufficialmente come verrà implementato il modello menzionato nei report. Il modello all'avanguardia potrebbe anche supportare API enterprise, agenti, ricerca e altri prodotti ByteDance.
Un modello da 5 trilioni di parametri è necessariamente migliore di Kimi K3 o Qwen3.8-Max?
Non necessariamente. Il numero totale di parametri non determina direttamente la qualità del modello. Architettura, parametri attivi, dati di addestramento, post-addestramento, apprendimento per rinforzo, pensiero durante l'inferenza e utilizzo di strumenti possono essere ugualmente importanti.
Quanti parametri ha Kimi K3?
Moonshot AI ha annunciato ufficialmente che Kimi K3 ha 2,8 trilioni di parametri totali e 104 miliardi di parametri attivi. Utilizza un'architettura a miscela sparsa di esperti (MoE).
Quanti parametri ha Qwen3.8-Max?
Secondo i report di Alibaba e Reuters, Qwen3.8-Max di Alibaba ha 2,4 trilioni di parametri totali. Si basa anch'esso su un design a modello sparso, non attivando tutti i parametri per ogni token.
Quante GPU H100 sono necessarie per addestrare un modello da 5 trilioni di parametri?
La fonte fornisce uno scenario approssimativo equivalente a circa 35 milioni di giorni GPU H100, ad esempio 100.000 H100 che operano per 347 giorni, o 1 milione di H100 che operano per circa 35 giorni. I requisiti effettivi possono variare notevolmente in base ad architettura, precisione, utilizzo, numero di token, hardware ed efficienza di addestramento.
GPT-5.6 ha 5 trilioni di parametri?
OpenAI non ha divulgato pubblicamente il numero di parametri di GPT-5.6. Qualsiasi affermazione sul numero di parametri di GPT-5.6
Il confronto numerico diretto con un determinato modello
Secondo quanto riportato, un modello di ByteDance è ancora allo stadio di speculazione.
Quando potrebbe ByteDance rilasciare questo modello?
Al momento non è stata annunciata una data di rilascio ufficiale. Reuters, basandosi su un articolo del Financial Times, ha riferito che il modello si trova attualmente in fase di pre-addestramento, una fase che potrebbe richiedere diversi mesi prima di poter procedere con la messa a punto, la valutazione e la distribuzione.
Strumenti correlati
- ByteDance Seed: il centro ufficiale di ricerca di ByteDance e la piattaforma per i modelli fondamentali, i sistemi multimodali e la ricerca sull'IA.
- ByteDance Seed LLM: la panoramica ufficiale di ByteDance su pre-addestramento, post-addestramento, inferenza, memoria, apprendimento e ricerca sui modelli fondamentali.
- Doubao: l'assistente AI consumer di ByteDance, uno dei principali punti di accesso che potrebbe trarre beneficio da modelli fondamentali più potenti.
- Kimi: la piattaforma ufficiale del prodotto di Moonshot AI e il punto di accesso alla serie di modelli Kimi.
- Tongyi Qianwen: il portale ufficiale dei modelli Qwen e dei prodotti di Alibaba.
- NVIDIA H100: le specifiche ufficiali dell'acceleratore H100 e le informazioni sulle prestazioni di addestramento fornite da NVIDIA.
Link correlati
- Reuters: ByteDance punta a un modello AI gigante: un successivo articolo dello stesso giorno ha riferito che il modello potrebbe avere fino a 10 trilioni di parametri.
- ByteDance Seed Models: il catalogo ufficiale dei modelli e le direzioni di ricerca del team ByteDance Seed.
- ByteDance Seed Infrastructure: la panoramica ufficiale del lavoro di ByteDance sull'infrastruttura di addestramento distribuito, inferenza e sistemi AI.
- Blog tecnico di Kimi K3: la spiegazione ufficiale di Moonshot AI sull'architettura Kimi K3 con 2,8T e 104B parametri attivi.
- Repository GitHub di Kimi K3: il repository ufficiale del modello Kimi K3 e le specifiche tecniche.
- Sito ufficiale di Tongyi Qianwen: il portale ufficiale dei modelli e l'accesso API di Alibaba.
- GPU NVIDIA H100: specifiche ufficiali H100 e informazioni sull'addestramento di modelli di grandi dimensioni.
Riepilogo
Secondo quanto riportato, ByteDance sta preparando un modello fondamentale su scala ultra-grande, che supererà i modelli cinesi attualmente resi pubblici. AIBase e LatePost hanno inizialmente descritto il progetto come superiore a 5 trilioni di parametri, mentre un successivo rapporto di Reuters/Financial Times dello stesso giorno ha indicato che il modello potrebbe raggiungere i 10 trilioni di parametri e trovarsi già in fase di pre-addestramento.
Un progetto di queste dimensioni richiederà enormi risorse computazionali. Il calcolo H100 citato dalle fonti equivale a circa 35 milioni di giorni GPU, ma il fabbisogno effettivo di addestramento dipende dall'architettura, dai parametri attivi, dalla generazione hardware, dal tasso di utilizzo e dall'efficienza dell'addestramento.
La questione più grande non è se ByteDance possa costruire il modello più grande. Il numero totale di parametri è una metrica incompleta per misurare l'intelligenza, soprattutto per i sistemi misti sparsi di esperti.
La vera prova consiste in questo
ByteDance è in grado di trasformare una potenza di calcolo su scala trilione in un modello che sia significativamente superiore in termini di prestazioni, sufficientemente efficiente da sostenere i servizi e abbastanza prezioso da giustificare l'infrastruttura che vi sta dietro.