ByteDance secondo quanto riportato prevede di lanciare un modello AI con oltre 5 trilioni di parametri, con notizie successive che indicano fino a 10 trilioni

La corsa ai modelli all'avanguardia in Cina sta entrando nell'era dei trilioni di parametri. Il Qwen3.8-Max di Alibaba ha già raggiunto 2,4 trilioni di parametri, mentre il Kimi K3 di Moonshot AI è stato spinto a

发布于 2026年8月7日generalGEO 评分: 02 次阅读
Questa immagine è la copertina del titolo di un articolo, con uno sfondo scuro blu-nero profondo, adornato da linee blu tecnologiche e punti luminosi. Al centro dell'immagine è chiaramente mostrato il titolo principale, mentre sullo sfondo in alto è visibile il logo di ByteDance. Il contenuto del titolo corrisponde pienamente al tema dell'articolo, evidenziando direttamente l'informazione chiave secondo cui ByteDance prevede di lanciare un modello con 5 trilioni di parametri.

Secondo quanto riportato, ByteDance prevede di addestrare un modello AI con oltre 5 trilioni di parametri; successivi report indicano fino a 10 trilioni

Introduzione

La competizione sui modelli all'avanguardia in Cina sta entrando nell'era dei trilioni di parametri.

Il Qwen3.8-Max di Alibaba ha raggiunto 2,4 trilioni di parametri, mentre il Kimi K3 di Moonshot AI ha spinto la scala dichiarata pubblicamente a 2,8 trilioni di parametri.

ByteDance potrebbe prepararsi al prossimo salto.

AIBase, citando un report di LatePost, ha riferito che ByteDance, il 7 agosto 2026, stava discutendo l'addestramento di un modello fondamentale con oltre 5 trilioni di parametri. Secondo il report, il progetto è ancora in fase iniziale e non vi è alcuna garanzia che il modello finale venga rilasciato.

Immagine del contenuto pubblicato da LatePost, con titolo "#ByteDance discute l'addestramento di un modello con oltre 5 trilioni di parametri#". Il contenuto menziona che ByteDance sta discutendo l'addestramento di un modello con oltre 5 trilioni di parametri, superando Alibaba Qwen 3.8-Max (2,4 trilioni di parametri) e Moonshot AI K3 (2,8 trilioni di parametri), il modello di dimensioni maggiori conosciuto a livello nazionale. Il nuovo modello è guidato da Xiang Liang, responsabile di Seed Foundation, in collaborazione con Shen Ke, responsabile dei dati di pre-addestramento per LLM. Seed sta riorganizzando la struttura, suddividendo le responsabilità e allocando le risorse. L'immagine è correlata al contenuto nel documento riguardante la discussione di ByteDance sull'addestramento di un modello con oltre 5 trilioni di parametri ed è uno screenshot del report di LatePost.

Solo in termini di scala, questo progetto diventerebbe uno dei più grandi progetti di modelli AI mai riportati pubblicamente in Cina.

Tuttavia, lo stesso giorno c'è stato anche un importante aggiornamento.

Nella sera del 7 agosto, Reuters, citando il Financial Times e fonti vicine alla questione, ha riportato che ByteDance sta addestrando un modello con fino a 10 trilioni di parametri, e che il modello è già entrato nella fase di pre-addestramento. ByteDance non ha ancora risposto pubblicamente a questo report.

I due report non sono necessariamente contraddittori. Un progetto inizialmente discusso come "oltre 5 trilioni" potrebbe puntare a una configurazione più grande. Tuttavia, poiché ByteDance non ha ancora divulgato ufficialmente l'architettura del modello o il numero di parametri, tutte le cifre in questo articolo devono essere considerate come piani riportati, non come specifiche confermate del modello.

Secondo quanto riportato, ByteDance si avvicina alla soglia dei 5 trilioni di parametri

Il report originale di LatePost afferma che ByteDance sta discutendo un modello con oltre 5 trilioni di parametri.

Questo lo collocherebbe ben oltre le dimensioni attualmente dichiarate da molti modelli all'avanguardia cinesi.

Modello Parametri totali riportati pubblicamente Stato
Qwen3.8-Max 2,4 trilioni Pubblicato da Alibaba
Kimi K3 2,8 trilioni Pubblicato da Moonshot AI
Modello ByteDance riportato Oltre 5 trilioni Piano riportato
Dati successivi FT/Reuters Fino a 10 trilioni Riportato, non confermato ufficialmente

Moonshot AI ha descritto ufficialmente Kimi K3 come un modello misto di esperti con 2,8 trilioni di parametri, attivando 104 miliardi di parametri per token.

Reuters ha riportato il 3 agosto che il Qwen3.8-Max di Alibaba contiene 2,4 trilioni di parametri totali.

Se ByteDance dovesse eventualmente addestrare e distribuire un modello da 5 a 10 trilioni di parametri, ciò rappresenterebbe un aumento significativo delle dimensioni totali del modello.

Ma questo non significa automaticamente che le capacità del modello sarebbero due o tre volte superiori.

Il numero di parametri non equivale al livello di intelligenza

Le fonti di AIBase descrivono il modello da 5 trilioni di parametri come appartenente alla stessa categoria di scala dei sistemi all'avanguardia americani, come GPT-5.6 o i modelli di fascia alta più recenti di Anthropic.

Questo confronto richiede un'importante precisazione.

OpenAI e Anthropic non hanno divulgato pubblicamente il numero esatto di parametri di GPT-5.6, Claude Fable 5 o Claude Mythos 5.

Reuters ha sollevato lo stesso punto nel suo report del 7 agosto: il confronto diretto di scala con i sistemi leader americani è difficile perché questi laboratori non pubblicano il numero di parametri dei loro modelli.

Il numero di parametri è solo una dimensione per misurare le capacità di un modello.

Le prestazioni dipendono anche da:

  • Architettura del modello
  • Numero di parametri attivati per token
  • Qualità dei dati di addestramento
  • Numero di token di addestramento
  • Filtraggio dei dati
  • Progettazione dell'ottimizzatore
  • Apprendimento per rinforzo
  • Post-addestramento
  • Uso di strumenti
  • Calcolo al momento del test
  • Architettura per contesto lungo
  • Efficienza dell'inferenza

Questo è particolarmente importante per i modelli misti di esperti (MoE).

Un modello MoE sparso può contenere trilioni di parametri totali, ma attivare solo un piccolo sottoinsieme per ogni token.

Kimi K3 è un ottimo esempio.

Le sue specifiche ufficiali elencano:

  • 2,8 trilioni di parametri totali
  • 10,4 miliardi di parametri attivati
  • 896 esperti instradati
  • 16 esperti selezionati per ogni token

Pertanto, il numero totale di pesi non è la stessa cosa della quantità di calcolo utilizzata per ogni passo di inferenza.

ByteDance non ha ancora divulgato pubblicamente se il modello riportato utilizzi un'architettura sparsa simile, né quanti parametri verrebbero attivati per token.

Un modello da 5 trilioni di parametri richiederebbe un'enorme potenza di calcolo per l'addestramento

Il report originale ha utilizzato come esempio le GPU NVIDIA H100 per illustrare la scala.

Le sue stime suggeriscono che addestrare un modello da 5 trilioni di parametri richiederebbe circa:

  • 100.000 GPU di classe H100 per 347 giorni, oppure
  • 1.000.000 di GPU per circa 35 giorni

Entrambi gli scenari hanno un tempo di accelerazione totale approssimativamente nello stesso ordine di grandezza:

Scenario Numero di GPU Durata Giorni GPU approssimativi
Cluster a lungo termine 100.000 347 giorni 34,7 milioni
Cluster su larga scala a breve termine 1.000.000 35 giorni 35 milioni

Queste cifre dovrebbero essere intese come stime approssimative di scenario fornite dalle fonti, non come formule ingegneristiche universali.

I requisiti effettivi di addestramento dipendono in gran parte da:

  • Architettura
  • Attivazione sparsa rispetto a densa
  • Numero di token
  • Precisione
  • Utilizzo dei FLOP del modello
  • Salvataggio dei checkpoint
  • Efficienza della rete
  • Generazione hardware
  • Stabilità dell'addestramento
  • Prestazioni della pipeline dei dati
  • Esecuzioni fallite e riavvii

Le specifiche ufficiali NVIDIA H100 indicano che la versione SXM ha un TDP massimo fino a 700W e supporta l'addestramento di transformer su larga scala grazie al Transformer Engine di Hopper e all'infrastruttura NVLink.

Alla scala di centinaia di migliaia di acceleratori, il solo cluster di GPU raggiunge un livello in cui energia elettrica, rete, raffreddamento e capacità dei data center diventano vincoli primari.

Perché "1 milione di GPU" non significa che ByteDance si addestrerà in questo modo

Le fonti di AIBase hanno correttamente sottolineato che eseguire 1 milione di acceleratori di classe H100 simultaneamente sarebbe una configurazione infrastrutturale estrema.

Un progetto più realistico potrebbe distribuire l'addestramento su un cluster più piccolo ma comunque enorme.

Le fonti suggeriscono uno scenario più vicino a:

  • Da 200.000 a 300.000 acceleratori
  • Funzionamento per circa tre o quattro mesi

Questo sarebbe comunque uno dei cluster di addestramento più grandi mai realizzati.

Uno dei progetti di addestramento di modelli più ambiziosi nella storia dell'umanità.

E il pre-addestramento è solo una fase.

Un modello all'avanguardia richiede anche tempo e potenza di calcolo per i seguenti passaggi:

  1. Preparazione dei dati
  2. Sperimentazione sull'architettura
  3. Ricerca sull'estensione della scala
  4. Pre-addestramento
  5. Valutazione dei checkpoint
  6. Post-addestramento supervisionato
  7. Apprendimento per rinforzo
  8. Test di sicurezza
  9. Addestramento per strumenti e agenti
  10. Ottimizzazione del servizio

Pertanto, l'articolo originale di AIBase stima che l'intero processo richieda almeno sei mesi, con un tempo totale potenzialmente vicino a un anno prima che un modello maturo venga rilasciato.

Successivamente, il report del Financial Times (sintetizzato da Reuters) ha affermato che il modello è già entrato nella fase di pre-addestramento, indicando che questa fase richiede tipicamente circa tre-sei mesi, prima delle fasi di ottimizzazione e rilascio.

Entrambe le descrizioni portano alla stessa conclusione pratica: un progetto di questa portata è un'infrastruttura a lungo termine, non un modello che appare immediatamente dopo che il primo cluster di addestramento viene messo online.

ByteDance ha la capacità di tentare

Un addestramento di questa scala non è solo un problema di ricerca.

È anche un problema di infrastruttura e capitale.

ByteDance è una delle poche aziende tecnologiche cinesi con le risorse finanziarie, i canali di distribuzione verso i consumatori, l'infrastruttura cloud, la capacità dei data center e i team di ingegneria AI sufficienti per tentare seriamente un progetto di questa portata.

L'organizzazione Seed ufficiale dell'azienda copre i seguenti ambiti:

  • Pre-addestramento di modelli fondamentali
  • Post-addestramento
  • Apprendimento per rinforzo
  • Inferenza ad alte prestazioni
  • Addestramento distribuito
  • Compilazione per hardware eterogeneo
  • Modelli multimodali
  • Sistemi agente

Il team infrastrutturale di ByteDance descrive esplicitamente il proprio lavoro come comprendente addestramento distribuito, sistemi di apprendimento per rinforzo, inferenza ad alte prestazioni e tecnologie di compilazione orientate ai modelli fondamentali.

Anche nei suoi materiali di reclutamento vengono menzionati esplicitamente i seguenti contenuti lavorativi:

  • Addestramento su scala ultra-massiccia
  • Stabilità dell'addestramento
  • Utilizzo dei FLOP del modello
  • Progettazione congiunta software-hardware
  • Inferenza multi-nodo
  • Parallelizzazione
  • Ottimizzazione della pianificazione

Questi sono esattamente i problemi di ingegneria dei sistemi che diventano cruciali quando si addestrano modelli con parametri su scala di trilioni.

Il numero di GPU della fonte è solo una stima, non un dato divulgato pubblicamente

AIBase ha inoltre citato stime di terze parti sull'entità della potenza di calcolo AI disponibile presso diversi laboratori all'avanguardia.

I numeri approssimativi menzionati nell'articolo sono:

  • OpenAI: circa 2 milioni di GPU
  • Anthropic: circa 620.000 GPU
  • DeepSeek: circa 60.000 GPU

Questi numeri non dovrebbero essere considerati dati di inventario verificati.

OpenAI e Anthropic non pubblicano in tempo reale il numero esatto di tutti gli acceleratori disponibili nelle proprie strutture, nei partner cloud e nella capacità riservata.

La cifra di circa 60.000 acceleratori per DeepSeek proviene originariamente da una stima di SemiAnalysis ed è stata poi ampiamente citata in vari report. Queste stime includono un mix eterogeneo di acceleratori come A100, H100, H800 e H20, non una flotta omogenea.

Più affidabile di qualsiasi numero di inventario esatto è il punto chiave più generale:

Lo sviluppo di modelli all'avanguardia dipende sempre più dall'accesso a potenza di calcolo accelerata su scala ultra-massiccia, e quando la scala dei modelli continua ad aumentare, il divario tra le aziende con infrastrutture su scala ultra-massiccia e i laboratori più piccoli potrebbe diventare estremamente pronunciato.

Salendo verso trilioni di parametri.

Il confronto con H100 è solo una linea di base

Utilizzare la potenza di calcolo equivalente H100 rende più comprensibile la discussione sui calcoli, ma ByteDance non si affida necessariamente a un unico tipo di acceleratore.

Le grandi aziende AI possono combinare:

  • H100
  • H200
  • Sistemi NVIDIA di generazione Blackwell
  • Chip NVIDIA versione Cina
  • Acceleratori AI nazionali cinesi
  • Hardware personalizzato
  • Più regioni cloud e data center

Acceleratori più recenti possono modificare il numero fisico di GPU necessarie per completare la stessa quantità di calcolo di addestramento.

Anche il software è ugualmente importante.

Miglioramenti nei seguenti ambiti:

  • Efficienza del kernel
  • Grado di parallelismo
  • Instradamento degli esperti
  • Gestione della memoria
  • Comunicazione
  • Salvataggio dei checkpoint
  • Quantizzazione
  • Caricamento dei dati

Possono modificare significativamente la relazione tra la scala complessiva del modello e i costi di addestramento.

Pertanto, "il modello X richiede esattamente Y GPU" dovrebbe essere sempre considerato un'ipotesi di scenario, non una legge fissa.

Perché ByteDance potrebbe aver bisogno di un modello così grande

La fonte inquadra principalmente il progetto come un tentativo di spingere il livello di intelligenza di Doubao verso la frontiera globale.

Questo è probabilmente solo una parte della motivazione.

Modelli fondamentali più grandi potrebbero sostenere diverse parti dell'ecosistema AI di ByteDance.

Doubao

Doubao è uno dei principali prodotti AI consumer di ByteDance nel mercato cinese.

Un modello base più forte può migliorare:

  • Ragionamento generale
  • Lavoro basato sulla conoscenza
  • Programmazione
  • Ricerca
  • Attività con contesto lungo
  • Comportamento agente
  • Interazioni multimodali

Ricerca Seed

I modelli su scala ultra-massiccia forniranno inoltre al team Seed una nuova piattaforma di ricerca per esplorare:

  • Leggi di scaling
  • Architetture sparse
  • Apprendimento per rinforzo
  • Addestramento di agenti
  • Efficienza dei modelli
  • Memoria
  • Ragionamento su lunghi orizzonti temporali

Volcano Engine

ByteDance può inoltre commercializzare le capacità dei modelli attraverso servizi enterprise e servizi cloud.

Pertanto, i modelli all'avanguardia hanno valore potenziale anche al di là dei chatbot consumer.

I modelli più grandi devono comunque generare ritorni economici

L'ultima questione nell'articolo di AIBase è la più critica.

Un modello dal costo di addestramento estremamente elevato può generare ritorni corrispondenti?

I laboratori all'avanguardia non devono pagare solo per l'esecuzione finale dell'addestramento.

La spesa totale può includere:

  • GPU
  • Data center
  • Energia elettrica
  • Rete
  • Storage
  • Stipendi dei ricercatori
  • Preparazione dei dati
  • Esperimenti falliti
  • Post-addestramento
  • Inferenza
  • Lavori legati alla sicurezza
  • Integrazione del prodotto

Successivamente, il modello deve creare valore attraverso una combinazione di:

  • Abbonamenti consumer
  • Pubblicità
  • E-commerce
  • API enterprise
  • Servizi cloud
  • Prodotti per strumenti di efficienza
  • Strumenti di programmazione
  • Agenti
  • Miglioramenti dell'efficienza interna

La scala dei parametri ha senso economicamente solo se si traduce in capacità utili a costi di inferenza accettabili.

Questo è il motivo per cui l'attuale generazione di modelli all'avanguardia enfatizza sempre più l'efficienza di scaling, non solo il numero totale di parametri.

Ad esempio, Kimi K3 ha 2,8 trilioni di parametri totali, ma attiva solo 104 miliardi di parametri per token. Moonshot AI ha dichiarato che la sua architettura ha migliorato l'efficienza di scaling rispetto alla generazione precedente.

Pertanto, la vera competizione non è:

Chi ha più parametri?

Ma piuttosto:

Chi riesce a trasformare le migliori capacità con meno risorse?

Convertire nell'intelligenza più utile con costi sostenibili di addestramento e inferenza?

Cosa è confermato e cosa è ancora solo segnalato

Confermato

  • Secondo le informazioni di Moonshot AI, Kimi K3 ha 2,8 trilioni di parametri totali.
  • Secondo i report di Alibaba e Reuters, Qwen3.8-Max ha 2,4 trilioni di parametri totali.
  • Il team Seed di ByteDance lavora su pre-addestramento su larga scala, post-addestramento, inferenza e infrastruttura dei modelli.
  • Doubao è il prodotto AI consumer di ByteDance.
  • La NVIDIA H100 è progettata specificamente per l'addestramento di Transformer su larga scala e carichi di lavoro AI con trilioni di parametri.

Segnalato ma non confermato ufficialmente da ByteDance

  • ByteDance sta costruendo un modello con oltre 5 trilioni di parametri.
  • L'obiettivo finale potrebbe arrivare fino a 10 trilioni di parametri.
  • La dimensione esatta del cluster di addestramento.
  • La quantità totale di potenza di calcolo equivalente H100 richiesta.
  • La data di rilascio finale.
  • Se il modello verrà infine rilasciato pubblicamente.
  • L'architettura del modello e il numero di parametri attivi.

Non verificabile dalle specifiche pubbliche del modello

  • Un modello da 5 trilioni di parametri appartiene automaticamente al "livello GPT-5.6".
  • Il solo numero di parametri può prevedere il livello di intelligenza del modello.
  • Il numero esatto di parametri dei modelli di livello GPT-5.6 o Fable/Mythos di Anthropic.
  • L'inventario GPU esatto attuale di OpenAI o Anthropic.

Domande frequenti

ByteDance sta davvero addestrando un modello da 5 trilioni di parametri?

AIBase, citando LatePost, ha riportato che ByteDance sta discutendo di un modello con oltre 5 trilioni di parametri. Più tardi lo stesso giorno, Reuters, citando il Financial Times, ha riportato che ByteDance sta già pre-addestrando un modello che potrebbe arrivare fino a 10 trilioni di parametri. ByteDance non ha confermato pubblicamente la cifra esatta.

Questo modello supporterà Doubao?

Le fonti prevedono che il modello rafforzerà l'ecosistema Doubao di ByteDance, ma ByteDance non ha ancora annunciato ufficialmente come verrà implementato il modello menzionato nei report. Il modello all'avanguardia potrebbe anche supportare API enterprise, agenti, ricerca e altri prodotti ByteDance.

Un modello da 5 trilioni di parametri è necessariamente migliore di Kimi K3 o Qwen3.8-Max?

Non necessariamente. Il numero totale di parametri non determina direttamente la qualità del modello. Architettura, parametri attivi, dati di addestramento, post-addestramento, apprendimento per rinforzo, pensiero durante l'inferenza e utilizzo di strumenti possono essere ugualmente importanti.

Quanti parametri ha Kimi K3?

Moonshot AI ha annunciato ufficialmente che Kimi K3 ha 2,8 trilioni di parametri totali e 104 miliardi di parametri attivi. Utilizza un'architettura a miscela sparsa di esperti (MoE).

Quanti parametri ha Qwen3.8-Max?

Secondo i report di Alibaba e Reuters, Qwen3.8-Max di Alibaba ha 2,4 trilioni di parametri totali. Si basa anch'esso su un design a modello sparso, non attivando tutti i parametri per ogni token.

Quante GPU H100 sono necessarie per addestrare un modello da 5 trilioni di parametri?

La fonte fornisce uno scenario approssimativo equivalente a circa 35 milioni di giorni GPU H100, ad esempio 100.000 H100 che operano per 347 giorni, o 1 milione di H100 che operano per circa 35 giorni. I requisiti effettivi possono variare notevolmente in base ad architettura, precisione, utilizzo, numero di token, hardware ed efficienza di addestramento.

GPT-5.6 ha 5 trilioni di parametri?

OpenAI non ha divulgato pubblicamente il numero di parametri di GPT-5.6. Qualsiasi affermazione sul numero di parametri di GPT-5.6

Il confronto numerico diretto con un determinato modello

Secondo quanto riportato, un modello di ByteDance è ancora allo stadio di speculazione.

Quando potrebbe ByteDance rilasciare questo modello?

Al momento non è stata annunciata una data di rilascio ufficiale. Reuters, basandosi su un articolo del Financial Times, ha riferito che il modello si trova attualmente in fase di pre-addestramento, una fase che potrebbe richiedere diversi mesi prima di poter procedere con la messa a punto, la valutazione e la distribuzione.

Strumenti correlati

  • ByteDance Seed: il centro ufficiale di ricerca di ByteDance e la piattaforma per i modelli fondamentali, i sistemi multimodali e la ricerca sull'IA.
  • ByteDance Seed LLM: la panoramica ufficiale di ByteDance su pre-addestramento, post-addestramento, inferenza, memoria, apprendimento e ricerca sui modelli fondamentali.
  • Doubao: l'assistente AI consumer di ByteDance, uno dei principali punti di accesso che potrebbe trarre beneficio da modelli fondamentali più potenti.
  • Kimi: la piattaforma ufficiale del prodotto di Moonshot AI e il punto di accesso alla serie di modelli Kimi.
  • Tongyi Qianwen: il portale ufficiale dei modelli Qwen e dei prodotti di Alibaba.
  • NVIDIA H100: le specifiche ufficiali dell'acceleratore H100 e le informazioni sulle prestazioni di addestramento fornite da NVIDIA.

Link correlati

Riepilogo

Secondo quanto riportato, ByteDance sta preparando un modello fondamentale su scala ultra-grande, che supererà i modelli cinesi attualmente resi pubblici. AIBase e LatePost hanno inizialmente descritto il progetto come superiore a 5 trilioni di parametri, mentre un successivo rapporto di Reuters/Financial Times dello stesso giorno ha indicato che il modello potrebbe raggiungere i 10 trilioni di parametri e trovarsi già in fase di pre-addestramento.

Un progetto di queste dimensioni richiederà enormi risorse computazionali. Il calcolo H100 citato dalle fonti equivale a circa 35 milioni di giorni GPU, ma il fabbisogno effettivo di addestramento dipende dall'architettura, dai parametri attivi, dalla generazione hardware, dal tasso di utilizzo e dall'efficienza dell'addestramento.

La questione più grande non è se ByteDance possa costruire il modello più grande. Il numero totale di parametri è una metrica incompleta per misurare l'intelligenza, soprattutto per i sistemi misti sparsi di esperti.

La vera prova consiste in questo

ByteDance è in grado di trasformare una potenza di calcolo su scala trilione in un modello che sia significativamente superiore in termini di prestazioni, sufficientemente efficiente da sostenere i servizi e abbastanza prezioso da giustificare l'infrastruttura che vi sta dietro.