Kimi K3 ora disponibile con pesi aperti: esplorando il modello all'avanguardia da 2,8T parametri di Moon's Dark Side AI

Moon's Dark Side AI ha mantenuto la promessa pubblicando i pesi completi di Kimi K3, il loro modello più grande e ambizioso mai realizzato. Il modello è ora disponibile sulle pagine ufficiali Hugging Face e GitHub di Moon's Dark Side AI, accompagnato da un rapporto tecnico dettagliato e progetti infrastrutturali complementari. Kimi K3 è un modello nativo multimodale di esperti misti, con 2,8 trilioni di parametri totali, circa 104 miliardi di parametri attivati per token e una finestra di contesto di 1 milione di token. Moon's Dark

发布于 2026年7月30日generalGEO 评分: 012 次阅读
Questa immagine è la grafica promozionale di Moon's Dark Side AI per il lancio del modello large Kimi K3, con uno sfondo nero intenso abbinato a un design tecnologico in viola e blu. Al centro, è evidenziata la scritta bianca "Kimi K3 Is Now Open-Weight", sopra la quale compare il logo "Kimi" semitrasparente, e sotto il nome del marchio "moonshot AI". Sul lato destro, c'è un'icona di lucchetto tecnologico viola luminescente con motivi di nodi geometrici sulla superficie, sospesa su una piattaforma con anelli luminosi, circondata da scie di punti luminosi. Sul lato sinistro, è presente una scheda modello con simboli di codice, che evidenzia la caratteristica dei pesi aperti di questo modello all'avanguardia da 2,8T parametri.

I pesi di Kimi K3 sono ora disponibili: esplorazione del modello all'avanguardia da 2,8 trilioni di parametri di Moonshot AI

Introduzione

Moonshot AI ha mantenuto la sua promessa, rilasciando ufficialmente i pesi completi del suo modello più grande e ambizioso mai realizzato: Kimi K3.

Il modello è ora disponibile per il download tramite le pagine ufficiali Hugging Face e GitHub di Moonshot AI, accompagnato da un rapporto tecnico dettagliato e da progetti infrastrutturali correlati.

Kimi K3 è un modello nativo multimodale di tipo Mixture of Experts, con 2,8 trilioni di parametri totali, circa 104 miliardi di parametri attivati per ogni token e una finestra di contesto di 1 milione di token.

Moonshot lo posiziona come un modello all'avanguardia a pesi aperti, progettato per programmazione a lungo ciclo, ricerca, comprensione multimodale, lavoro conoscitivo di agenti e compiti di ragionamento che potrebbero coinvolgere centinaia o migliaia di passaggi.

L'importanza di questo rilascio è duplice.

In primo luogo, il modello stesso spinge la scala dei pesi aperti verso la soglia dei 3 trilioni di parametri.

In secondo luogo, Moonshot ha rivelato molto più dei semplici checkpoint del modello. I materiali pubblici descrivono in dettaglio la sua architettura, le strategie di post-addestramento, l'infrastruttura di reinforcement learning per contesti lunghi, il sistema di addestramento parallelo per esperti, l'ottimizzazione dell'inferenza, i risultati dei benchmark e diversi casi di studio ingegneristici a lungo termine.

Questa immagine mostra la pagina del progetto GitHub di Moonshot AI per il rilascio del modello open-source Kimi K3. Il ramo del progetto è main, con 1 ramo e 0 tag. L'ultimo commit è un commit iniziale di 7 minuti fa. La pagina mostra che il progetto contiene una cartella assets, un file LICENSE, un file README.md e un file di rapporto tecnico chiamato k3_tech_report.pdf. Questi sono esattamente i materiali di accompagnamento menzionati nel documento rilasciati insieme a Kimi K3. Gli utenti possono visualizzare i contenuti relativi al codice del progetto tramite il pulsante "Code".

I pesi completi di Kimi K3 sono ora disponibili

Moonshot aveva precedentemente annunciato il lancio di Kimi K3, promettendo di rilasciare i pesi completi entro il 27 luglio 2026.

Il rilascio è ora completo.

Il modello ufficiale è accessibile tramite i seguenti canali:

Il repository GitHub contiene il file README, la licenza di Kimi K3, il rapporto tecnico completo, risorse per architettura e benchmark, guide per la distribuzione e istruzioni per l'uso del modello.

La scheda del modello su Hugging Face fornisce la configurazione del modello e l'accesso ai pesi pubblicati.

Ciò significa che il modello è passato dall'essere un sistema all'avanguardia ospitato e in attesa di rilascio pubblico, a un modello che ricercatori e team infrastrutturali qualificati possono effettivamente scaricare, ispezionare, distribuire, mettere a punto e adattare secondo i termini della licenza Kimi K3.

L'immagine mostra informazioni relative a Kimi K3. Kimi K3 è disponibile oggi su Kimi.com, Kimi Work, Kimi Code e Kimi API. Al momento del lancio, Kimi K3 utilizzerà per impostazione predefinita il massimo sforzo di pensiero. Aggiornamenti successivi introdurranno modalità di sforzo basso-alto. Attualmente stiamo collaborando strettamente con partner di inferenza e manutentori open-source per garantire la coerenza dei dettagli tecnici e ottenere una distribuzione affidabile dell'ecosistema. I pesi completi del modello saranno rilasciati il 27 luglio 2026. I dettagli su architettura, addestramento e valutazione saranno pubblicati insieme al rapporto tecnico di Kimi K3.

Cosa significa "aperto" per Kimi K3

Kimi K3 è meglio descritto come un modello a pesi aperti con codice e documentazione pubblici.

La licenza concede diritti ampi, consentendo agli utenti di utilizzare, copiare, modificare, mettere a punto, distribuire, creare opere derivate, ridistribuire, concedere in sublicenza e vendere copie secondo i termini della licenza.

Tuttavia,

la licenza include requisiti commerciali aggiuntivi.

Ad esempio, un'azienda che gestisce un'attività Model-as-a-Service idonea con ricavi totali superiori a 20 milioni di dollari in un periodo di 12 mesi consecutivi deve prima stipulare un accordo separato con Moonshot AI prima di utilizzare Kimi K3 o i suoi derivati per scopi commerciali.

La licenza impone inoltre requisiti di esposizione per determinati prodotti o servizi commerciali molto grandi che superano soglie specifiche di utenti o ricavi.

L'uso interno e l'uso tramite i prodotti ufficiali di Moonshot o partner di inferenza certificati sono trattati diversamente.

Pertanto, chiunque intenda utilizzare Kimi K3 per scopi commerciali dovrebbe leggere attentamente la licenza effettiva, senza presumere che sia uguale ad Apache 2.0, MIT o altre licenze permissive standard.

Un modello da 2,8 trilioni di parametri con 104B parametri attivati

La capacità totale di Kimi K3 è enorme, ma il suo design Mixture of Experts (MoE) significa che non tutti i 2,8 trilioni di parametri vengono attivati per ogni token.

La scheda ufficiale del modello elenca quanto segue:

Specifica Kimi K3
Architettura Mixture of Experts (MoE)
Parametri totali 2,8T
Parametri attivati 104B
Numero di layer 93
Layer densi 1
Esperti instradati 896
Esperti selezionati per token 16
Esperti condivisi 2
Dimensione del vocabolario 160K
Lunghezza del contesto 1.048.576 token
Encoder visivo MoonViT-V2
Parametri dell'encoder visivo 401M
Quantizzazione Pesi MXFP4 / Attivazioni MXFP8
Modalità Testo e immagini

Il rapporto tecnico fornisce un confronto architetturale più preciso con Kimi K2.

L'immagine è una tabella di confronto architetturale tra Kimi K2 e Kimi K3, che mostra le differenze in termini di numero di layer, parametri totali, parametri attivati, dimensione nascosta, dimensione degli esperti e molti altri aspetti. Kimi K3 mostra miglioramenti in numero di layer, parametri totali, parametri attivati e dimensione degli esperti, con un aumento del 52% nel numero di layer, del 167% nei parametri totali e del 220% nei parametri attivati. Inoltre, Kimi K3 introduce nuovi meccanismi di attenzione e residuali, e presenta cambiamenti nella lunghezza del contesto di addestramento, nel meccanismo di attenzione e nella funzione di attivazione. Questa tabella è strettamente correlata al contesto e mostra visivamente i miglioramenti architetturali di Kimi K3 rispetto a Kimi K2.

Rispetto a Kimi K2, K3 aumenta la profondità del modello e la sparsità degli esperti, introducendo al contempo nuovi meccanismi di attenzione e residuali.

Moonshot afferma che, sulla base di Kimi K2, l'efficienza complessiva di scaling è migliorata di circa 2,5 volte grazie a miglioramenti combinati nell'architettura e nelle modalità di addestramento.

Questa affermazione si riferisce all'efficienza con cui la potenza di calcolo aggiuntiva si traduce in capacità del modello, non a un miglioramento generalizzato di 2,5 volte nella velocità di inferenza.

Modello nativo multimodale e finestra di contesto di un milione di token

Kimi K3 è progettato come un modello nativo multimodale, non un modello linguistico con un modulo visivo aggiunto solo alla fine dell'addestramento.

Il suo encoder visivo MoonViT-V2 ha circa 401 milioni di parametri.

Il rapporto tecnico indica che MoonViT-V2 è stato addestrato da zero utilizzando l'obiettivo di previsione del token successivo del modello, anziché essere inizializzato da un modello visivo pre-addestrato contrastivamente come SigLIP.

Moonshot riferisce che questo metodo è rimasto stabile durante l'addestramento e ha raggiunto prestazioni visive competitive.

![L'immagine mostra Moonshot

AI negli esperimenti di ablazione del pre-addestramento, variazione della norma del gradiente della torre visiva di diversi modelli al variare dei passi di addestramento. La Figura (a) mostra l'intera traiettoria di addestramento, la Figura (b) è un ingrandimento dei passi 14k - 16k. La linea blu rappresenta MoonViT-3D inizializzato da SigLIP, la linea rossa rappresenta MoonViT-V2 addestrato da zero. Rispetto al modello inizializzato con SigLIP, MoonViT-V2 addestrato da zero mantiene una norma del gradiente più bassa e minori fluttuazioni, indicando un'ottimizzazione più stabile. Il grafico è strettamente correlato al contesto e mostra visivamente la stabilità di MoonViT-V2 durante il processo di addestramento.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/63b386e9-0be5-4813-a254-4665269d9469-a3cea91a-babc-4ab7-9d22-af510c0efa46.jpeg)

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b6691c45-6229-4970-8a27-4e5a6deb00e1-dc511091-a635-4fc2-a80b-ab2e008b1415.png)

La lunghezza del contesto supportata da questo modello è:

1.048.576 token

Questa scala è particolarmente importante per i sistemi agente, perché un compito di codifica o ricerca a lunga esecuzione può accumulare contenuti del repository, output degli strumenti, log, screenshot, materiali di ricerca, piani intermedi, registrazioni di test falliti, risultati di ragionamenti precedenti e informazioni di correzione iterative.

Un contesto di milioni di token non elimina la necessità di gestione del contesto, ma consente a K3 di conservare una cronologia di lavoro molto più ampia rispetto ai sistemi tradizionali a contesto breve.

Tre principali cambiamenti architetturali

Il rapporto tecnico attribuisce la scala e la stabilità di K3 a diversi cambiamenti architetturali.

I tre più significativi sono:

  1. Meccanismo di attenzione ibrida KDA + Gate MLA.
  2. Residui di attenzione.
  3. Modello esperto misto latente stabile.

L'immagine mostra l'architettura di Kimi K3, divisa in tre parti. A sinistra ci sono i moduli Stable Normalized LatentMoE e KDA, che includono Shared Expert, Routed Expert, Router, Linear, Norm, ecc. In alto a destra c'è l'operazione AttnRes, con Output, Stable LatentMoE, Gated MLA, Stable LatentMoE, KDA, ecc. A destra c'è la spina dorsale Block Attention Residuals, con Block n-1, Block n-2, Block n-3, ecc. Il grafico è strettamente correlato al contesto e mostra visivamente la struttura modulare dei tre principali cambiamenti nell'architettura di Kimi K3.

1. Meccanismo di attenzione ibrida: KDA + Gate MLA

Kimi K3 adotta un design di attenzione ibrida.

La scheda del modello ufficiale elenca:

69 layer KDA + 24 layer Gate MLA

L'architettura segue uno schema ripetitivo in cui più layer di attenzione Kimi Delta si combinano con layer periodici di attenzione latente multi-testa con gate.

Kimi Delta Attention

KDA è un meccanismo di attenzione lineare progettato per ridurre il carico di memoria e calcolo associato a contesti estremamente lunghi.

KDA non utilizza una cache KV tradizionale che cresce con ogni token come nell'attenzione completa standard, ma mantiene uno stato ricorrente.

Questo lo rende interessante per sequenze di milioni di token.

Moonshot ha precedentemente introdotto KDA attraverso la serie di ricerca lineare Kimi, e il team ha riportato che, nelle loro condizioni di valutazione, KDA riduce i requisiti della cache KV e migliora il throughput di decodifica per contesti lunghi.

Gate MLA

K3 non sostituisce completamente l'attenzione globale.

I layer periodici Gate MLA preservano la capacità del modello di recuperare informazioni globalmente nel contesto.

Pertanto, questo design ibrido cerca di bilanciare due obiettivi:

  • Elaborazione efficiente di sequenze lunghe.
  • Recupero globale robusto.

L'idea non è che l'attenzione lineare sia sempre superiore all'attenzione globale, ma che ciascun meccanismo gestisca parti diverse del problema del contesto lungo.

2. Residui di attenzione

Le reti neurali profonde devono trasmettere informazioni attraverso più livelli, evitando che rappresentazioni utili vadano gradualmente perse.

Kimi K3 introduce i residui di attenzione (AttnRes) per cambiare il modo in cui le informazioni vengono trasmesse in profondità.

Questo meccanismo non si basa su un flusso residuo sequenziale uniforme, ma consente ai moduli successivi di recuperare selettivamente rappresentazioni prodotte dai moduli precedenti.

Concettualmente, questo fornisce alla rete un meccanismo di apprendimento che le permette di

decidere quali informazioni precedenti dovrebbero rimanere direttamente accessibili.

L'obiettivo è migliorare il flusso informativo in un modello a 93 layer senza costringere ogni caratteristica a passare rigorosamente attraverso lo stesso percorso residuo identico.

3. LatentMoE stabile

Kimi K3 aumenta significativamente la sparsità dell'MoE.

Il modello include:

896 esperti instradati

Ma ogni token attiva solo:

16 esperti instradati

Inoltre, il modello include due esperti condivisi.

Questo rende il numero totale di parametri del modello molto grande, ma il calcolo attivo è molto inferiore al totale dei parametri.

A questo livello di sparsità, la stabilità dell'addestramento e l'equilibrio degli esperti diventano problemi spinosi.

Il design Stable LatentMoE di Moonshot include diversi meccanismi progettati per affrontare questi problemi.

SiTU-GLU

Kimi K3 sostituisce SwiGLU con SiTU-GLU, una funzione di attivazione progettata per evitare una crescita illimitata in caso di estensione estrema.

L'immagine mostra le strutture dei rami Gate e Up di GLU, SwiGLU e SiTU-GLU, insieme alle loro curve di risposta scalare. Tutti i rami ricevono un input scalare x, le curve condividono il dominio x ∈ [−10, 100], e l'angolo in basso a destra mostra un ingrandimento dell'area vicino all'origine. Quando β1 = 4, β2 = 25, la curva di SiTU-GLU è vicina a quella di SwiGLU vicino all'origine, e quando x è un grande numero positivo, |f(x)| ≤ β1β2 = 100 per SiTU-GLU, mentre SwiGLU rimane senza limiti. Il grafico è correlato al contenuto del contesto che descrive la sostituzione di SwiGLU con SiTU-GLU in Kimi K3 per evitare una crescita illimitata in caso di scalatura estrema.

Bilanciamento dei quantili

Il sistema adotta anche un metodo di bilanciamento del carico basato su bias di instradamento dinamici, invece di fare affidamento esclusivamente sulle tradizionali funzioni di perdita di bilanciamento ausiliarie.

L'obiettivo è ottenere una distribuzione più uniforme dei token instradati tra gli esperti senza introdurre troppe interferenze nell'addestramento.

Addestramento di Agenti con Milioni di Token

Il rapporto tecnico di Kimi K3 sottolinea in particolare l'addestramento post-addestramento per agenti a lunga esecuzione.

Il modello è stato addestrato in tre aree:

  • Ragionamento generale.
  • Compiti agente generali.
  • Agente di programmazione.

Supporta anche molteplici livelli di granularità del ragionamento:

  • Basso.
  • Alto.
  • Massimo.

Il modello finale combina diverse strategie specializzate attraverso la distillazione multi-insegnante on-policy (MOPD).

Moonshot non addestra modelli permanenti separati per ogni area e livello di granularità, ma addestra modelli insegnante specializzati e integra il loro comportamento in una strategia K3 unificata.

AgentENV: Addestramento in Sandbox a Lungo Termine

Il rapporto tecnico descrive AgentENV, un livello infrastrutturale costruito per il dispiegamento persistente di agenti.

Il sistema si basa su Firecracker.

L'ambiente micro-VM consente agli agenti di eseguire sequenze lunghe di operazioni in un sandbox riproducibile.

Un compito di addestramento può includere:

  1. Leggere un file.
  2. Scrivere codice.
  3. Eseguire comandi.
  4. Aprire applicazioni.
  5. Acquisire screenshot.
  6. Usare strumenti di postazione di lavoro simulata.
  7. Correggere errori.
  8. Tornare dopo un lungo ritardo.
  9. Continuare l'esecuzione dallo stato ambientale precedente.

Questo è diverso dall'apprendimento per rinforzo basato su brevi sessioni di domande e risposte.

Un agente può effettuare centinaia di chiamate a strumenti e mantenere lo stato in un ambiente simulato per diversi giorni virtuali.

L'articolo originale descrive un ambiente simulato che coinvolge applicazioni come Slack, Notion e Gmail.

La principale sfida di addestramento è la persistenza: sia lo stato esteso del contesto dell'ambiente che del modello devono rimanere disponibili.

Durante un lungo processo di implementazione.

Sintesi dei compiti guidata dal grafo di conoscenza

L'addestramento a ciclo lungo richiede anche un gran numero di compiti difficili.

Moonshot descrive una pipeline di generazione dei compiti organizzata attorno a un grafo di conoscenza gerarchico.

Il grafo copre molteplici aree tra cui informatica, intelligenza artificiale, programmazione, matematica, fisica, chimica, biomedicina e discipline umanistiche.

I concetti correlati possono essere campionati insieme, recuperando materiali pubblici pertinenti, e quindi sintetizzando nuovi compiti di valutazione o addestramento da questi materiali.

Lo scopo del grafo è creare compiti che richiedano l'uso effettivo di strumenti e ragionamenti a più fasi, non solo ricordare risposte.

Infrastruttura per il modello MoE da 3T livelli

Un modello da 2,8T con una finestra di contesto di un milione di token non può essere addestrato e servito in modo efficiente solo tramite l'architettura del modello.

Il rapporto tecnico di Moonshot descrive il lavoro di sistema che copre i kernel KDA, il parallelismo del contesto, il parallelismo degli esperti, la gestione della memoria, la pianificazione RL a ciclo lungo, la cache dei prefissi, la decodifica speculativa e il controllo di ammissione al servizio.

Parte di questo contenuto è già pubblico.

MoonEP: parallelismo degli esperti bilanciato

MoonEP è una libreria di comunicazione per il parallelismo degli esperti open source di Moonshot.

Nell'addestramento MoE, il routing può diventare gravemente sbilanciato.

Poiché il router preferisce certi esperti, un rango può ricevere molti più token di un altro. Quando ciò accade, il dispositivo più veloce deve attendere quello più lento.

MoonEP utilizza esperti dinamici ridondanti per risolvere questo problema.

Può creare copie temporanee di esperti in base al modello di routing corrente, mantenendo così bilanciato il carico di lavoro dei token su ciascun rango.

Il progetto descrive il suo obiettivo come fare in modo che ogni rango rimanga esattamente al carico di token di routing previsto, riducendo al contempo il sovraccarico di comunicazione.

Questo è cruciale alla scala K3, poiché distribuire 896 esperti in un grande cluster comporta enormi problemi di sincronizzazione.

FlashKDA: Kernel KDA ad alte prestazioni

FlashKDA fornisce kernel Kimi Delta Attention ad alte prestazioni basati su CUTLASS.

Il repository pubblico attualmente elenca i seguenti requisiti:

SM90 o successivo
CUDA 12.9 o successivo
PyTorch 2.4 o successivo

Il repository include test di correttezza e dati di benchmark per hardware supportato.

FlashKDA mira ad accelerare il meccanismo di attenzione che rende pratica l'architettura a contesto lungo K3.

Quantizzazione MXFP4 nativa

Kimi K3 utilizza l'addestramento consapevole della quantizzazione a partire dalla fase di messa a punto supervisionata.

La configurazione ufficiale elenca:

Pesi MXFP4
Attivazioni MXFP8

Questo è diverso dall'addestramento prima di un modello completamente ad alta precisione e poi dalla quantizzazione successiva all'addestramento.

Il modello è addestrato per operare direttamente con questi formati a bassa precisione nel pipeline.

Ciò aiuta a ridurre l'overhead di memoria e comunicazione.

Requisiti, ma questo non trasforma un modello da 2,8T in un modello desktop ordinario.

È possibile eseguire Kimi K3 localmente?

I pesi sono pubblici, ma "scaricabile" non significa "eseguibile facilmente su un laptop".

Kimi K3 ha un totale di 2,8 trilioni di parametri.

Anche con attivazione sparsa e formati a bassa precisione, eseguire il modello completo richiede una grande quantità di memoria acceleratore aggregata, interconnessioni di dispositivi ad alta larghezza di banda, parallelismo degli esperti, un motore di inferenza compatibile e supporto efficiente per KDA, MLA e MoE.

Il repository ufficiale di Moonshot raccomanda:

  • vLLM
  • SGLang
  • TokenSpeed utilizzato tramite lo schema di distribuzione di Moonshot

L'ecosistema è ancora in rapida evoluzione. Il supporto può dipendere da schemi specifici, kernel, modalità di quantizzazione e hardware.

Prima di costruire un ambiente self-hosted, confermare l'ultima documentazione di distribuzione di Kimi K3 e non presumere che le impostazioni standard del servizio Transformer funzionino correttamente.

Per la maggior parte degli individui e dei piccoli team, l'API ospitata può essere molto più semplice che eseguire il modello completo.

API Kimi K3 e sforzo di ragionamento

Moonshot offre anche Kimi K3 tramite la sua piattaforma API ufficiale:

https://platform.kimi.ai/

L'identificatore del modello è:

kimi-k3

Kimi K3 utilizza funzionalità di ragionamento e restituisce il campo reasoning_content.

La scheda ufficiale del modello descrive tre livelli di sforzo di ragionamento:

low
high
max

Un importante dettaglio di implementazione è la cronologia del pensiero conservata.

Per i flussi di lavoro di agenti multi-turno, Moonshot afferma che gli sviluppatori dovrebbero restituire l'intero messaggio precedente dell'assistente (inclusi reasoning_content, content e tool_calls) alla richiesta successiva.

Eliminare parte di questo stato può danneggiare la continuità, poiché il modo in cui K3 è addestrato richiede di conservare la cronologia del ragionamento.

Prestazioni di benchmark

Il rapporto tecnico di Moonshot valuta Kimi K3 in termini di ragionamento e conoscenza, codifica, flussi di lavoro agente e visione.

La propria suite di valutazione dell'azienda classifica K3 come uno dei modelli più potenti disponibili, guidando in compiti specifici rispetto a molti sistemi open-weight e proprietari.

Allo stesso tempo, il rapporto afferma chiaramente che il modello è ancora in ritardo rispetto ai più forti sistemi proprietari nel complesso, in particolare Claude Fable 5 e GPT-5.6 Sol.

Questa qualificazione è importante.

L'affermazione non è che K3 vinca tutti i benchmark.

La conclusione più sostenibile è che Kimi K3 porta i pesi aperti in un regno di prestazioni che fino a poco tempo fa era principalmente associato ai sistemi di frontiera proprietari.

Immagine di tabella, confronto delle prestazioni di Kimi K3 con Claude Fable 5, GPT-5.6 Sol, GLM-5.2 e altri modelli in molteplici aspetti tra cui ragionamento e conoscenza, codifica, flusso di lavoro agente e visione. Nella tabella, i risultati migliori sono in grassetto, i secondi migliori sono sottolineati. Ad esempio, nel ragionamento e nella conoscenza, Kimi K3 si distingue in attività come GQA OpenWorld, Critiq, ACLRC, superando in alcune attività modelli come Claude Fable 5. La tabella è strettamente correlata al contesto e presenta visivamente le prestazioni di Kimi K3 in diverse attività.

Anche molti confronti di benchmark si basano su diversi strumenti agente, tra cui Kimi Code, Claude Code, Codex e strumenti di benchmark ufficiali.

Pertanto, i punteggi di benchmark degli agenti non dovrebbero essere interpretati come pura capacità del modello.

Risultati di misurazione. Gli strumenti circostanti, i prompt, la gestione del contesto, i meccanismi di fallback e il valutatore influiscono tutti sostanzialmente sui risultati.

Caso di studio sulla codifica a ciclo lungo

Il rapporto fornisce diversi casi, mirati a dimostrare che K3 è in grado di svolgere lavori di ingegneria complessi ben oltre i semplici compiti di completamento del codice.

Questi casi sono forniti dagli sviluppatori del modello e dovrebbero essere visti come esempi dimostrativi, non come garanzie di prestazione universali.

MiniTriton: costruire un sistema di programmazione GPU

Moonshot riferisce che Kimi K3 ha sviluppato MiniTriton, un sistema di programmazione GPU compatto simile a Triton.

Il progetto include rappresentazioni intermedie, flussi del compilatore, generazione PTX, linguaggi front-end, componenti runtime, ottimizzazione dei kernel GPU e primitive di addestramento distribuito.

L'immagine mostra un caso di calcolo GPU sviluppato da Kimi K3 sulla GPU NVIDIA L20 utilizzando il compilatore MiniTriton. Include grafici delle prestazioni dei thread per core CUDA e core tensoriali, nonché curve di convergenza per MiniTriton rispetto a torch eager e per le primitive distribuite MiniTriton (NCCL) rispetto all'addestramento su singola GPU. Nel dettaglio, il grafico dei thread su core CUDA confronta le prestazioni di diversi compilatori come train, gpt e torch eager; il grafico dei thread su core tensoriali confronta le prestazioni di compilatori come train e gpt; le curve di convergenza mostrano rispettivamente l'andamento della perdita di addestramento per MiniTriton rispetto a torch eager e per le primitive distribuite MiniTriton rispetto all'addestramento su singola GPU.

Moonshot afferma che K3 ha anche ottimizzato kernel complessi relativi alla propria architettura, ottenendo significativi miglioramenti delle prestazioni su kernel selezionati.

Ciò dimostra il comportamento previsto del modello: esaminare codebase complessi, eseguire analisi delle prestazioni, scrivere codice di basso livello, eseguire benchmark dei risultati e iterare per migliorare.

Ma ciò non significa che ogni kernel o compilatore generato dal modello sia completamente affidabile senza revisione e test umani.

Un esperimento di progettazione di chip di 48 ore

In un altro caso di studio, Kimi K3 è stato inserito in un ambiente sandbox per 48 ore e gli è stato chiesto di creare un prototipo di chip di inferenza per un modello di piccole dimensioni, il cui design presenta somiglianze con l'architettura sopra menzionata.

Il modello ha utilizzato strumenti di automazione della progettazione elettronica open source e la libreria di celle standard Nangate da 45 nanometri.

Moonshot ha riferito che la simulazione finale del design è stata completata entro un budget di area di analisi di 4 mm quadrati, ha chiuso i tempi a una frequenza di clock di 100 MHz, includeva circa 1,46 milioni di celle standard, utilizzava 0,277 MiB di SRAM e raggiungeva una velocità di decodifica di oltre 8.700 token al secondo tramite simulazione RTL.

L'immagine mostra l'introduzione al prototipo del chip di inferenza progettato da Kimi K3. Come prova di concetto iniziale, Kimi K3 segue lo stesso design architettonico, inclusi meccanismi di attenzione ibrida KDA e NoPE-MLA, Block AttnRes, routing MoE basato su sigmoide, ecc. Entro un budget di area di analisi di 4 mm², il design chiude i tempi a un clock di 100 MHz, include circa 1,46 milioni di celle standard, 0,277 MiB di SRAM, un array MAC INT4 con dequantizzazione integrata e una velocità di decodifica nella simulazione RTL superiore a 8.700 token/s. Il design è stato costruito, ottimizzato e verificato utilizzando Kimi Code in 48 ore di funzionamento autonomo e il codice è disponibile su GitHub.

Si tratta di una prova di concetto basata su simulazione, non di un chip prodotto in serie.

Codifica scientifica e astrofisica

K3 è stato valutato anche in un'attività di riproduzione di astrofisica computazionale.

Moonshot afferma che il modello ha letto e convalidato in modo incrociato oltre 20 articoli, implementato un flusso di lavoro numerico completo, valutato oltre 300 equazioni di stato, identificato incongruenze in formule pubblicate, scritto oltre 3.000 righe di codice Python e generato un dashboard HTML interattivo.

![L'immagine mostra i risultati di Kimi K3 nella codifica scientifica. Per riprodurre la relazione universale I-Love-Q nell'astrofisica computazionale, Kimi K3 ha esaminato oltre 20 articoli, convalidato i risultati in modo incrociato, implementato un flusso numerico completo, valutato oltre 300 set di equazioni di stato, scoperto incongruenze in formule pubbliche, scritto oltre 3000 righe di codice Python e generato un dashboard HTML interattivo in circa 2 ore, mentre un ricercatore esperto di solito impiega 1-2 settimane. L'immagine è strettamente correlata al contesto e mostra visivamente i risultati specifici di Kimi K3 nell'attività di codifica scientifica.]

Secondo il rapporto, il lavoro autonomo ha richiesto circa due ore, mentre un ricercatore esperto di solito impiega da una a due settimane.

Per il lavoro scientifico, la verifica indipendente rimane fondamentale. Il modello può generare un flusso di lavoro completo, ma possono ancora verificarsi sottili errori in ipotesi, unità di misura, metodi numerici, citazioni o interpretazioni.

Valutazione della sicurezza informatica

Il rapporto tecnico discute anche la valutazione della sicurezza informatica.

Moonshot afferma che Kimi K3 ha scoperto vulnerabilità del kernel Linux precedentemente sconosciute in test di sicurezza controllati, e le relative scoperte sono state verificate da esperti umani.

Il significato non è che K3 debba essere utilizzato per operazioni di sicurezza offensiva non supervisionate.

Piuttosto, indica che i modelli di codifica a ciclo lungo stanno diventando sempre più capaci di leggere grandi codebase, tracciare comportamenti di basso livello, formulare ipotesi, verificare ipotesi, correggere metodi e procedere dopo tentativi falliti.

Queste capacità possono supportare audit difensivi e revisioni della sicurezza del codice, ma rendono anche più importanti l'autorizzazione, l'isolamento in sandbox, il controllo degli accessi e la supervisione umana.

Costo ed efficienza

Il valore di un modello non è determinato solo dai punteggi dei benchmark.

I sistemi agente a ciclo lungo possono generare milioni di token su un singolo compito.

Pertanto, il costo dipende dalla lunghezza dell'input, dalla lunghezza dell'output, dalla complessità dell'inferenza, dal tasso di hit della cache, dal numero di chiamate agli strumenti, dal numero di tentativi, dalla gestione del contesto e dal fornitore di inferenza.

Il rapporto tecnico di Moonshot include punteggi e confronti dei costi per diversi benchmark agente.

Questi grafici mostrano che K3 ha un rapporto costo-efficacia relativo su alcuni carichi di lavoro di test.

Non dovrebbe essere interpretato come una conclusione generale che K3 sia più economico di tutte le alternative in ogni scenario.

Nella pianificazione della produzione, si dovrebbe misurare il costo totale per completare con successo un'attività, piuttosto che concentrarsi solo sul prezzo per milione di token.

Il significato del rilascio dei pesi open source

Il rilascio di Kimi K3 va oltre il ranking di un singolo modello.

Apre diversi ambiti di ricerca e ingegneria che sono difficili da studiare in sistemi solo API.

I ricercatori possono esaminare o modificare i pesi del modello, il comportamento MoE, il meccanismo di attenzione basato su KDA, i meccanismi di contesto lungo, i componenti visivi, il comportamento di quantizzazione, i sistemi di servizio e le strategie di post-addestramento degli agenti.

I team di infrastruttura possono testare diverse soluzioni di servizio.

Le aziende possono valutare l'implementazione on-premise quando l'hardware è economicamente conveniente.

La comunità può costruire:

  • Nuove soluzioni di inferenza.

  • Varianti quantizzate.

  • Modelli derivati ottimizzati.

  • Sistemi specifici per dominio.

  • Framework di valutazione

  • Strumenti di routing dei modelli

  • Ottimizzazioni hardware specifiche

Se questi possano formare un ecosistema paragonabile ai rilasci di modelli aperti importanti del passato dipenderà dai costi di inferenza, dall'hardware disponibile, dai termini di licenza, dagli strumenti della comunità e dalla qualità dei modelli derivati più piccoli.

Lista di controllo pratica prima di distribuire Kimi K3

1. Leggere il contratto di licenza

Confermare che il tuo caso d'uso rientri in: ricerca interna, uso aziendale, ottimizzazione, applicazioni embedded, inferenza pubblica o modello come servizio.

2. Verificare il supporto hardware

Controllare l'architettura dell'acceleratore, la capacità HBM, le interconnessioni, la versione CUDA, i requisiti del kernel, il supporto alla quantizzazione, il numero di dispositivi e la topologia del parallelismo degli esperti.

3. Scegliere un motore di inferenza supportato

Utilizzare le soluzioni specifiche per K3 attualmente disponibili per vLLM, SGLang o altri percorsi di servizio ufficialmente supportati.

4. Testare individualmente il contesto completo da 1 milione

Misurare la latenza di prefilling, la latenza di decodifica, il comportamento della cache dei prefissi, l'occupazione della memoria, la concorrenza, la produttività e il ripristino dagli errori.

5. Conservare la cronologia delle inferenze

Per i flussi di lavoro agente multi-turno, seguire le linee guida di Moonshot, restituendo i messaggi completi dell'assistente (inclusi stato di inferenza e chiamate agli strumenti).

6. Verificare le attività reali

Eseguire benchmark su repository propri, flussi di lavoro di ricerca, documenti, attività visive, uso di strumenti e scenari agente.

7. Misurare il costo per attività completata

Concentrarsi solo sul prezzo del token può essere fuorviante. Calcolare il costo dei tentativi, delle chiamate agli strumenti, della lunghezza dell'output e dell'intervento umano.

Domande frequenti

Kimi K3 è open source?

I pesi completi, il codebase, la documentazione e il rapporto tecnico di Kimi K3 sono stati resi pubblici. MoonShot lo descrive come un modello a pesi aperti. Il modello utilizza una licenza personalizzata Kimi K3, non Apache 2.0.

protocolli standard, gli utenti commerciali devono esaminare attentamente i termini specifici.

Dove scaricare Kimi K3?

I pesi ufficiali sono disponibili su Moonshot AI su Hugging Face. Il repository principale del codice sorgente e il report tecnico sono consultabili su GitHub.

Quanti parametri ha Kimi K3?

Kimi K3 ha circa 2,8 trilioni di parametri totali. Grazie all'architettura a esperti misti sparsi, ogni token attiva circa 104 miliardi di parametri.

Qual è la finestra di contesto di Kimi K3?

Il modello ufficiale supporta un contesto fino a 1.048.576 token. Il dispiegamento di contesti lunghi richiede comunque molta memoria e infrastruttura di inferenza, specialmente in scenari concorrenti.

Kimi K3 può funzionare su GPU consumer?

Il modello completo da 2,8T non può praticamente funzionare su normali GPU consumer. Anche con attivazioni sparse e quantizzazione a bassa precisione, il peso completo e lo stack di servizio richiedono grandi infrastrutture multi-acceleratore.

Quali motori di inferenza supportano Kimi K3?

Il repository ufficiale di Moonshot consiglia di utilizzare vLLM, SGLang e TokenSpeed tramite la guida di deploy specifica per K3. Poiché il modello utilizza ottimizzazioni legate a KDA, MLA, MoE e MXFP4, è necessario verificare la versione supportata prima del deploy.

Cosa sono MoonEP e FlashKDA?

MoonEP è una libreria di comunicazione parallela per esperti open-source di Moonshot, utilizzata per bilanciare il carico dei token MoE tra GPU. FlashKDA è un kernel di attenzione Kimi Delta ad alte prestazioni basato su CUTLASS.

Kimi K3 è superiore a GPT-5.6 Sol e Claude Fable 5?

Non in modo assoluto. Il report tecnico di Moonshot indica che Kimi K3 ha raggiunto prestazioni all'avanguardia e primeggia in compiti specifici, ma nel complesso è ancora inferiore ai sistemi proprietari più potenti. I risultati dei benchmark dipendono anche dal framework degli agenti, dagli strumenti, dalle impostazioni di inferenza e dai metodi di valutazione.

Strumenti correlati

  • Kimi K3 su Hugging Face: Scheda ufficiale del modello e pesi completi di Kimi K3.
  • Kimi K3 su GitHub: Repository ufficiale con README, licenza, asset e report tecnico.
  • MoonEP: Libreria di comunicazione parallela per esperti di Moonshot per il bilanciamento dinamico del carico di lavoro MoE.
  • FlashKDA: Kernel di attenzione Kimi Delta ad alte prestazioni basato su CUTLASS.
  • vLLM: Motore di inferenza e servizio open-source raccomandato nella guida di deploy di Kimi K3.
  • SGLang: Framework di servizio open-source per LLM e modelli multimodali elencato da Moonshot per il deploy di K3.
  • Kimi API: Piattaforma API ospitata da Moonshot AI per accedere al modello kimi-k3.

Link correlati

Riepilogo

Moonshot AI ha ora rilasciato i pesi completi di Kimi K3, trasformando il suo modello all'avanguardia da 2,8T parametri in un sistema che ricercatori e team di infrastruttura possono esaminare, distribuire, mettere a punto ed estendere sotto la licenza Kimi K3.

Il modello combina 104 miliardi di parametri attivati, una finestra di contesto di 1 milione di token, multimodalità nativa, meccanismi di attenzione ibrida KDA/Gated-MLA, residui di attenzione, MoE latente stabile, addestramento consapevole della quantizzazione e post-addestramento per agenti a lungo orizzonte.

Altrettanto importante, questa pubblicazione svela parte dell'ingegneria di sistema dietro il modello attraverso progetti come MoonEP e FlashKDA. K3 rimane un modello estremamente impegnativo da auto-ospitare, e i suoi migliori risultati dovrebbero essere interpretati nel contesto della scelta del framework e dell'esecuzione da parte degli sviluppatori.

Valutazione.
La vera pietra miliare non è solo l'esistenza di un modello da 2,8T parametri, ma il fatto che un modello di queste dimensioni sia ora disponibile per una comunità più ampia per essere esaminato, eseguito e su cui costruire.

Kimi K3 现已开放权重:探秘月之暗面 AI 的 2.8T 参数前沿模型