Kimi K3 ora disponibile con pesi aperti: esplorando il modello all'avanguardia da 2,8T parametri di Moon's Dark Side AI
Moon's Dark Side AI ha mantenuto la promessa pubblicando i pesi completi di Kimi K3, il loro modello più grande e ambizioso mai realizzato. Il modello è ora disponibile sulle pagine ufficiali Hugging Face e GitHub di Moon's Dark Side AI, accompagnato da un rapporto tecnico dettagliato e progetti infrastrutturali complementari. Kimi K3 è un modello nativo multimodale di esperti misti, con 2,8 trilioni di parametri totali, circa 104 miliardi di parametri attivati per token e una finestra di contesto di 1 milione di token. Moon's Dark

I pesi di Kimi K3 sono ora disponibili: esplorazione del modello all'avanguardia da 2,8 trilioni di parametri di Moonshot AI
Introduzione
Moonshot AI ha mantenuto la sua promessa, rilasciando ufficialmente i pesi completi del suo modello più grande e ambizioso mai realizzato: Kimi K3.
Il modello è ora disponibile per il download tramite le pagine ufficiali Hugging Face e GitHub di Moonshot AI, accompagnato da un rapporto tecnico dettagliato e da progetti infrastrutturali correlati.
Kimi K3 è un modello nativo multimodale di tipo Mixture of Experts, con 2,8 trilioni di parametri totali, circa 104 miliardi di parametri attivati per ogni token e una finestra di contesto di 1 milione di token.
Moonshot lo posiziona come un modello all'avanguardia a pesi aperti, progettato per programmazione a lungo ciclo, ricerca, comprensione multimodale, lavoro conoscitivo di agenti e compiti di ragionamento che potrebbero coinvolgere centinaia o migliaia di passaggi.
L'importanza di questo rilascio è duplice.
In primo luogo, il modello stesso spinge la scala dei pesi aperti verso la soglia dei 3 trilioni di parametri.
In secondo luogo, Moonshot ha rivelato molto più dei semplici checkpoint del modello. I materiali pubblici descrivono in dettaglio la sua architettura, le strategie di post-addestramento, l'infrastruttura di reinforcement learning per contesti lunghi, il sistema di addestramento parallelo per esperti, l'ottimizzazione dell'inferenza, i risultati dei benchmark e diversi casi di studio ingegneristici a lungo termine.

I pesi completi di Kimi K3 sono ora disponibili
Moonshot aveva precedentemente annunciato il lancio di Kimi K3, promettendo di rilasciare i pesi completi entro il 27 luglio 2026.
Il rilascio è ora completo.
Il modello ufficiale è accessibile tramite i seguenti canali:
Il repository GitHub contiene il file README, la licenza di Kimi K3, il rapporto tecnico completo, risorse per architettura e benchmark, guide per la distribuzione e istruzioni per l'uso del modello.
La scheda del modello su Hugging Face fornisce la configurazione del modello e l'accesso ai pesi pubblicati.
Ciò significa che il modello è passato dall'essere un sistema all'avanguardia ospitato e in attesa di rilascio pubblico, a un modello che ricercatori e team infrastrutturali qualificati possono effettivamente scaricare, ispezionare, distribuire, mettere a punto e adattare secondo i termini della licenza Kimi K3.

Cosa significa "aperto" per Kimi K3
Kimi K3 è meglio descritto come un modello a pesi aperti con codice e documentazione pubblici.
La licenza concede diritti ampi, consentendo agli utenti di utilizzare, copiare, modificare, mettere a punto, distribuire, creare opere derivate, ridistribuire, concedere in sublicenza e vendere copie secondo i termini della licenza.
Tuttavia,
la licenza include requisiti commerciali aggiuntivi.
Ad esempio, un'azienda che gestisce un'attività Model-as-a-Service idonea con ricavi totali superiori a 20 milioni di dollari in un periodo di 12 mesi consecutivi deve prima stipulare un accordo separato con Moonshot AI prima di utilizzare Kimi K3 o i suoi derivati per scopi commerciali.
La licenza impone inoltre requisiti di esposizione per determinati prodotti o servizi commerciali molto grandi che superano soglie specifiche di utenti o ricavi.
L'uso interno e l'uso tramite i prodotti ufficiali di Moonshot o partner di inferenza certificati sono trattati diversamente.
Pertanto, chiunque intenda utilizzare Kimi K3 per scopi commerciali dovrebbe leggere attentamente la licenza effettiva, senza presumere che sia uguale ad Apache 2.0, MIT o altre licenze permissive standard.
Un modello da 2,8 trilioni di parametri con 104B parametri attivati
La capacità totale di Kimi K3 è enorme, ma il suo design Mixture of Experts (MoE) significa che non tutti i 2,8 trilioni di parametri vengono attivati per ogni token.
La scheda ufficiale del modello elenca quanto segue:
| Specifica | Kimi K3 |
|---|---|
| Architettura | Mixture of Experts (MoE) |
| Parametri totali | 2,8T |
| Parametri attivati | 104B |
| Numero di layer | 93 |
| Layer densi | 1 |
| Esperti instradati | 896 |
| Esperti selezionati per token | 16 |
| Esperti condivisi | 2 |
| Dimensione del vocabolario | 160K |
| Lunghezza del contesto | 1.048.576 token |
| Encoder visivo | MoonViT-V2 |
| Parametri dell'encoder visivo | 401M |
| Quantizzazione | Pesi MXFP4 / Attivazioni MXFP8 |
| Modalità | Testo e immagini |
Il rapporto tecnico fornisce un confronto architetturale più preciso con Kimi K2.

Rispetto a Kimi K2, K3 aumenta la profondità del modello e la sparsità degli esperti, introducendo al contempo nuovi meccanismi di attenzione e residuali.
Moonshot afferma che, sulla base di Kimi K2, l'efficienza complessiva di scaling è migliorata di circa 2,5 volte grazie a miglioramenti combinati nell'architettura e nelle modalità di addestramento.
Questa affermazione si riferisce all'efficienza con cui la potenza di calcolo aggiuntiva si traduce in capacità del modello, non a un miglioramento generalizzato di 2,5 volte nella velocità di inferenza.
Modello nativo multimodale e finestra di contesto di un milione di token
Kimi K3 è progettato come un modello nativo multimodale, non un modello linguistico con un modulo visivo aggiunto solo alla fine dell'addestramento.
Il suo encoder visivo MoonViT-V2 ha circa 401 milioni di parametri.
Il rapporto tecnico indica che MoonViT-V2 è stato addestrato da zero utilizzando l'obiettivo di previsione del token successivo del modello, anziché essere inizializzato da un modello visivo pre-addestrato contrastivamente come SigLIP.
Moonshot riferisce che questo metodo è rimasto stabile durante l'addestramento e ha raggiunto prestazioni visive competitive.

La lunghezza del contesto supportata da questo modello è:
1.048.576 token
Questa scala è particolarmente importante per i sistemi agente, perché un compito di codifica o ricerca a lunga esecuzione può accumulare contenuti del repository, output degli strumenti, log, screenshot, materiali di ricerca, piani intermedi, registrazioni di test falliti, risultati di ragionamenti precedenti e informazioni di correzione iterative.
Un contesto di milioni di token non elimina la necessità di gestione del contesto, ma consente a K3 di conservare una cronologia di lavoro molto più ampia rispetto ai sistemi tradizionali a contesto breve.
Tre principali cambiamenti architetturali
Il rapporto tecnico attribuisce la scala e la stabilità di K3 a diversi cambiamenti architetturali.
I tre più significativi sono:
- Meccanismo di attenzione ibrida KDA + Gate MLA.
- Residui di attenzione.
- Modello esperto misto latente stabile.

1. Meccanismo di attenzione ibrida: KDA + Gate MLA
Kimi K3 adotta un design di attenzione ibrida.
La scheda del modello ufficiale elenca:
69 layer KDA + 24 layer Gate MLA
L'architettura segue uno schema ripetitivo in cui più layer di attenzione Kimi Delta si combinano con layer periodici di attenzione latente multi-testa con gate.
Kimi Delta Attention
KDA è un meccanismo di attenzione lineare progettato per ridurre il carico di memoria e calcolo associato a contesti estremamente lunghi.
KDA non utilizza una cache KV tradizionale che cresce con ogni token come nell'attenzione completa standard, ma mantiene uno stato ricorrente.
Questo lo rende interessante per sequenze di milioni di token.
Moonshot ha precedentemente introdotto KDA attraverso la serie di ricerca lineare Kimi, e il team ha riportato che, nelle loro condizioni di valutazione, KDA riduce i requisiti della cache KV e migliora il throughput di decodifica per contesti lunghi.
Gate MLA
K3 non sostituisce completamente l'attenzione globale.
I layer periodici Gate MLA preservano la capacità del modello di recuperare informazioni globalmente nel contesto.
Pertanto, questo design ibrido cerca di bilanciare due obiettivi:
- Elaborazione efficiente di sequenze lunghe.
- Recupero globale robusto.
L'idea non è che l'attenzione lineare sia sempre superiore all'attenzione globale, ma che ciascun meccanismo gestisca parti diverse del problema del contesto lungo.
2. Residui di attenzione
Le reti neurali profonde devono trasmettere informazioni attraverso più livelli, evitando che rappresentazioni utili vadano gradualmente perse.
Kimi K3 introduce i residui di attenzione (AttnRes) per cambiare il modo in cui le informazioni vengono trasmesse in profondità.
Questo meccanismo non si basa su un flusso residuo sequenziale uniforme, ma consente ai moduli successivi di recuperare selettivamente rappresentazioni prodotte dai moduli precedenti.
Concettualmente, questo fornisce alla rete un meccanismo di apprendimento che le permette di
decidere quali informazioni precedenti dovrebbero rimanere direttamente accessibili.
L'obiettivo è migliorare il flusso informativo in un modello a 93 layer senza costringere ogni caratteristica a passare rigorosamente attraverso lo stesso percorso residuo identico.
3. LatentMoE stabile
Kimi K3 aumenta significativamente la sparsità dell'MoE.
Il modello include:
896 esperti instradati
Ma ogni token attiva solo:
16 esperti instradati
Inoltre, il modello include due esperti condivisi.
Questo rende il numero totale di parametri del modello molto grande, ma il calcolo attivo è molto inferiore al totale dei parametri.
A questo livello di sparsità, la stabilità dell'addestramento e l'equilibrio degli esperti diventano problemi spinosi.
Il design Stable LatentMoE di Moonshot include diversi meccanismi progettati per affrontare questi problemi.
SiTU-GLU
Kimi K3 sostituisce SwiGLU con SiTU-GLU, una funzione di attivazione progettata per evitare una crescita illimitata in caso di estensione estrema.
![L'immagine mostra le strutture dei rami Gate e Up di GLU, SwiGLU e SiTU-GLU, insieme alle loro curve di risposta scalare. Tutti i rami ricevono un input scalare x, le curve condividono il dominio x ∈ [−10, 100], e l'angolo in basso a destra mostra un ingrandimento dell'area vicino all'origine. Quando β1 = 4, β2 = 25, la curva di SiTU-GLU è vicina a quella di SwiGLU vicino all'origine, e quando x è un grande numero positivo, |f(x)| ≤ β1β2 = 100 per SiTU-GLU, mentre SwiGLU rimane senza limiti. Il grafico è correlato al contenuto del contesto che descrive la sostituzione di SwiGLU con SiTU-GLU in Kimi K3 per evitare una crescita illimitata in caso di scalatura estrema.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/fefa954c-d8a3-4294-a43b-b222b3386796-9daf2fb4-86f3-4c9a-96cf-f477c6f49b97.png)
Bilanciamento dei quantili
Il sistema adotta anche un metodo di bilanciamento del carico basato su bias di instradamento dinamici, invece di fare affidamento esclusivamente sulle tradizionali funzioni di perdita di bilanciamento ausiliarie.
L'obiettivo è ottenere una distribuzione più uniforme dei token instradati tra gli esperti senza introdurre troppe interferenze nell'addestramento.
Addestramento di Agenti con Milioni di Token
Il rapporto tecnico di Kimi K3 sottolinea in particolare l'addestramento post-addestramento per agenti a lunga esecuzione.
Il modello è stato addestrato in tre aree:
- Ragionamento generale.
- Compiti agente generali.
- Agente di programmazione.
Supporta anche molteplici livelli di granularità del ragionamento:
- Basso.
- Alto.
- Massimo.
Il modello finale combina diverse strategie specializzate attraverso la distillazione multi-insegnante on-policy (MOPD).
Moonshot non addestra modelli permanenti separati per ogni area e livello di granularità, ma addestra modelli insegnante specializzati e integra il loro comportamento in una strategia K3 unificata.
AgentENV: Addestramento in Sandbox a Lungo Termine
Il rapporto tecnico descrive AgentENV, un livello infrastrutturale costruito per il dispiegamento persistente di agenti.
Il sistema si basa su Firecracker.
L'ambiente micro-VM consente agli agenti di eseguire sequenze lunghe di operazioni in un sandbox riproducibile.
Un compito di addestramento può includere:
- Leggere un file.
- Scrivere codice.
- Eseguire comandi.
- Aprire applicazioni.
- Acquisire screenshot.
- Usare strumenti di postazione di lavoro simulata.
- Correggere errori.
- Tornare dopo un lungo ritardo.
- Continuare l'esecuzione dallo stato ambientale precedente.
Questo è diverso dall'apprendimento per rinforzo basato su brevi sessioni di domande e risposte.
Un agente può effettuare centinaia di chiamate a strumenti e mantenere lo stato in un ambiente simulato per diversi giorni virtuali.
L'articolo originale descrive un ambiente simulato che coinvolge applicazioni come Slack, Notion e Gmail.
La principale sfida di addestramento è la persistenza: sia lo stato esteso del contesto dell'ambiente che del modello devono rimanere disponibili.
Durante un lungo processo di implementazione.
Sintesi dei compiti guidata dal grafo di conoscenza
L'addestramento a ciclo lungo richiede anche un gran numero di compiti difficili.
Moonshot descrive una pipeline di generazione dei compiti organizzata attorno a un grafo di conoscenza gerarchico.
Il grafo copre molteplici aree tra cui informatica, intelligenza artificiale, programmazione, matematica, fisica, chimica, biomedicina e discipline umanistiche.
I concetti correlati possono essere campionati insieme, recuperando materiali pubblici pertinenti, e quindi sintetizzando nuovi compiti di valutazione o addestramento da questi materiali.
Lo scopo del grafo è creare compiti che richiedano l'uso effettivo di strumenti e ragionamenti a più fasi, non solo ricordare risposte.
Infrastruttura per il modello MoE da 3T livelli
Un modello da 2,8T con una finestra di contesto di un milione di token non può essere addestrato e servito in modo efficiente solo tramite l'architettura del modello.
Il rapporto tecnico di Moonshot descrive il lavoro di sistema che copre i kernel KDA, il parallelismo del contesto, il parallelismo degli esperti, la gestione della memoria, la pianificazione RL a ciclo lungo, la cache dei prefissi, la decodifica speculativa e il controllo di ammissione al servizio.
Parte di questo contenuto è già pubblico.
MoonEP: parallelismo degli esperti bilanciato
MoonEP è una libreria di comunicazione per il parallelismo degli esperti open source di Moonshot.
Nell'addestramento MoE, il routing può diventare gravemente sbilanciato.
Poiché il router preferisce certi esperti, un rango può ricevere molti più token di un altro. Quando ciò accade, il dispositivo più veloce deve attendere quello più lento.
MoonEP utilizza esperti dinamici ridondanti per risolvere questo problema.
Può creare copie temporanee di esperti in base al modello di routing corrente, mantenendo così bilanciato il carico di lavoro dei token su ciascun rango.
Il progetto descrive il suo obiettivo come fare in modo che ogni rango rimanga esattamente al carico di token di routing previsto, riducendo al contempo il sovraccarico di comunicazione.
Questo è cruciale alla scala K3, poiché distribuire 896 esperti in un grande cluster comporta enormi problemi di sincronizzazione.
FlashKDA: Kernel KDA ad alte prestazioni
FlashKDA fornisce kernel Kimi Delta Attention ad alte prestazioni basati su CUTLASS.
Il repository pubblico attualmente elenca i seguenti requisiti:
SM90 o successivo
CUDA 12.9 o successivo
PyTorch 2.4 o successivo
Il repository include test di correttezza e dati di benchmark per hardware supportato.
FlashKDA mira ad accelerare il meccanismo di attenzione che rende pratica l'architettura a contesto lungo K3.
Quantizzazione MXFP4 nativa
Kimi K3 utilizza l'addestramento consapevole della quantizzazione a partire dalla fase di messa a punto supervisionata.
La configurazione ufficiale elenca:
Pesi MXFP4
Attivazioni MXFP8
Questo è diverso dall'addestramento prima di un modello completamente ad alta precisione e poi dalla quantizzazione successiva all'addestramento.
Il modello è addestrato per operare direttamente con questi formati a bassa precisione nel pipeline.
Ciò aiuta a ridurre l'overhead di memoria e comunicazione.
Requisiti, ma questo non trasforma un modello da 2,8T in un modello desktop ordinario.
È possibile eseguire Kimi K3 localmente?
I pesi sono pubblici, ma "scaricabile" non significa "eseguibile facilmente su un laptop".
Kimi K3 ha un totale di 2,8 trilioni di parametri.
Anche con attivazione sparsa e formati a bassa precisione, eseguire il modello completo richiede una grande quantità di memoria acceleratore aggregata, interconnessioni di dispositivi ad alta larghezza di banda, parallelismo degli esperti, un motore di inferenza compatibile e supporto efficiente per KDA, MLA e MoE.
Il repository ufficiale di Moonshot raccomanda:
L'ecosistema è ancora in rapida evoluzione. Il supporto può dipendere da schemi specifici, kernel, modalità di quantizzazione e hardware.
Prima di costruire un ambiente self-hosted, confermare l'ultima documentazione di distribuzione di Kimi K3 e non presumere che le impostazioni standard del servizio Transformer funzionino correttamente.
Per la maggior parte degli individui e dei piccoli team, l'API ospitata può essere molto più semplice che eseguire il modello completo.
API Kimi K3 e sforzo di ragionamento
Moonshot offre anche Kimi K3 tramite la sua piattaforma API ufficiale:
L'identificatore del modello è:
kimi-k3
Kimi K3 utilizza funzionalità di ragionamento e restituisce il campo reasoning_content.
La scheda ufficiale del modello descrive tre livelli di sforzo di ragionamento:
low
high
max
Un importante dettaglio di implementazione è la cronologia del pensiero conservata.
Per i flussi di lavoro di agenti multi-turno, Moonshot afferma che gli sviluppatori dovrebbero restituire l'intero messaggio precedente dell'assistente (inclusi reasoning_content, content e tool_calls) alla richiesta successiva.
Eliminare parte di questo stato può danneggiare la continuità, poiché il modo in cui K3 è addestrato richiede di conservare la cronologia del ragionamento.
Prestazioni di benchmark
Il rapporto tecnico di Moonshot valuta Kimi K3 in termini di ragionamento e conoscenza, codifica, flussi di lavoro agente e visione.
La propria suite di valutazione dell'azienda classifica K3 come uno dei modelli più potenti disponibili, guidando in compiti specifici rispetto a molti sistemi open-weight e proprietari.
Allo stesso tempo, il rapporto afferma chiaramente che il modello è ancora in ritardo rispetto ai più forti sistemi proprietari nel complesso, in particolare Claude Fable 5 e GPT-5.6 Sol.
Questa qualificazione è importante.
L'affermazione non è che K3 vinca tutti i benchmark.
La conclusione più sostenibile è che Kimi K3 porta i pesi aperti in un regno di prestazioni che fino a poco tempo fa era principalmente associato ai sistemi di frontiera proprietari.

Anche molti confronti di benchmark si basano su diversi strumenti agente, tra cui Kimi Code, Claude Code, Codex e strumenti di benchmark ufficiali.
Pertanto, i punteggi di benchmark degli agenti non dovrebbero essere interpretati come pura capacità del modello.
Risultati di misurazione. Gli strumenti circostanti, i prompt, la gestione del contesto, i meccanismi di fallback e il valutatore influiscono tutti sostanzialmente sui risultati.
Caso di studio sulla codifica a ciclo lungo
Il rapporto fornisce diversi casi, mirati a dimostrare che K3 è in grado di svolgere lavori di ingegneria complessi ben oltre i semplici compiti di completamento del codice.
Questi casi sono forniti dagli sviluppatori del modello e dovrebbero essere visti come esempi dimostrativi, non come garanzie di prestazione universali.
MiniTriton: costruire un sistema di programmazione GPU
Moonshot riferisce che Kimi K3 ha sviluppato MiniTriton, un sistema di programmazione GPU compatto simile a Triton.
Il progetto include rappresentazioni intermedie, flussi del compilatore, generazione PTX, linguaggi front-end, componenti runtime, ottimizzazione dei kernel GPU e primitive di addestramento distribuito.

Moonshot afferma che K3 ha anche ottimizzato kernel complessi relativi alla propria architettura, ottenendo significativi miglioramenti delle prestazioni su kernel selezionati.
Ciò dimostra il comportamento previsto del modello: esaminare codebase complessi, eseguire analisi delle prestazioni, scrivere codice di basso livello, eseguire benchmark dei risultati e iterare per migliorare.
Ma ciò non significa che ogni kernel o compilatore generato dal modello sia completamente affidabile senza revisione e test umani.
Un esperimento di progettazione di chip di 48 ore
In un altro caso di studio, Kimi K3 è stato inserito in un ambiente sandbox per 48 ore e gli è stato chiesto di creare un prototipo di chip di inferenza per un modello di piccole dimensioni, il cui design presenta somiglianze con l'architettura sopra menzionata.
Il modello ha utilizzato strumenti di automazione della progettazione elettronica open source e la libreria di celle standard Nangate da 45 nanometri.
Moonshot ha riferito che la simulazione finale del design è stata completata entro un budget di area di analisi di 4 mm quadrati, ha chiuso i tempi a una frequenza di clock di 100 MHz, includeva circa 1,46 milioni di celle standard, utilizzava 0,277 MiB di SRAM e raggiungeva una velocità di decodifica di oltre 8.700 token al secondo tramite simulazione RTL.

Si tratta di una prova di concetto basata su simulazione, non di un chip prodotto in serie.
Codifica scientifica e astrofisica
K3 è stato valutato anche in un'attività di riproduzione di astrofisica computazionale.
Moonshot afferma che il modello ha letto e convalidato in modo incrociato oltre 20 articoli, implementato un flusso di lavoro numerico completo, valutato oltre 300 equazioni di stato, identificato incongruenze in formule pubblicate, scritto oltre 3.000 righe di codice Python e generato un dashboard HTML interattivo.
![L'immagine mostra i risultati di Kimi K3 nella codifica scientifica. Per riprodurre la relazione universale I-Love-Q nell'astrofisica computazionale, Kimi K3 ha esaminato oltre 20 articoli, convalidato i risultati in modo incrociato, implementato un flusso numerico completo, valutato oltre 300 set di equazioni di stato, scoperto incongruenze in formule pubbliche, scritto oltre 3000 righe di codice Python e generato un dashboard HTML interattivo in circa 2 ore, mentre un ricercatore esperto di solito impiega 1-2 settimane. L'immagine è strettamente correlata al contesto e mostra visivamente i risultati specifici di Kimi K3 nell'attività di codifica scientifica.]
Secondo il rapporto, il lavoro autonomo ha richiesto circa due ore, mentre un ricercatore esperto di solito impiega da una a due settimane.
Per il lavoro scientifico, la verifica indipendente rimane fondamentale. Il modello può generare un flusso di lavoro completo, ma possono ancora verificarsi sottili errori in ipotesi, unità di misura, metodi numerici, citazioni o interpretazioni.
Valutazione della sicurezza informatica
Il rapporto tecnico discute anche la valutazione della sicurezza informatica.
Moonshot afferma che Kimi K3 ha scoperto vulnerabilità del kernel Linux precedentemente sconosciute in test di sicurezza controllati, e le relative scoperte sono state verificate da esperti umani.
Il significato non è che K3 debba essere utilizzato per operazioni di sicurezza offensiva non supervisionate.
Piuttosto, indica che i modelli di codifica a ciclo lungo stanno diventando sempre più capaci di leggere grandi codebase, tracciare comportamenti di basso livello, formulare ipotesi, verificare ipotesi, correggere metodi e procedere dopo tentativi falliti.
Queste capacità possono supportare audit difensivi e revisioni della sicurezza del codice, ma rendono anche più importanti l'autorizzazione, l'isolamento in sandbox, il controllo degli accessi e la supervisione umana.
Costo ed efficienza
Il valore di un modello non è determinato solo dai punteggi dei benchmark.
I sistemi agente a ciclo lungo possono generare milioni di token su un singolo compito.
Pertanto, il costo dipende dalla lunghezza dell'input, dalla lunghezza dell'output, dalla complessità dell'inferenza, dal tasso di hit della cache, dal numero di chiamate agli strumenti, dal numero di tentativi, dalla gestione del contesto e dal fornitore di inferenza.
Il rapporto tecnico di Moonshot include punteggi e confronti dei costi per diversi benchmark agente.
Questi grafici mostrano che K3 ha un rapporto costo-efficacia relativo su alcuni carichi di lavoro di test.
Non dovrebbe essere interpretato come una conclusione generale che K3 sia più economico di tutte le alternative in ogni scenario.
Nella pianificazione della produzione, si dovrebbe misurare il costo totale per completare con successo un'attività, piuttosto che concentrarsi solo sul prezzo per milione di token.
Il significato del rilascio dei pesi open source
Il rilascio di Kimi K3 va oltre il ranking di un singolo modello.
Apre diversi ambiti di ricerca e ingegneria che sono difficili da studiare in sistemi solo API.
I ricercatori possono esaminare o modificare i pesi del modello, il comportamento MoE, il meccanismo di attenzione basato su KDA, i meccanismi di contesto lungo, i componenti visivi, il comportamento di quantizzazione, i sistemi di servizio e le strategie di post-addestramento degli agenti.
I team di infrastruttura possono testare diverse soluzioni di servizio.
Le aziende possono valutare l'implementazione on-premise quando l'hardware è economicamente conveniente.
La comunità può costruire:
Nuove soluzioni di inferenza.
Varianti quantizzate.
Modelli derivati ottimizzati.
Sistemi specifici per dominio.
Framework di valutazione
Strumenti di routing dei modelli
Ottimizzazioni hardware specifiche
Se questi possano formare un ecosistema paragonabile ai rilasci di modelli aperti importanti del passato dipenderà dai costi di inferenza, dall'hardware disponibile, dai termini di licenza, dagli strumenti della comunità e dalla qualità dei modelli derivati più piccoli.
Lista di controllo pratica prima di distribuire Kimi K3
1. Leggere il contratto di licenza
Confermare che il tuo caso d'uso rientri in: ricerca interna, uso aziendale, ottimizzazione, applicazioni embedded, inferenza pubblica o modello come servizio.
2. Verificare il supporto hardware
Controllare l'architettura dell'acceleratore, la capacità HBM, le interconnessioni, la versione CUDA, i requisiti del kernel, il supporto alla quantizzazione, il numero di dispositivi e la topologia del parallelismo degli esperti.
3. Scegliere un motore di inferenza supportato
Utilizzare le soluzioni specifiche per K3 attualmente disponibili per vLLM, SGLang o altri percorsi di servizio ufficialmente supportati.
4. Testare individualmente il contesto completo da 1 milione
Misurare la latenza di prefilling, la latenza di decodifica, il comportamento della cache dei prefissi, l'occupazione della memoria, la concorrenza, la produttività e il ripristino dagli errori.
5. Conservare la cronologia delle inferenze
Per i flussi di lavoro agente multi-turno, seguire le linee guida di Moonshot, restituendo i messaggi completi dell'assistente (inclusi stato di inferenza e chiamate agli strumenti).
6. Verificare le attività reali
Eseguire benchmark su repository propri, flussi di lavoro di ricerca, documenti, attività visive, uso di strumenti e scenari agente.
7. Misurare il costo per attività completata
Concentrarsi solo sul prezzo del token può essere fuorviante. Calcolare il costo dei tentativi, delle chiamate agli strumenti, della lunghezza dell'output e dell'intervento umano.
Domande frequenti
Kimi K3 è open source?
I pesi completi, il codebase, la documentazione e il rapporto tecnico di Kimi K3 sono stati resi pubblici. MoonShot lo descrive come un modello a pesi aperti. Il modello utilizza una licenza personalizzata Kimi K3, non Apache 2.0.
protocolli standard, gli utenti commerciali devono esaminare attentamente i termini specifici.
Dove scaricare Kimi K3?
I pesi ufficiali sono disponibili su Moonshot AI su Hugging Face. Il repository principale del codice sorgente e il report tecnico sono consultabili su GitHub.
Quanti parametri ha Kimi K3?
Kimi K3 ha circa 2,8 trilioni di parametri totali. Grazie all'architettura a esperti misti sparsi, ogni token attiva circa 104 miliardi di parametri.
Qual è la finestra di contesto di Kimi K3?
Il modello ufficiale supporta un contesto fino a 1.048.576 token. Il dispiegamento di contesti lunghi richiede comunque molta memoria e infrastruttura di inferenza, specialmente in scenari concorrenti.
Kimi K3 può funzionare su GPU consumer?
Il modello completo da 2,8T non può praticamente funzionare su normali GPU consumer. Anche con attivazioni sparse e quantizzazione a bassa precisione, il peso completo e lo stack di servizio richiedono grandi infrastrutture multi-acceleratore.
Quali motori di inferenza supportano Kimi K3?
Il repository ufficiale di Moonshot consiglia di utilizzare vLLM, SGLang e TokenSpeed tramite la guida di deploy specifica per K3. Poiché il modello utilizza ottimizzazioni legate a KDA, MLA, MoE e MXFP4, è necessario verificare la versione supportata prima del deploy.
Cosa sono MoonEP e FlashKDA?
MoonEP è una libreria di comunicazione parallela per esperti open-source di Moonshot, utilizzata per bilanciare il carico dei token MoE tra GPU. FlashKDA è un kernel di attenzione Kimi Delta ad alte prestazioni basato su CUTLASS.
Kimi K3 è superiore a GPT-5.6 Sol e Claude Fable 5?
Non in modo assoluto. Il report tecnico di Moonshot indica che Kimi K3 ha raggiunto prestazioni all'avanguardia e primeggia in compiti specifici, ma nel complesso è ancora inferiore ai sistemi proprietari più potenti. I risultati dei benchmark dipendono anche dal framework degli agenti, dagli strumenti, dalle impostazioni di inferenza e dai metodi di valutazione.
Strumenti correlati
- Kimi K3 su Hugging Face: Scheda ufficiale del modello e pesi completi di Kimi K3.
- Kimi K3 su GitHub: Repository ufficiale con README, licenza, asset e report tecnico.
- MoonEP: Libreria di comunicazione parallela per esperti di Moonshot per il bilanciamento dinamico del carico di lavoro MoE.
- FlashKDA: Kernel di attenzione Kimi Delta ad alte prestazioni basato su CUTLASS.
- vLLM: Motore di inferenza e servizio open-source raccomandato nella guida di deploy di Kimi K3.
- SGLang: Framework di servizio open-source per LLM e modelli multimodali elencato da Moonshot per il deploy di K3.
- Kimi API: Piattaforma API ospitata da Moonshot AI per accedere al modello
kimi-k3.
Link correlati
- Repository GitHub ufficiale di Kimi K3: Repository principale con dettagli architetturali, istruzioni di deploy, uso del modello, licenza e asset tecnici.
- Scheda Hugging Face di Kimi K3: Riepilogo ufficiale del modello e pesi completi scaricabili.
- Report tecnico di Kimi K3: Report di ricerca completo su architettura, addestramento, infrastruttura, valutazione e casi studio.
- Licenza di Kimi K3: Licenza ufficiale che regola pesi, codice, opere derivate, deploy e usi commerciali specifici.
- Repository MoonEP: Implementazione open-source del sistema parallelo bilanciato per esperti di Moonshot.
- Repository FlashKDA: Implementazione open-source del kernel KDA e risorse di benchmark.
- Organizzazione Kimi K3 su ModelScope: Modelli Moonshot AI distribuiti tramite ModelScope.
Riepilogo
Moonshot AI ha ora rilasciato i pesi completi di Kimi K3, trasformando il suo modello all'avanguardia da 2,8T parametri in un sistema che ricercatori e team di infrastruttura possono esaminare, distribuire, mettere a punto ed estendere sotto la licenza Kimi K3.
Il modello combina 104 miliardi di parametri attivati, una finestra di contesto di 1 milione di token, multimodalità nativa, meccanismi di attenzione ibrida KDA/Gated-MLA, residui di attenzione, MoE latente stabile, addestramento consapevole della quantizzazione e post-addestramento per agenti a lungo orizzonte.
Altrettanto importante, questa pubblicazione svela parte dell'ingegneria di sistema dietro il modello attraverso progetti come MoonEP e FlashKDA. K3 rimane un modello estremamente impegnativo da auto-ospitare, e i suoi migliori risultati dovrebbero essere interpretati nel contesto della scelta del framework e dell'esecuzione da parte degli sviluppatori.
Valutazione.
La vera pietra miliare non è solo l'esistenza di un modello da 2,8T parametri, ma il fatto che un modello di queste dimensioni sia ora disponibile per una comunità più ampia per essere esaminato, eseguito e su cui costruire.