Kimi K3 domina l'arena del codice frontend, costruisce un compilatore GPU e progetta un chip in 48 ore
Moonshot AI ha lanciato Kimi K3, un modello multimodale nativo progettato per la codifica prolungata, il lavoro basato sulla conoscenza, il ragionamento visivo e i flussi di lavoro basati su agenti. Il modello vanta 2,8 trilioni di parametri totali, un contesto di 100 milioni di token e un'architettura a esperti misti altamente sparsa: per ogni token, vengono attivati solo 16 dei suoi 896 esperti. Moonshot lo descrive come il primo modello di livello 3T aperto, sebbene l'annuncio dell'azienda indichi che i pesi completi del modello saranno rilasciati il 27 luglio 2026. Kimi K3 ha immediatamente attirato l'attenzione per i risultati nello sviluppo frontend, nell'ottimizzazione autonoma dei kernel GPU, nella creazione di un piccolo compilatore GPU chiamato MiniTriton e in un esperimento di progettazione di chip completato in 48 ore utilizzando strumenti di automazione della progettazione elettronica open source. Moonshot riconosce che K3 non è leader in tutte le categorie. Le sue stesse

Kimi K3 domina l'arena del codice frontend, costruisce un compilatore GPU e progetta un chip in 48 ore
Introduzione
Moonshot AI ha lanciato Kimi K3, un modello multimodale nativo progettato per la codifica prolungata, il lavoro basato sulla conoscenza, il ragionamento visivo e i flussi di lavoro basati su agenti.
Il modello vanta 2,8 trilioni di parametri totali, un contesto di 100 milioni di token e un'architettura a esperti misti altamente sparsa: per ogni token, vengono attivati solo 16 dei suoi 896 esperti. Moonshot lo descrive come il primo modello di livello 3T aperto, sebbene l'annuncio dell'azienda indichi che i pesi completi del modello saranno rilasciati il 27 luglio 2026.
Kimi K3 ha immediatamente attirato l'attenzione per i risultati nello sviluppo frontend, nell'ottimizzazione autonoma dei kernel GPU, nella creazione di un piccolo compilatore GPU chiamato MiniTriton e in un esperimento di progettazione di chip completato in 48 ore utilizzando strumenti di automazione della progettazione elettronica open source.
Moonshot riconosce che K3 non è leader in tutte le categorie. Le sue stesse valutazioni mostrano che il modello è in ritardo rispetto a Claude Fable 5 e GPT-5.6 Sol nelle prestazioni complessive, ma produce risultati migliori in diverse attività di codifica e agenti a lungo termine.
Fonte immagine: confronto intelligente di Artificial Analysis condiviso nell'articolo, che mostra la posizione di Kimi K3.
Un modello Kimi più costoso
Kimi K3 ha portato i prezzi dell'API Moonshot a un livello superiore rispetto ai precedenti modelli di codifica Kimi.
La tabella dei prezzi del rapporto originale elenca le seguenti tariffe per l'API cinese:
| Modello | Input con cache hit | Input senza cache | Output |
|---|---|---|---|
| Kimi K3 | ¥2 per milione di token | ¥20 per milione di token | ¥100 per milione di token |
| Kimi K2.7 Code | ¥1,30 per milione di token | ¥6,50 per milione di token | ¥27 per milione di token |
Confronto dei prezzi tra Kimi K3 e Kimi K2.7 Code nell'articolo originale.
La piattaforma API internazionale di Moonshot elenca i prezzi di Kimi K3 come:
- $0,30 per milione di token di input con cache hit
- $3,00 per milione di token di input senza cache
- $15,00 per milione di token di output
Questo è significativamente più costoso di Kimi K2.7 Code, ma ancora inferiore ai prezzi di Claude Fable 5 citati da Moonshot nel confronto di lancio.
La tabella di confronto dei prezzi mostra che il prezzo di output di Kimi K3 è solo il 30% di quello di Claude Fable 5.
È necessario essere cauti nella lettura dei confronti dei prezzi. Le tariffe API possono variare in base alla regione, al fornitore, al comportamento della cache e ai successivi aggiornamenti del prodotto. Prima della distribuzione, la pagina ufficiale dell'API Kimi è il modo migliore per verificare gli attuali standard di fatturazione.
Kimi K3 al primo posto nell'arena del codice frontend
Il risultato più notevole proviene dal campo dello sviluppo frontend.
Al momento della pubblicazione, Kimi K3 è al primo posto nella classifica preliminare WebDev dell'Arena del codice frontend. Il grafico originale mostra un tasso di vittoria del 76%, superando Claude Fable 5 e GPT-5.6 Sol.
Kimi K3 è al primo posto nei risultati preliminari dell'arena del codice frontend presentati nel rapporto.
In sette categorie frontend, il rapporto originale afferma che K3 è al primo posto in sei:
- Siti web per brand e marketing
- Design di immagini di riferimento
- Interfacce di analisi dei dati
- Prodotti di consumo
- Simulazioni
- Strumenti per la creazione di contenuti
Secondo quanto riportato, nella categoria dei giochi si è classificato secondo.
Questi risultati sono particolarmente importanti perché il lavoro frontend non è solo un problema di generazione di codice. Un modello di grandi dimensioni capace deve essere in grado di interpretare esigenze visive, creare applicazioni funzionali, eseguirle, controllare i risultati e modificare l'implementazione quando l'interfaccia non corrisponde al design previsto.
Ricreazione di un'interfaccia in stile macOS basata su browser
Un esempio citato nell'articolo originale è la ricreazione di un'interfaccia in stile macOS 27 in circa sei ore utilizzando un cluster di agenti.
Il risultato non è solo uno screenshot statico. Il rapporto afferma che, ad eccezione di poche funzioni come il browser e il telefono, la maggior parte delle applicazioni e delle interazioni desktop funzionano correttamente.
Un'interfaccia browser generata da agenti che imita un moderno sistema operativo desktop.
Altre demo includono un simulatore di braccio robotico e un gioco 3D completamente programmatico basato su browser che utilizza Three.js e WebGPU.
Questi esempi rimangono dimostrativi, non benchmark standardizzati, ma mostrano il tipo di flusso di lavoro che Moonshot spera che K3 supporti: creazione di software lunga, visiva e iterativa.
Visione nel ciclo
Moonshot descrive il flusso di lavoro frontend di K3 come visione nel ciclo.
Il modello non genera codice e si ferma, ma è in grado di:
- Scrivere o modificare il codice dell'applicazione.
- Eseguire il progetto.
- Controllare screenshot in tempo reale o risultati renderizzati.
- Rilevare problemi di layout, colore, gerarchia o interazione.
- Modificare il codice.
- Rielaborare i risultati aggiornati e ripetere il processo.
Questo processo colma il divario tra generazione di codice e valutazione visiva.
Il modello potrebbe generare HTML, CSS e JavaScript sintatticamente validi, ma comunque produrre interfacce scadenti. Osservando l'output renderizzato, K3 può identificare problemi difficili da individuare solo dal codice sorgente.
Per repository frontend più grandi, il contesto di 100 milioni di token è cruciale. Può contenere un gran numero di componenti, definizioni di tipo, regole del sistema di design, documentazione del progetto e dipendenze tra file in un unico contesto di lavoro.
L'articolo originale menziona anche un compromesso: alcuni utenti riferiscono che attività frontend complesse richiedono dai 20 minuti a un'ora. Queste sono solo osservazioni individuali, non misurazioni controllate della latenza, ma indicano che K3
Potrebbe preferire iterazioni lunghe piuttosto che output immediati.
Benchmark di programmazione e ingegneria su cicli lunghi
La programmazione è uno dei punti di forza principali di Kimi K3.
La tabella dei benchmark nel report originale elenca i seguenti risultati:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |

Risultati riportati di Kimi K3 in diverse valutazioni di programmazione e ingegneria del software.
Il blog ufficiale di Kimi K3 fornisce importanti chiarimenti metodologici.
Per DeepSWE, Moonshot riporta nei suoi confronti principali i risultati del framework Kimi Code, mentre la classifica pubblica del mini-SWE-agent riporta un punteggio di 67.3. Possono quindi esserci piccole differenze a seconda del framework e delle impostazioni di valutazione.
Per SWE Marathon, Moonshot ha utilizzato il branch di calibrazione H20 dei task ufficiali. L'azienda segnala inoltre che Claude Fable 5 ha mostrato comportamenti di fallback in alcune valutazioni, il che potrebbe aver ridotto il suo punteggio misurato.
Questi dettagli non invalidano i risultati, ma sono importanti quando si confrontano i modelli. Il framework agente, i permessi degli strumenti, l'hardware, le impostazioni di inferenza, i comportamenti di fallback e la calibrazione dei task possono tutti influenzare il punteggio finale.
Ottimizzazione autonoma dei kernel GPU
Moonshot ha testato se Kimi K3 fosse in grado di ottimizzare kernel GPU con una supervisione umana minima.
Ogni modello ha ricevuto lo stesso ambiente sandbox e ha avuto al massimo 24 ore per analizzare, riscrivere, eseguire benchmark e ottimizzare i seguenti kernel correlati:
- Attention Residuals
- Kimi Delta Attention
- Un carico di lavoro MLA a 512 dimensioni di testa
- Una GPU generica di un altro fornitore
I test NVIDIA sono stati eseguiti su hardware H200.
Ottimizzazione AttnRes
Per il carico di lavoro Attention Residuals, il documento originale indica che K3 ha progettato un nuovo algoritmo di kernel a due fasi, riducendo
Il tempo combinato di esecuzione forward e backward da 283,6 ms a 114,4 ms.
Ciò corrisponde a un'accelerazione di circa il 59,7% rispetto alla baseline, portando Kimi K3 vicino al risultato di Claude Fable 5 nella configurazione sperimentale di Moonshot.

Grafico della traiettoria di miglioramento riportata da Kimi K3 nel task del kernel AttnRes.
Il grafico mostra anche il miglioramento dell'agente nel tempo. K3 ha ottenuto diversi progressi significativi all'inizio dell'esecuzione, continuando poi a ottimizzare il kernel attraverso iterazioni successive.
Kernel MLA-512
Nel task MLA-512 partendo da zero, il kernel di Kimi K3 ha raggiunto i 517,8 TFLOPS riportati sotto carico combinato forward e backward.
Il secondo risultato più alto mostrato nel report è di circa 492,7 TFLOPS.

Kimi K3 ha raggiunto i 517,8 TFLOPS riportati nel task di ottimizzazione MLA-512.
Moonshot afferma che, durante le fasi avanzate dello sviluppo del modello, le versioni iniziali di K3 hanno svolto la maggior parte del lavoro di ottimizzazione dei kernel per il team. Questo è un flusso di lavoro auto-riportato dall'azienda e non è stato verificato in modo indipendente nei materiali collegati alla fonte.
MiniTriton: un compilatore GPU costruito da zero
L'esperimento successivo va oltre l'ottimizzazione di singoli kernel.
Moonshot ha esplorato se Kimi K3 potesse costruire da zero un piccolo sistema di programmazione GPU. Il risultato è MiniTriton, un compilatore compatto simile a Triton, che include:
- Una propria rappresentazione intermedia a livello di tile
- Un layer IR basato su MLIR
- Un processo di ottimizzazione
- Una pipeline di generazione del codice PTX
- Supporto runtime per i kernel generati
Moonshot riporta che MiniTriton ha eguagliato o superato le prestazioni di Triton e torch.compile nei benchmark roofline supportati, risultando superiore a Triton in alcuni carichi di lavoro.

Prestazioni della roofline CUDA riportate da MiniTriton su GPU NVIDIA L20.
Il compilatore supporta anche l'addestramento end-to-end di nanoGPT e raggiunge una convergenza stabile. Secondo Moonshot, la curva di perdita rimane vicina all'implementazione di riferimento, con solo lievi deviazioni.
Questo è più significativo rispetto a benchmark isolati su micro-benchmark. Indica che il sistema generato è in grado di collegare il linguaggio front-end, la rappresentazione intermedia, la pipeline di ottimizzazione, la generazione PTX e il runtime in un flusso di lavoro coerente.
Tuttavia, al momento della stesura di questo articolo, Moonshot non ha ancora rilasciato pubblicamente il codice di MiniTriton. Pertanto, le dichiarazioni sulle prestazioni provengono dai materiali di presentazione di Kimi K3 e non sono ancora riproducibili tramite codice ufficialmente rilasciato.
Un chip progettato in 48 ore di esecuzione
Anche Kimi K3 è stato testato nella progettazione di chip.
In 48 ore di esecuzione autonoma, il modello ha costruito, ottimizzato e verificato un chip progettato per servire piccoli modelli basati sull'architettura K3, utilizzando strumenti EDA open-source e il kit di progettazione del processo Nangate 45nm.
Moonshot ha riportato i seguenti risultati di progettazione simulati:
- Area inferiore a 4 mm²
- 1,46 milioni di celle standard
- 0,277 MB di SRAM
- Timing chiuso a 100 MHz
- Throughput di decodifica simulato superiore a 8700 token al secondo
- Un array di moltiplicazione e accumulo INT4 con dequantizzazione fusa

Questo caso di studio sulla progettazione del chip riporta una velocità di elaborazione di oltre 8700 token al secondo in simulazione.
La differenza tra un progetto digitale verificato e un chip fisico effettivamente fabbricato è importante.
I materiali pubblici descrivono un esercizio di progettazione, ottimizzazione, timing e simulazione EDA. Non indicano che il chip sia stato tape-out, fabbricato, incapsulato e testato su silicio.
Anche con questa limitazione, completare una pipeline estesa di progettazione hardware è un notevole caso di codifica a lungo termine. Richiede che l'agente lavori in modo coordinato tra decisioni architetturali, descrizione hardware, sintesi, placement & routing, controllo timing, verifica e ottimizzazione iterativa.
Due innovazioni fondamentali alla base della scala 2.8T
Kimi K3 è costruito su due tecnologie sviluppate da Moonshot AI:
- Kimi Delta Attention
- Attention Residuals (Residui di Attenzione)
Il modello combina queste tecnologie con un'architettura a mistura di esperti ad attivazione più sparsa.

Kimi K3 combina KDA, residue di attenzione, Gated MLA e Stable LatentMoE.
Kimi Delta Attention
Kimi Delta Attention, abbreviato KDA, è progettato per rendere il meccanismo di attenzione più efficiente su sequenze lunghe.
KDA non si basa esclusivamente sull'attenzione completa standard sull'intero contesto, ma fornisce un meccanismo efficiente per elaborare input lunghi, preservando al contempo le informazioni necessarie per la codifica, il ragionamento e le attività degli agenti.
Questa è una delle basi del contesto di un milione di token del modello K3.
Meccanismo dei residui di attenzione
I livelli Transformer tradizionali aggiungono ripetutamente l'output di ogni nuovo livello allo stato nascosto accumulato.
Il meccanismo dei residui di attenzione (AttnRes) cambia questo modello. Consente ai livelli successivi di recuperare selettivamente rappresentazioni da diverse profondità, invece di trattare semplicemente tutti i livelli precedenti come parte di un flusso accumulato uniforme.
Moonshot lo descrive come un modo più flessibile di far fluire le informazioni in modelli ultra-profondi.
Architettura Stable LatentMoE
Kimi K3 ha 896 moduli esperti, ma ogni token attiva solo 16 esperti.
Questa estrema scarsità riduce il costo computazionale per token (rispetto alla scala complessiva del modello), ma aumenta anche la difficoltà di routing e bilanciamento del carico. Il framework Stable LatentMoE di Moonshot mira a mantenere la stabilità dell'addestramento in questa configurazione sparsa.
Bilanciamento quantile
I modelli a mistura di esperti devono distribuire i token tra gli esperti in modo equo, evitando il sovraccarico di pochi esperti.
K3 adotta la tecnica del bilanciamento quantile, che assegna gli esperti in base ai quantili dei punteggi del router, invece di fare affidamento su strategie di bilanciamento regolate manualmente. Moonshot afferma che ciò elimina ipertparametri sensibili di bilanciamento del carico, rendendo l'assegnazione degli esperti su larga scala più stabile.
Ottimizzatore per testa
K3 estende l'ottimizzatore Muon, implementando l'ottimizzazione Muon per testa.
Questo approccio scompone i parametri di attenzione in strutture indipendenti e li ottimizza separatamente per ogni testa di attenzione. L'obiettivo è fornire un comportamento di ottimizzazione più adattivo per ogni testa di attenzione durante l'addestramento su larga scala.
SiTU e Gated MLA
Due componenti aggiuntivi supportano il controllo dell'attivazione e dell'attenzione:
- Unità Sigmoid Tanh (SiTU) migliora il controllo dell'attivazione
- Gated MLA aumenta la flessibilità della selezione dell'attenzione
Combinando KDA, AttnRes, Stable LatentMoE, bilanciamento quantile e Muon per testa, Moonshot afferma che questi miglioramenti aumentano l'efficienza complessiva di scaling di circa 2,5 volte rispetto a Kimi K2.
Addestramento consapevole della quantizzazione e architettura di inferenza
Kimi K3 adotta l'addestramento consapevole della quantizzazione a partire dalla fase di Supervised Fine-Tuning.
Il blog tecnico ufficiale elenca:
- Pesi MXFP4
- Attivazioni MXFP8
L'obiettivo è migliorare la compatibilità tra diversi acceleratori hardware, mantenendo al contempo la possibilità di addestrare e distribuire modelli di queste dimensioni.
Moonshot suggerisce anche una distribuzione con supernodi di oltre 64 acceleratori per un'inferenza efficiente. Ciò indica chiaramente che pesi aperti non equivalgono a una distribuzione locale comoda: questo modello da 2,8 trilioni di parametri rimane un sistema ad alta intensità infrastrutturale.
Meccanismo di cache dei prefissi KDA
KDA introduce nuove sfide per la cache dei prefissi tradizionale.
Moonshot afferma di aver sviluppato un'implementazione della cache di prefilling corrispondente e di averla contribuita all'ecosistema vLLM. La sua API ufficiale riporta un tasso di hit della cache superiore al 90% nei carichi di lavoro di tipo codice.
Questo livello di cache spiega la grande differenza di prezzo tra input con e senza cache. L'implementazione sarà open-sourced insieme al modello, e gli sviluppatori potranno consultare gli annunci ufficiali di Kimi e vLLM.
Repository del codice attualmente disponibile e stato di integrazione.
Limitazioni note
Moonshot elenca tre importanti limitazioni di Kimi K3.
Sensibilità alla cronologia del ragionamento
La modalità di addestramento di K3 preserva la cronologia del ragionamento precedente del modello.
Se il framework dell'agente non restituisce la cronologia prevista completa, la qualità della generazione può diventare instabile. Quando gli utenti passano da altri modelli a K3 nel bel mezzo di una sessione attiva,
Lo stesso problema può verificarsi anche con K3.
Moonshot AI consiglia di utilizzare strumenti compatibili verificati (come Kimi Code) e di evitare di cambiare modello durante una sessione.
Eccessiva proattività
K3 è stato ampiamente addestrato su attività lunghe e complesse.
Di conseguenza, potrebbe reagire in modo eccessivo a problemi minori o istruzioni vaghe, prendendo decisioni non previste dall'utente.
Le applicazioni che richiedono confini rigorosi dovrebbero definirli esplicitamente nel prompt di sistema o nel file AGENTS.md.
Gap nell'esperienza utente
Moonshot AI afferma che, rispetto a Claude Fable 5 e GPT-5.6 Sol, K3 presenta ancora un notevole divario nell'esperienza utente.
Questa limitazione è preziosa: i punteggi dei benchmark e le demo di ingegneria autonoma non coprono tutti gli aspetti dell'esperienza di produzione, inclusi coerenza delle risposte, latenza, interpretazione delle istruzioni, affidabilità degli strumenti e fluidità della conversazione.
Disponibilità e stato dei pesi aperti
Kimi K3 è disponibile tramite:
Al lancio, K3 utilizza l'intensità di pensiero massima per impostazione predefinita. Moonshot AI afferma che gli aggiornamenti futuri aggiungeranno opzioni di intensità di pensiero inferiori e superiori.
L'azienda ha annunciato che i pesi completi del modello saranno rilasciati entro il 27 luglio 2026. Fino a quando questi pesi e il report tecnico non saranno resi pubblici, parte dell'architettura, le impostazioni dei benchmark, l'implementazione MiniTriton e il flusso di progettazione del chip si basano ancora sulle descrizioni pubblicate da Moonshot AI.

Kimi K3 porta la scala del modello aperto riportata da Moonshot AI a 2,8 trilioni di parametri.
Domande frequenti
Cos'è Kimi K3?
Kimi K3 è un modello multimodale nativo da 2,8 trilioni di parametri sviluppato da Moonshot AI, adatto per coding a lungo ciclo, lavoro di conoscenza, ragionamento visivo e attività agente. Supporta una finestra di contesto di 1 milione di token, attivando 16 su 896 esperti per token.
Kimi K3 è open source?
Moonshot AI definisce K3 un modello open source di livello 3T e ha annunciato che i pesi completi del modello saranno rilasciati entro il 27 luglio 2026. Al momento della stesura di questo articolo, il rilascio dei pesi completi e il report tecnico di K3 non sono ancora stati completati.
Quanto costa l'API di Kimi K3?
I prezzi internazionali dell'API Kimi sono: $0,30 per milione di token di input in cache, $3,00 per milione di token di input non in cache e $15,00 per milione di token di output. I prezzi sono soggetti a modifiche.
Pertanto, gli utenti in produzione dovrebbero verificare le tariffe correnti sulla piattaforma API ufficiale.
Le capacità di frontend coding di Kimi K3 sono davvero al primo posto?
Kimi K3 è temporaneamente al primo posto nella classifica Arena WebDev al momento del rilascio. Con l'aggiunta di più voti e modelli, la classifica cambia dinamicamente, quindi per la classifica più recente si prega di fare riferimento alla pagina Arena in tempo reale.
Cos'è MiniTriton?
MiniTriton è un compilatore GPU compatto che Moonshot AI afferma essere stato costruito da zero da Kimi K3. Include una rappresentazione intermedia a livello di blocco basata su MLIR, passaggi di ottimizzazione, una pipeline di generazione del codice PTX e supporta l'allenamento end-to-end di nanoGPT.
Kimi K3 ha prodotto un chip fisico?
Non ci sono informazioni ufficiali sulla fabbricazione fisica. Moonshot AI descrive un'esecuzione di automazione della progettazione elettronica (EDA) autonoma di 48 ore che ha completato la progettazione, l'ottimizzazione, la verifica e la simulazione del chip utilizzando la libreria Nangate 45nm.
Kimi K3 può essere eseguito localmente?
Il modello è estremamente grande. Moonshot AI suggerisce che per un'inferenza efficiente, la configurazione di distribuzione richiede almeno 64 acceleratori. Anche dopo il rilascio dei pesi aperti, l'esecuzione locale richiede ancora un'infrastruttura specializzata significativa o una distribuzione pesantemente modificata.
Quali sono i principali limiti di Kimi K3?
Moonshot AI sottolinea la sua sensibilità alla cronologia dei pensieri trattenuti, un'eccessiva proattività in attività ambigue e un divario nell'esperienza utente rispetto a Claude Fable 5 e GPT-5.6 Sol. Si raccomandano vincoli espliciti dell'agente e framework di adattamento compatibili.
Strumenti correlati
- Kimi: Lo spazio di lavoro agente di Moonshot AI, che può utilizzare Kimi K3 in flussi di lavoro di coding, ricerca, documenti, diapositive e visualizzazione.
- Kimi Code: L'agente di coding da terminale open source di Moonshot AI, anche il framework di adattamento K3 consigliato.
- Piattaforma API Kimi: Il servizio API ufficiale per accedere a
kimi-k3e altri modelli Kimi. - Classifica Arena WebDev: Classifica delle votazioni della community in tempo reale per modelli di frontend e sviluppo web.
- Triton: Linguaggio e compilatore open source per scrivere kernel GPU ad alte prestazioni.
- MLIR: Infrastruttura del compilatore riutilizzabile di LLVM per la costruzione di rappresentazioni intermedie e pipeline di ottimizzazione.
- vLLM: Motore di inferenza LLM open source che supporta inferenza ad alto rendimento e caching dei prefissi.
- OpenROAD: Toolchain open source RTL-to-GDSII associata al flusso di progettazione automatizzata di chip.
Link correlati
- Blog tecnico ufficiale di Kimi K3: L'articolo di lancio di Moonshot AI, che copre architettura, casi di coding, prezzi, disponibilità, valutazione e limiti.
- Piattaforma API Kimi K3: Fonte ufficiale corrente per l'accesso e i prezzi dell'API K3.
- Repository GitHub di Kimi Code: Repository ufficiale dell'agente di coding e documentazione di installazione.
- Classifica Arena WebDev: Classifica attuale dei modelli frontend e dati di voto.
- Classifica DeepSWE: Benchmark pubblico di ingegneria del software citato nel report di valutazione di Moonshot AI.
- Program Bench: Benchmark di programmazione utilizzato nei confronti di coding di K3.
- SWE Marathon: Benchmark di ingegneria del software a lungo ciclo citato da Moonshot AI.
Panoramica
Kimi K3 è il modello più grande di Moonshot AI fino ad oggi, con un totale di 2,8
8 trilioni di parametri, supporto nativo per input multimodali, finestra di contesto di 1 milione di token e attivazione sparsa di 16 su 896 esperti.
I risultati iniziali più evidenti si manifestano nel campo dell'ingegneria a lungo ciclo. K3 si è classificato primo nella classifica preliminare del Frontend Code Arena, ha ottimizzato i kernel GPU, ha costruito il compilatore MiniTriton e ha completato un flusso di lavoro di progettazione di chip analogici della durata di 48 ore utilizzando strumenti EDA open-source.
L'architettura integra il meccanismo di attenzione Kimi Delta, connessioni residue di attenzione, MoE latente stabile, bilanciamento quantile, ottimizzatore Muon per testa, SiTU e MLA con gate. Moonshot AI riferisce che l'efficienza di scaling è migliorata di 2,5 volte rispetto a Kimi K2, riconoscendo al contempo importanti limitazioni in termini di compatibilità con agenti, proattività ed esperienza utente complessiva.
La dichiarazione più importante di Kimi K3 non è di aver vinto tutti i benchmark, ma di mantenere un'elevata produttività in compiti ingegneristici eccezionalmente lunghi, guidati visivamente e dipendenti da catene di strumenti.