Kimi K3 sospende le nuove sottoscrizioni dopo che la domanda ha spinto la capacità GPU al limite

Kimi K3 era disponibile da sole circa 48 ore quando Moonshot AI ha annunciato che avrebbe temporaneamente smesso di accettare nuove sottoscrizioni consumer.

发布于 2026年7月22日generalGEO 评分: 03 次阅读
Immagine di copertina dell’articolo “Kimi K3 sospende le nuove sottoscrizioni dopo che la domanda ha spinto la capacità GPU al limite”

Kimi K3 sospende le nuove sottoscrizioni dopo che la domanda ha spinto la capacità GPU al limite

Introduzione

Kimi K3 era disponibile da sole circa 48 ore quando Moonshot AI ha annunciato che avrebbe temporaneamente smesso di accettare nuove sottoscrizioni consumer.

Il motivo non era un cambiamento programmato del prodotto o una mancanza di domanda. Era esattamente il contrario. Secondo Moonshot, le richieste per Kimi K3 sono aumentate ben oltre le previsioni e si sono avvicinate al limite di capacità dei suoi attuali cluster di calcolo.

Agli utenti paganti esistenti è stato permesso di continuare a utilizzare il servizio. Moonshot ha dichiarato che avrebbe destinato le risorse di calcolo disponibili agli abbonati attuali mentre espandeva la capacità, per poi riaprire nuovi posti per le sottoscrizioni in lotti.

Illustrazione di Kimi K3 che sospende nuove sottoscrizioni dopo che la domanda ha portato la capacità GPU al limite

Avviso del 19 luglio di Moonshot che spiega la carenza di potenza di calcolo e la sospensione temporanea delle sottoscrizioni.

Il problema improvviso di capacità è seguito a un lancio insolitamente forte per Kimi K3, un modello multimodale nativo da 2,8 trilioni di parametri progettato per coding a lungo termine, creazione visiva, lavoro conoscitivo e attività basate su agenti.

Moonshot descrive K3 come il primo modello aperto di classe 3T. Il suo articolo di lancio afferma inoltre che i pesi completi del modello sono previsti per il rilascio entro il 27 luglio 2026, quindi "aperto" al lancio dovrebbe essere inteso nel contesto di quella tempistica di rilascio annunciata.

Kimi K3 è Diventato Popolare in Due Giorni

L'impennata della domanda è più facile da comprendere se vista insieme alle prestazioni iniziali del modello e al volume di dimostrazioni degli utenti apparse subito dopo il lancio.

Kimi K3 è entrato nel mercato con una finestra di contesto da 1 milione di token, capacità visiva nativa e un'architettura sparse Mixture-of-Experts con 2,8 trilioni di parametri totali. È progettato per attività che possono continuare per lunghi periodi e richiedono chiamate di strumenti ripetute, esecuzione di codice, ispezione visiva o ragionamento multi-step.

Il blog tecnico di Moonshot riconosce che K3 è ancora in ritardo rispetto a Claude Fable 5 e GPT-5.6 Sol nelle prestazioni complessive. Allo stesso tempo, il modello ha ottenuto risultati forti in diverse valutazioni di coding e orientate agli agenti.

Primo Posto nella Classifica Preliminare Frontend Code Arena

Al momento coperto dal rapporto originale, Kimi K3 deteneva il primo posto nella classifica preliminare WebDev di Arena con un punteggio di circa 1.679.

La classifica live del 21 luglio mostrava Kimi K3 al primo posto con un punteggio preliminare di 1.678, davanti a Claude Fable 5 e GPT-5.6 Sol.

Illustrazione di Kimi K3 che sospende nuove sottoscrizioni dopo che la domanda ha portato la capacità GPU al limite

Risultato preliminare di Kimi K3 al primo posto nella classifica di sviluppo frontend di Arena.

Le valutazioni frontend sono utili perché testano più della semplice capacità di un modello di produrre codice valido. Un buon risultato richiede spesso che il modello comprenda un obiettivo visivo, crei un'interfaccia funzionante, ispezioni l'output renderizzato e riveda il

implementazione.

Kimi K3 è progettato per questo tipo di flusso di lavoro "visione nel ciclo". Può muoversi tra codice sorgente e screenshot dal vivo, utilizzando il risultato renderizzato come feedback per un altro passaggio di sviluppo.

Poiché la classifica si basa su votazioni in corso, i punteggi e le posizioni possono cambiare. La pagina live di Arena dovrebbe essere considerata la fonte corrente, piuttosto che qualsiasi grafica statica di lancio.

Risultati di Codifica Forti ma Misti

Il rapporto originale ha anche evidenziato tre valutazioni di ingegneria del software:

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol
DeepSWE 67,5 70,0 73,0
Program Bench 77,8 76,8 77,6
SWE Marathon 42,0 35,0 39,0

Illustrazione di Kimi K3 che sospende nuove sottoscrizioni dopo che la domanda ha portato la capacità GPU al limite

Risultati riportati di Kimi K3 nei benchmark di codifica e ingegneria del software a lungo orizzonte.

I risultati mostrano un quadro più equilibrato rispetto a una semplice affermazione di "modello migliore".

K3 è rimasto indietro rispetto a Claude Fable 5 e GPT-5.6 Sol su DeepSWE, ha superato leggermente su Program Bench e ha raggiunto il punteggio più alto riportato nel confronto SWE Marathon di Moonshot.

La metodologia del benchmark è importante qui. Moonshot ha utilizzato diversi harness di agenti a seconda del modello e nota che la sua valutazione SWE Marathon ha utilizzato un ramo calibrato H20 dei compiti ufficiali. Inoltre, riporta che Claude Fable 5 ha incontrato un comportamento di fallback in parte di quella valutazione.

Queste differenze non rendono i risultati inutili, ma significano che i punteggi provenienti da diversi harness non dovrebbero essere trattati come condizioni di laboratorio perfettamente identiche.

Gli Sviluppatori Hanno Rapidamente Trasformato Kimi K3 in un Parco Giochi Creativo

Le classifiche erano solo una parte del lancio. Gli sviluppatori hanno anche iniziato a pubblicare siti web, strumenti interattivi, giochi, scene 3D ed esperimenti visivi creati con K3.

Un esempio presentava un gioco open-world che un utente ha detto sarebbe stato difficile immaginare di generare da un prompt solo pochi mesi prima.

Illustrazione di Kimi K3 che sospende nuove sottoscrizioni dopo che la domanda ha portato la capacità GPU al limite

Dimostrazione di un utente di un gioco open-world creato con Kimi K3.

Un altro utente ha confrontato Kimi K3 e Claude Opus 4.8 sul compito di generare un ambiente di magazzino virtuale. Nel confronto pubblicato, il risultato di Kimi conteneva più illuminazione, oggetti, struttura ambientale e dettagli visibili.

Illustrazione di Kimi K3 che sospende nuove sottoscrizioni dopo che la domanda ha portato la capacità GPU al limite

Confronto pubblicato da un utente di scene di magazzino virtuale generate da due modelli.

Questi esempi sono dimostrazioni aneddotiche piuttosto che benchmark controllati. La formulazione del prompt, la configurazione dell'agente, l'accesso agli strumenti, i limiti di tempo e l'intervento manuale possono tutti influenzare l'output.

Tuttavia, la rapida comparsa

Questi progetti hanno contribuito ad alimentare l'interesse. Gli utenti non si limitavano a porre domande a K3; molti svolgevano lunghe sessioni di programmazione che coinvolgevano la creazione, il rendering, il test e la revisione di progetti sostanziosi.

Questa distinzione è importante per l'infrastruttura.

Una breve risposta da chatbot può richiedere una singola richiesta modello. Un agente di programmazione può leggere ripetutamente file, pianificare, scrivere codice, chiamare strumenti, eseguire comandi, ispezionare risultati e iniziare un altro ciclo di ragionamento. Un singolo compito utente può quindi consumare una capacità di inferenza molto maggiore rispetto a una conversazione convenzionale.

Il volume delle richieste si è avvicinato al limite del cluster esistente

Il 19 luglio, Moonshot ha dichiarato che Kimi K3 aveva ricevuto molto più interesse del previsto.

Nelle precedenti 48 ore, le richieste degli utenti avevano superato nettamente le previsioni e si stavano avvicinando al limite di capacità dei cluster esistenti dell'azienda.

Kimi K3 sospende i nuovi abbonamenti dopo che la domanda ha portato la capacità GPU al limite illustrazione

Moonshot ha affermato che la domanda si era avvicinata al limite della sua attuale capacità di calcolo.

Quando troppe richieste di inferenza raggiungono un cluster contemporaneamente, possono sorgere diversi problemi:

  • Le risposte potrebbero diventare più lente.
  • Le richieste potrebbero mettersi in coda.
  • Le attività degli agenti a lunga esecuzione potrebbero occupare capacità per periodi prolungati.
  • Gli utenti potrebbero riscontrare timeout o guasti temporanei del servizio.
  • Il fornitore potrebbe dover limitare l'accesso per proteggere la qualità del servizio.

Kimi K3 rende il problema più difficile a causa delle sue dimensioni e del focus del prodotto.

Il modello contiene 2,8 trilioni di parametri totali, e molti dei suoi casi d'uso più interessanti coinvolgono contesti lunghi, ripetuti ragionamenti, screenshot, operazioni su file e chiamate a strumenti. Sebbene la sua architettura sparsa attivi solo una parte del modello completo per ogni token, servirlo ad alto volume richiede comunque un'infrastruttura sostanziale.

Moonshot ha quindi annunciato tre misure immediate:

  1. Sospendere i nuovi abbonamenti consumer.
  2. Dare priorità al calcolo per i membri paganti esistenti.
  3. Espandere la capacità e riaprire gradualmente i posti per gli abbonamenti.

Non si prevedeva che gli abbonati attuali perdessero i loro benefici esistenti a causa della sospensione temporanea.

Nota sullo stato: La sospensione si applicava ai nuovi abbonamenti consumer, non necessariamente a ogni account gratuito, prodotto API, accordo aziendale o abbonamento esistente. La disponibilità del prodotto può cambiare rapidamente, quindi gli utenti dovrebbero controllare le pagine ufficiali dei prezzi e degli abbonamenti di Kimi per lo stato attuale.

Gli abbonamenti Kimi e Kimi Code verranno separati

Moonshot ha anche affermato che la sua futura struttura degli abbonamenti cambierà.

L'azienda prevede di separare i vantaggi principali di Kimi, inclusi Kimi Web, l'app Kimi e Kimi Work, dai vantaggi di Kimi Code.

Ciò indica due diverse categorie di utilizzo.

Utilizzo Generale di Kimi

L'abbonamento principale Kimi è pensato per una più ampia produttività personale, tra cui:

  • Conversazioni generali
  • Lavoro di ricerca e conoscenza
  • Documenti e presentazioni
  • Compiti visivi e multimodali
  • Flussi di lavoro dell'agente Kimi Work

Utilizzo di Kimi Code

Kimi Code è progettato per compiti sostenuti di ingegneria del software,

inclusi:

  • Leggere e modificare repository
  • Eseguire comandi nel terminale
  • Eseguire il debug e il refactoring
  • Utilizzare strumenti di sviluppo
  • Avviare sottoagenti
  • Gestire sessioni di codifica lunghe

Il profilo computazionale di questi prodotti può essere molto diverso.

Uno sviluppatore potrebbe lasciare un agente di codifica in esecuzione mentre esplora un repository, modifica diversi file, esegue test, analizza i fallimenti e ripete il ciclo. Separare i piani offre a Moonshot un maggiore controllo sui limiti di velocità, sui prezzi e sull'allocazione delle risorse per utenti con carichi di lavoro sostanzialmente diversi.

L'annuncio non ha fornito prezzi finali, quote o una data confermata per il nuovo sistema di abbonamento.

La sfida infrastrutturale dietro la pausa

La sospensione degli abbonamenti evidenzia un problema più ampio per i fornitori di IA avanzata: il lancio di un modello di successo può generare una domanda più rapidamente di quanto l'infrastruttura fisica possa essere ampliata.

Aumentare la capacità non è semplice come aggiornare un'impostazione software. I fornitori potrebbero dover ottenere acceleratori, distribuire server, collegare reti e storage, configurare il software di inferenza, validare l'affidabilità e riequilibrare il traffico tra i cluster.

Kimi ha precedentemente pubblicato ricerche su Mooncake, la sua architettura di servizio incentrata sulla cache KV. Il sistema separa i carichi di lavoro di prefill e decoding e utilizza memoria CPU distribuita, DRAM e risorse SSD per migliorare l'efficienza del servizio per contesti lunghi.

Il documento su Mooncake riporta che l'architettura ha permesso a Kimi di gestire il 75% di richieste in più nei carichi di lavoro reali testati all'epoca.

Kimi K3 crea una sfida nuova e più grande. Un servizio più efficiente può aumentare il lavoro gestito dall'hardware esistente, ma non elimina la necessità di ulteriore potenza di calcolo fisica quando la domanda aumenta in modo sufficientemente brusco.

Ecco perché la pausa temporanea è meglio interpretata come una decisione di gestione della capacità. Moonshot ha scelto di limitare la nuova domanda a pagamento piuttosto che continuare a vendere abbonamenti che i suoi attuali cluster potrebbero non servire in modo affidabile.

Crescita dei ricavi e preparazione all'IPO

Il rapporto originale collega la popolarità di K3 al più ampio slancio commerciale di Moonshot AI.

Secondo rapporti di stampa che citano persone a conoscenza dell'azienda, le vendite giornaliere di Moonshot sono aumentate di almeno sei volte dopo il lancio di K3.

Un rapporto di Bloomberg ha anche affermato che i ricavi annuali ricorrenti di Moonshot hanno raggiunto circa 300 milioni di dollari a giugno 2026**, in aumento rispetto ai 200 milioni di dollari di aprile.

I ricavi annuali ricorrenti non sono la stessa cosa dei ricavi annuali certificati da revisione contabile. Si tratta di una metrica previsionale basata sugli attuali ricavi da abbonamenti e contratti.

I rapporti hanno anche affermato che Moonshot aveva distribuito una risoluzione degli azionisti cercando sostegno per una quotazione a Hong Kong e potrebbe perseguire un'IPO entro circa sei mesi.

Reuters ha riportato separatamente che:

  • Moonshot stava sciogliendo la sua struttura offshore in vista di una potenziale IPO a Hong Kong.
  • L'azienda aveva ingaggiato consulenti, tra cui Goldman Sachs e China International Capital Corporation.
  • Aveva raccolto più di 2 miliardi di dollari a maggio.
  • La raccolta fondi storica totale aveva superato i 5,5 miliardi di dollari.
  • La sua valutazione ha raggiunto circa 30 miliardi di dollari a giugno.
  • Aveva iniziato a cercare altri 2 miliardi di dollari.

Questi dettagli erano

segnalato attraverso fonti anonime o materiali di raccolta fondi, piuttosto che tramite una presentazione ufficiale di Moonshot. L'azienda ha rifiutato di commentare con Reuters in merito al processo di IPO.

Successive notizie provenienti da Bloomberg hanno affermato che Moonshot stava discutendo un round di finanziamento pre-IPO con una valutazione fino a 50 miliardi di dollari. Tale cifra rappresenta un obiettivo in discussione, non un finanziamento completato o una valutazione di mercato pubblico confermata.

Perché il tempismo è importante

Le performance del modello, la domanda degli utenti, la crescita dei ricavi, la raccolta fondi e i preparativi per la quotazione sono arrivati quasi contemporaneamente.

Per una startup di intelligenza artificiale, questa combinazione può rafforzare la narrazione presentata agli investitori:

  • Il modello mostra un evidente slancio tecnico.
  • Gli utenti stanno attivamente provando il prodotto.
  • La domanda è sufficientemente forte da creare un problema di capacità.
  • I ricavi da abbonamenti e API sono in crescita.
  • L'azienda ha una strada verso capitali aggiuntivi.

Allo stesso tempo, la carenza di potenza di calcolo rivela il costo di questa crescita.

Un modello di codifica potente è costoso da gestire. Più le sue funzionalità di agente hanno successo, più è probabile che gli utenti avviino carichi di lavoro di lunga durata anziché brevi chat.

Ciò crea un difficile equilibrio. Moonshot ha bisogno di capacità sufficiente per preservare l'esperienza utente, ma deve anche gestire il costo del capitale per aggiungere rapidamente hardware.

La decisione di sospendere la vendita di nuovi abbonamenti consumer, almeno temporaneamente, suggerisce che l'affidabilità per gli utenti esistenti ha avuto la priorità rispetto alla massimizzazione della crescita immediata degli abbonamenti.

Cosa devono sapere gli utenti esistenti e nuovi

Per gli abbonati a pagamento esistenti, Moonshot ha dichiarato che i vantaggi del servizio rimarranno disponibili e che l'attuale carenza non rimuoverà i loro diritti di abbonamento.

Per le persone che non si erano ancora iscritte, la situazione pratica era diversa:

  • I nuovi abbonamenti consumer erano temporaneamente non disponibili.
  • Ulteriori posti sarebbero stati riaperti a lotti con l'aumento della capacità di calcolo.
  • I futuri piani generali Kimi e Kimi Code sarebbero stati separati.
  • I dettagli finali del piano non erano ancora stati annunciati.

Gli sviluppatori che necessitano di accesso programmatico possono ancora controllare la piattaforma API Kimi. La disponibilità delle API, i prezzi e i limiti di velocità sono gestiti separatamente dagli abbonamenti consumer e possono seguire regole di capacità diverse.

L'API Kimi attualmente elenca K3 a:

Tipo di utilizzo Prezzo per milione di token
Input in cache $0,30
Input non in cache $3,00
Output $15,00

Questi prezzi sono le attuali quotazioni della piattaforma al momento in cui questo file è stato preparato e potrebbero cambiare successivamente.

Domande frequenti

Perché Kimi ha sospeso i nuovi abbonamenti?

Moonshot ha dichiarato che la domanda per Kimi K3 è stata di gran lunga superiore alle sue previsioni e ha raggiunto il limite di capacità dei suoi cluster di calcolo esistenti. L'azienda ha sospeso i nuovi abbonamenti consumer per poter dare priorità all'esperienza degli attuali membri a pagamento.

Gli abbonati Kimi esistenti sono interessati?

Moonshot ha dichiarato che gli abbonati esistenti manterranno i loro vantaggi e non saranno influenzati dalla sospensione degli abbonamenti. La velocità effettiva del servizio potrebbe comunque variare durante periodi di domanda eccezionalmente elevata.

Quando Kimi riaprirà i nuovi abbonamenti?

Non è stata annunciata una data fissa di riapertura. Moonshot ha dichiarato che aumenterà la capacità di calcolo e rilascerà nuovi

iscrizioni a lotti fino alla ripresa delle sottoscrizioni normali.

Kimi K3 è ancora gratuito?

La sospensione riguardava le nuove sottoscrizioni consumer, non necessariamente ogni forma di accesso. L'accesso gratuito, l'accesso tramite API Kimi, i prodotti aziendali e le sottoscrizioni esistenti possono avere limiti e regole di disponibilità separati.

Perché Kimi K3 richiede così tanta potenza di calcolo?

K3 è un modello con 2,8 trilioni di parametri progettato per contesti lunghi, input multimodali, agenti di codifica e uso ripetuto di strumenti. I flussi di lavoro di codifica possono generare molte chiamate sequenziali al modello durante un singolo compito utente, aumentando la richiesta totale di inferenza.

Cosa cambierà con i piani di abbonamento di Kimi?

Moonshot ha dichiarato di voler separare i vantaggi generali di Kimi da quelli di Kimi Code. Questo permetterà all'azienda di assegnare prezzi, limiti di utilizzo e risorse di calcolo diversi per utenti generici e utenti intensivi di agenti di codifica.

Kimi K3 è il miglior modello di frontend per la codifica?

Kimi K3 ha ottenuto il primo posto nella classifica preliminare WebDev di Arena al momento della pubblicazione. I risultati di Arena vengono aggiornati continuamente, quindi è necessario controllare la classifica live per la posizione più recente.

Moonshot AI andrà sicuramente in borsa entro sei mesi?

Non è stata confermata alcuna IPO definitiva. I media riferiscono che Moonshot si sta preparando per un'eventuale quotazione a Hong Kong e ha discusso una tempistica di circa sei mesi, ma Reuters ha notato che il calendario rimane flessibile.

Strumenti correlati

  • Kimi: Area di lavoro principale di Moonshot AI per conversazioni, ricerche, compiti visivi e flussi di agenti basati su K3.
  • Kimi Work: Ambiente generico di Kimi per documenti, slide, ricerche e lavori multi-step.
  • Kimi Code: Prodotto agente di codifica di Moonshot per terminali, repository, debug e compiti di ingegneria di lunga durata.
  • Kimi API Platform: Servizio API ufficiale per Kimi K3 e altri modelli Moonshot.
  • Kimi Membership Pricing: Pagina ufficiale per la disponibilità attuale degli abbonamenti consumer e informazioni sui piani.
  • Arena WebDev Leaderboard: Classifica live basata sul voto comunitario per i modelli di sviluppo frontend.
  • DeepSWE: Benchmark pubblico di ingegneria software citato nella valutazione tecnica di K3.
  • SWE Marathon: Benchmark focalizzato su compiti di ingegneria software a lungo termine.

Link correlati

Classifica attuale del frontend Kimi K3 e conteggio dei voti.

  • Kimi API Platform: prezzi ufficiali dell'API K3, documentazione e informazioni di accesso.
  • Kimi Code: informazioni ufficiali sul prodotto e guida all'installazione per l'agente di codifica.
  • Mooncake Research Paper: ricerca di Moonshot sull'architettura di servizio incentrata sulla cache KV utilizzata per i carichi di lavoro di Kimi.

Sommario

Il lancio di Kimi K3 ha generato una domanda sufficiente a spingere i cluster GPU esistenti di Moonshot AI vicino al loro limite di capacità in circa 48 ore. L'azienda ha risposto sospendendo temporaneamente le nuove sottoscrizioni dei consumatori e dando priorità agli abbonati paganti esistenti.

L'impennata è seguita a forti risultati di codifica, una posizione preliminare di primo posto nella classifica frontend di Arena e un'ondata di siti web, giochi e applicazioni 3D creati dagli utenti. Le attività di codifica e agenti di lunga durata consumano inoltre una capacità di inferenza considerevolmente maggiore rispetto alle normali sessioni di chat.

Moonshot prevede di separare l'abbonamento generale Kimi dai vantaggi di Kimi Code, ottenendo un maggiore controllo sull'allocazione del calcolo e sui prezzi futuri. Allo stesso tempo, i rapporti dei media indicano una rapida crescita dei ricavi, nuove discussioni di raccolta fondi e preparativi per una possibile IPO a Hong Kong, sebbene questi dettagli finanziari rimangano in gran parte basati su fonti anonime.

Il lancio ha dimostrato entrambi i lati della domanda di IA all'avanguardia: Kimi K3 ha attirato rapidamente gli utenti, ma servire affidabilmente quegli utenti è diventato un'immediata sfida infrastrutturale.