Kimi K3 agora com pesos abertos: Explore o modelo de fronteira de 2,8 trilhões de parâmetros da IA da Face Oculta da Lua

A IA da Face Oculta da Lua cumpriu sua promessa e lançou os pesos completos do Kimi K3, seu maior e mais ambicioso modelo até o momento. O modelo já está disponível nas páginas oficiais do Hugging Face e GitHub da IA da Face Oculta da Lua, acompanhado de um relatório técnico detalhado e um projeto de infraestrutura complementar. O Kimi K3 é um modelo nativo multimodal de especialistas mistos, com 2,8 trilhões de parâmetros totais, aproximadamente 104 bilhões de parâmetros ativados por token e uma janela de contexto de 1 milhão de tokens. A Face Oculta

发布于 2026年7月30日generalGEO 评分: 04 次阅读
Esta imagem é um visual promocional do lançamento do grande modelo Kimi K3 pela IA da Face Oculta da Lua, com um fundo preto profundo e um design tecnológico em tons de azul e roxo. O texto branco 'Kimi K3 Is Now Open-Weight' é destacado no centro, com o logotipo semitransparente 'Kimi' acima e o nome da marca 'moonshot AI' abaixo. À direita, há um ícone de cadeado tecnológico roxo brilhante, com padrões de conexão de nós geométricos em sua superfície, flutuando em uma plataforma com um halo, cercado por rastros de luz pontilhados. À esquerda, há um cartão de modelo com símbolos de código, destacando o recurso de pesos abertos deste modelo de fronteira de 2,8 trilhões de parâmetros.

Pesos do Kimi K3 agora disponíveis: Explorando o modelo de fronteira de 2,8 trilhões de parâmetros da Moonshot AI

Introdução

A Moonshot AI cumpriu sua promessa e lançou oficialmente os pesos completos de seu maior e mais ambicioso modelo até hoje — o Kimi K3.

O modelo já está disponível para download através das páginas oficiais da Moonshot AI no Hugging Face e no GitHub, acompanhado de um relatório técnico detalhado e um projeto de infraestrutura complementar.

O Kimi K3 é um modelo nativo multimodal do tipo Mixture of Experts, com 2,8 trilhões de parâmetros totais, aproximadamente 104 bilhões de parâmetros ativos por token e uma janela de contexto de 1 milhão de tokens.

A Moonshot o posiciona como um modelo de fronteira com pesos abertos, projetado para programação de longo ciclo, pesquisa, compreensão multimodal, trabalho de conhecimento agente e tarefas de raciocínio que podem abranger centenas ou milhares de etapas.

A importância deste lançamento se manifesta de duas maneiras.

Primeiro, o próprio modelo eleva a escala de pesos abertos para o nível de 3 trilhões de parâmetros.

Segundo, a Moonshot divulgou muito mais do que apenas os checkpoints do modelo. Os materiais públicos descrevem detalhadamente sua arquitetura, estratégias de pós-treinamento, infraestrutura de aprendizado por reforço para contextos longos, sistema de treinamento paralelo de especialistas, otimização de inferência, resultados de benchmarks e vários estudos de caso de engenharia de longa duração.

Esta imagem mostra a página do projeto GitHub da Moonshot AI para o lançamento do modelo open-source Kimi K3, com o branch principal do projeto, 1 branch, 0 tags, e o commit mais recente sendo o inicial há 7 minutos. A página mostra que o projeto contém uma pasta assets, um arquivo LICENSE, um arquivo README.md e um arquivo de relatório técnico chamado k3_tech_report.pdf. Estes são os materiais complementares que acompanham o Kimi K3, mencionados no documento. Os usuários podem acessar o conteúdo relacionado ao código do projeto através do botão "Code".

Pesos completos do Kimi K3 agora disponíveis

A Moonshot anunciou anteriormente o lançamento do Kimi K3 e prometeu divulgar os pesos completos até 27 de julho de 2026.

O lançamento já foi concluído.

O modelo oficial pode ser obtido através dos seguintes canais:

O repositório do GitHub contém um arquivo README, a licença do Kimi K3, o relatório técnico completo, recursos de arquitetura e benchmarks, guias de implantação e instruções de uso do modelo.

O cartão do modelo no Hugging Face fornece a configuração do modelo e acesso aos pesos publicados.

Isso significa que o modelo passou de um sistema de fronteira hospedado com lançamento planejado para um modelo que pesquisadores e equipes de infraestrutura qualificadas podem realmente baixar, inspecionar, implantar, ajustar e adaptar, de acordo com os termos da licença do Kimi K3.

A imagem mostra informações relacionadas ao Kimi K3. O Kimi K3 está disponível hoje em Kimi.com, Kimi Work, Kimi Code e Kimi API. No lançamento, o Kimi K3 usará o esforço máximo de pensamento por padrão, e atualizações futuras introduzirão modos de esforço baixo-alto. Atualmente, estamos trabalhando em estreita colaboração com parceiros de inferência e mantenedores de código aberto para garantir consistência técnica e uma implantação confiável do ecossistema. Os pesos completos do modelo serão lançados em 27 de julho de 2026, e os detalhes da arquitetura, treinamento e avaliação serão publicados junto com o relatório técnico do Kimi K3.

O que significa "aberto" no Kimi K3

O Kimi K3 é melhor descrito como um modelo de pesos abertos com código e documentação públicos.

A licença concede direitos amplos, permitindo que os usuários usem, copiem, modifiquem, ajustem, implantem, criem obras derivadas, redistribuam, sublicenciem e vendam cópias, de acordo com os termos da licença.

No entanto,

A licença inclui requisitos comerciais adicionais.

Por exemplo, uma empresa que opera um negócio de Model-as-a-Service qualificado e que tenha receita total superior a US$ 20 milhões em um período contínuo de 12 meses deve primeiro firmar um acordo separado com a Moonshot AI antes de usar o Kimi K3 ou seus derivados para fins comerciais.

A licença também impõe requisitos de exibição para certos produtos ou serviços comerciais muito grandes que excedam limites especificados de usuários ou receita.

O uso interno e o uso através dos produtos oficiais da Moonshot ou parceiros de inferência certificados serão tratados de forma diferente.

Portanto, qualquer pessoa que pretenda usar o Kimi K3 para fins comerciais deve ler atentamente a licença real, em vez de assumir que ela é igual ao Apache 2.0, MIT ou outras licenças permissivas padrão.

Um modelo de 2,8 trilhões de parâmetros com 104B de parâmetros ativos

A capacidade total do Kimi K3 é extremamente grande, mas seu design Mixture of Experts (MoE) significa que nem todos os 2,8 trilhões de parâmetros são ativados para cada token.

O cartão oficial do modelo lista as seguintes informações:

Especificação Kimi K3
Arquitetura Mixture of Experts (MoE)
Parâmetros totais 2,8T
Parâmetros ativos 104B
Número de camadas 93
Camadas densas 1
Número de especialistas roteados 896
Especialistas selecionados por token 16
Especialistas compartilhados 2
Tamanho do vocabulário 160K
Comprimento do contexto 1.048.576 tokens
Codificador visual MoonViT-V2
Parâmetros do codificador visual 401M
Método de quantização MXFP4 pesos / MXFP8 ativações
Modalidades Texto e imagem

O relatório técnico fornece uma comparação arquitetural mais precisa com o Kimi K2.

A imagem mostra uma tabela de comparação arquitetural entre Kimi K2 e Kimi K3, exibindo diferenças em vários aspectos, como número de camadas, parâmetros totais, parâmetros ativos, dimensão oculta, dimensão de especialistas, etc. O Kimi K3 apresenta melhorias em número de camadas, parâmetros totais, parâmetros ativos, dimensão de especialistas, etc., como um aumento de 52% no número de camadas, 167% nos parâmetros totais e 220% nos parâmetros ativos. Além disso, o Kimi K3 introduz novos mecanismos de atenção e residual, e há mudanças no comprimento do contexto de treinamento, mecanismo de atenção, função de ativação, etc. Esta tabela está intimamente relacionada ao contexto e mostra visualmente as melhorias arquiteturais do Kimi K3 em relação ao Kimi K2.

Comparado ao Kimi K2, o K3 aumenta a profundidade do modelo e a esparsidade dos especialistas, ao mesmo tempo que introduz novos mecanismos de atenção e residual.

A Moonshot afirma que, com base no Kimi K2, a eficiência geral de escalabilidade foi aprimorada em aproximadamente 2,5 vezes através de melhorias combinadas na arquitetura e nas abordagens de treinamento.

Esta afirmação se refere à eficiência com que o poder computacional adicional é convertido em capacidade do modelo, e não a um aumento de 2,5 vezes na velocidade de inferência em geral.

Modalidade nativa e janela de contexto de um milhão de tokens

O Kimi K3 é projetado como um modelo nativo multimodal, e não como um modelo de linguagem que apenas incorpora um módulo visual no final do treinamento.

Seu codificador visual MoonViT-V2 tem aproximadamente 401 milhões de parâmetros.

O relatório técnico indica que o MoonViT-V2 foi treinado do zero com o objetivo de previsão do próximo token do modelo, em vez de ser inicializado a partir de um modelo visual pré-treinado contrastivo como o SigLIP.

A Moonshot relata que este método permaneceu estável durante o treinamento e alcançou desempenho visual competitivo.

![A imagem mostra

AI em experimentos de ablação de pré-treinamento, a variação da norma do gradiente da torre visual de diferentes modelos com o número de passos de treinamento. A figura (a) mostra a trajetória completa de treinamento, e a figura (b) é uma ampliação dos passos 14k-16k. A linha azul representa o MoonViT-3D inicializado a partir do SigLIP, e a linha vermelha representa o MoonViT-V2 treinado do zero. Em comparação com o modelo inicializado com SigLIP, o MoonViT-V2 treinado do zero mantém uma norma de gradiente mais baixa e menos flutuações, indicando uma otimização mais estável. Este gráfico está intimamente relacionado ao contexto, apresentando visualmente a estabilidade do MoonViT-V2 durante o processo de treinamento.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/63b386e9-0be5-4813-a254-4665269d9469-a3cea91a-babc-4ab7-9d22-af510c0efa46.jpeg)

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b6691c45-6229-4970-8a27-4e5a6deb00e1-dc511091-a635-4fc2-a80b-ab2e008b1415.png)

O comprimento de contexto suportado por este modelo é:

1.048.576 tokens

Esta escala é particularmente importante para sistemas de agentes, pois uma tarefa de codificação ou pesquisa de longa duração pode acumular conteúdo de repositório, saídas de ferramentas, logs, capturas de tela, materiais de pesquisa, planos intermediários, registros de falhas de teste, resultados de raciocínio anteriores e informações de múltiplas rodadas de correção.

Um contexto de milhões de tokens não elimina a necessidade de gerenciamento de contexto, mas permite que o K3 retenha um histórico de trabalho muito maior do que os sistemas tradicionais de contexto curto.

Três Principais Mudanças Arquiteturais

O relatório técnico atribui a escala e a estabilidade do K3 a várias mudanças arquiteturais.

As três mais notáveis são:

  1. Mecanismo de atenção híbrida KDA + Gated MLA.
  2. Resíduo de atenção.
  3. Modelo de especialista misto latente estável.

A imagem mostra a arquitetura do Kimi K3, dividida em três partes. À esquerda estão os módulos Stable Normalized LatentMoE e KDA, contendo Shared Expert, Routed Expert, Router, Linear, Norm, etc. No canto superior direito está a operação AttnRes, com Output, Stable LatentMoE, Gated MLA, Stable LatentMoE, KDA, etc. À direita está o backbone Block Attention Residuals, com Block n-1, Block n-2, Block n-3, etc. Este gráfico está intimamente relacionado ao contexto, apresentando visualmente a estrutura modular das três principais mudanças na arquitetura do Kimi K3.

1. Mecanismo de Atenção Híbrida: KDA + Gated MLA

O Kimi K3 adota um design de atenção híbrida.

A ficha técnica oficial do modelo lista:

69 camadas KDA + 24 camadas Gated MLA

Esta arquitetura segue um padrão repetitivo, onde múltiplas camadas de atenção Kimi Delta são combinadas com camadas periódicas de atenção latente multi-cabeça com portão.

Atenção Kimi Delta

KDA é um mecanismo de atenção linear projetado para reduzir a carga de memória e computação associada a contextos extremamente longos.

Em vez de usar o cache KV tradicional que cresce com cada token como na atenção total padrão, o KDA mantém um estado recorrente.

Isso o torna atraente para sequências de milhões de tokens.

A Moonshot introduziu anteriormente o KDA através da série de pesquisa linear Kimi, onde a equipe relatou que, sob suas condições de avaliação, o KDA reduziu os requisitos de cache KV e melhorou a taxa de transferência de decodificação em contextos longos em comparação com a atenção total.

Gated MLA

O K3 não substitui completamente a atenção global.

As camadas periódicas de Gated MLA preservam a capacidade do modelo de recuperar informações globalmente no contexto.

Portanto, este design híbrido busca equilibrar dois objetivos:

  • Processamento eficiente de sequências longas.
  • Recuperação global robusta.

A ideia não é que a atenção linear seja sempre superior à atenção global, mas que cada mecanismo lida com diferentes partes do problema de contexto longo.

2. Resíduo de Atenção

Redes neurais profundas precisam transmitir informações através de múltiplas camadas, evitando a perda gradual de representações úteis.

O Kimi K3 introduz Resíduo de Atenção (AttnRes) para mudar a forma como a informação é transmitida na profundidade.

Este mecanismo não depende de um fluxo de resíduo sequencial uniforme, mas permite que módulos subsequentes recuperem seletivamente representações produzidas por módulos anteriores.

Conceitualmente, isso fornece à rede um mecanismo de aprendizado que permite

decidir quais informações anteriores devem permanecer diretamente acessíveis.

O objetivo é melhorar o fluxo de informações em um modelo de 93 camadas sem forçar cada característica a passar estritamente pelo mesmo caminho residual.

3. LatentMoE Estável

O Kimi K3 aumenta significativamente a esparsidade do MoE.

O modelo contém:

896 especialistas roteados

Mas cada token ativa apenas:

16 especialistas roteados

Além disso, o modelo também inclui dois especialistas compartilhados.

Isso resulta em um número muito grande de parâmetros totais do modelo, mas a computação ativa é muito menor do que o número total de parâmetros.

Neste nível de esparsidade, a estabilidade do treinamento e o equilíbrio dos especialistas tornam-se problemas espinhosos.

O design do LatentMoE estável da Moonshot incorpora vários mecanismos destinados a resolver esses problemas.

SiTU-GLU

O Kimi K3 substitui o SwiGLU pelo SiTU-GLU, uma função de ativação projetada para evitar o crescimento ilimitado sob escalas extremas.

A imagem mostra as estruturas dos ramos de porta e ramo superior de GLU, SwiGLU e SiTU-GLU, bem como suas curvas de resposta escalar. Todos os ramos recebem entrada escalar x, as curvas compartilham o domínio x ∈ [−10, 100], e o canto inferior direito amplia a área próxima à origem. O SiTU-GLU, com β1 = 4, β2 = 25, tem sua curva próxima ao SwiGLU perto da origem, e quando x é um número grande positivo, |f(x)| ≤ β1β2 = 100, enquanto o SwiGLU ainda é ilimitado. Este gráfico está relacionado ao conteúdo sobre a substituição do SwiGLU pelo SiTU-GLU no Kimi K3 para evitar crescimento ilimitado sob escalas extremas.

Balanceamento por Quantis

O sistema também adota um método de balanceamento de carga baseado em viés dinâmico de roteamento, em vez de depender inteiramente da função de perda de balanceamento auxiliar tradicional.

O objetivo é tornar a distribuição de tokens roteados entre especialistas mais uniforme, sem introduzir muita interferência no treinamento.

Treinamento de Agentes com Milhões de Tokens

O relatório técnico do Kimi K3 enfatiza particularmente o pós-treinamento para agentes de longa duração.

O modelo foi treinado em três áreas:

  • Raciocínio geral.
  • Tarefas gerais de agente.
  • Agente de programação.

Ele também suporta vários níveis de refinamento de raciocínio:

  • Baixo.
  • Alto.
  • Mais alto.

O modelo final combina várias estratégias especializadas através de Destilação de Política Online Multi-Professor (MOPD).

A Moonshot não treina modelos permanentes independentes para cada área e nível de refinamento, mas treina modelos professores especializados e integra seus comportamentos em uma política unificada do K3.

AgentENV: Treinamento em Sandbox de Longa Duração

O relatório técnico descreve o AgentENV, uma camada de infraestrutura construída para implantação de agentes persistentes.

O sistema adota uma abordagem baseada em Firecracker.

O ambiente de micro-máquinas virtuais permite que agentes executem sequências longas de operações em uma sandbox reproduzível.

Uma tarefa de treinamento pode incluir:

  1. Ler arquivos.
  2. Escrever código.
  3. Executar comandos.
  4. Abrir aplicativos.
  5. Capturar capturas de tela.
  6. Usar ferramentas simuladas de ambiente de trabalho.
  7. Depurar erros.
  8. Retornar após longos atrasos.
  9. Continuar a execução a partir do estado anterior do ambiente.

Isso difere do aprendizado por reforço baseado em rodadas curtas de perguntas e respostas.

Um agente pode realizar centenas de chamadas de ferramentas e manter o estado em um ambiente simulado por vários dias virtuais.

O artigo-fonte descreve ambientes simulados envolvendo aplicativos como Slack, Notion e Gmail.

O principal desafio de treinamento é a persistência: tanto o ambiente quanto o estado de contexto longo do modelo devem permanecer disponíveis.

Durante longos processos de implantação.

Síntese de tarefas guiada por grafo de conhecimento

O treinamento de ciclo longo também requer um grande número de tarefas difíceis.

Moonshot descreve um pipeline de geração de tarefas organizado em torno de um grafo de conhecimento hierárquico.

O grafo abrange diversos campos como ciência da computação, inteligência artificial, programação, matemática, física, química, biomedicina e humanidades.

Conceitos relacionados podem ser amostrados juntos, materiais públicos relevantes são recuperados e, a partir desses materiais, novas tarefas de avaliação ou treinamento são sintetizadas.

O objetivo do grafo é criar tarefas que exijam uso real de ferramentas e raciocínio de múltiplas etapas, não apenas memorização de respostas.

Infraestrutura para modelo MoE de 3T parâmetros

Um modelo de 2,8T parâmetros com janela de contexto de milhões de tokens não pode ser treinado e servido eficientemente apenas com a arquitetura do modelo.

O relatório técnico do Moonshot descreve trabalhos de sistema abrangendo núcleos KDA, paralelismo de contexto, paralelismo de especialistas, gerenciamento de memória, escalonamento de RL de ciclo longo, cache de prefixo, decodificação especulativa e controle de admissão de serviço.

Parte desse conteúdo já foi tornada pública.

MoonEP: Paralelismo de especialistas equilibrado

MoonEP é uma biblioteca de comunicação de paralelismo de especialistas de código aberto do Moonshot.

No treinamento de MoE, o roteamento pode ser severamente desequilibrado.

Como o roteador prefere certos especialistas, um rank pode receber muito mais tokens do que outro. Quando isso acontece, o dispositivo mais rápido precisa esperar pelo mais lento.

MoonEP usa especialistas redundantes dinâmicos para resolver esse problema.

Ele pode criar cópias temporárias de especialistas com base no padrão de roteamento atual, mantendo a carga de trabalho de tokens equilibrada entre os ranks.

O projeto descreve seu objetivo como manter cada rank exatamente na carga de tokens roteada esperada, enquanto reduz a sobrecarga de comunicação.

Isso é crítico na escala do K3, pois distribuir 896 especialistas em um grande cluster introduz enormes problemas de sincronização.

FlashKDA: Núcleo KDA de alto desempenho

FlashKDA fornece núcleos de atenção Kimi Delta de alto desempenho baseados em implementação CUTLASS.

O repositório público atualmente lista os seguintes requisitos:

SM90 ou superior
CUDA 12.9 ou superior
PyTorch 2.4 ou superior

O repositório inclui testes de correção e dados de benchmark para hardware compatível.

FlashKDA visa acelerar o mecanismo de atenção que torna prática a arquitetura de contexto longo do K3.

Quantização nativa MXFP4

O Kimi K3 usa treinamento ciente de quantização desde o estágio de ajuste fino supervisionado.

A configuração oficial lista:

Pesos MXFP4
Ativações MXFP8

Isso difere de treinar primeiro um modelo totalmente de alta precisão e depois quantizá-lo após o treinamento.

O modelo é treinado para operar diretamente nesses formatos de precisão reduzida durante o pipeline.

Isso ajuda a reduzir a sobrecarga de memória e comunicação.

Requisitos, mas isso não transforma um modelo de 2,8T em um modelo de desktop comum.

É possível executar o Kimi K3 localmente?

Os pesos são públicos, mas "baixável" não significa "executável facilmente em um laptop".

O Kimi K3 tem um total de 2,8 trilhões de parâmetros.

Mesmo com ativação esparsa e formatos de baixa precisão, executar o modelo completo requer uma grande quantidade de memória agregada de aceleradores, interconexão de dispositivos de alta largura de banda, execução paralela de especialistas, um mecanismo de inferência compatível e suporte eficiente para KDA, MLA e MoE.

O repositório oficial do Moonshot recomenda:

  • vLLM
  • SGLang
  • TokenSpeed usado através do esquema de implantação do Moonshot

O ecossistema ainda está evoluindo rapidamente. O suporte pode depender de esquemas, núcleos, modos de quantização e hardware específicos.

Antes de construir um ambiente auto-hospedado, confirme a documentação de implantação mais recente do Kimi K3 e não presuma que as configurações padrão de serviço Transformer funcionarão.

Para a maioria dos indivíduos e pequenas equipes, a API hospedada pode ser muito mais fácil do que executar o modelo completo.

API do Kimi K3 e nível de esforço de raciocínio

Moonshot também oferece o Kimi K3 através de sua plataforma de API oficial:

https://platform.kimi.ai/

O identificador do modelo é:

kimi-k3

O Kimi K3 usa funções de raciocínio e retorna o campo reasoning_content.

A ficha técnica oficial descreve três níveis de esforço de raciocínio:

low
high
max

Um detalhe importante de implementação é o histórico de pensamento preservado.

Para fluxos de trabalho de agente multi-turno, Moonshot indica que os desenvolvedores devem passar toda a mensagem anterior do assistente (incluindo reasoning_content, content e tool_calls) de volta para a próxima solicitação.

Descartar parte desse estado pode prejudicar a continuidade, pois a forma como o K3 foi treinado exige que o histórico de raciocínio seja preservado.

Desempenho em benchmarks

O relatório técnico do Moonshot avalia o Kimi K3 em raciocínio e conhecimento, programação, fluxos de trabalho de agente e visão.

O conjunto de avaliação da própria empresa classifica o K3 como um dos modelos mais fortes disponíveis, liderando em tarefas específicas em comparação com muitos sistemas de pesos abertos e proprietários.

Ao mesmo tempo, o relatório afirma claramente que o modelo ainda está atrás dos sistemas proprietários mais fortes no geral, especialmente Claude Fable 5 e GPT-5.6 Sol.

Essa ressalva é importante.

A afirmação não é que o K3 venceu todos os benchmarks.

A conclusão mais defensável é que Kimi K3 trouxe pesos abertos para um domínio de desempenho que até recentemente estava associado principalmente a sistemas proprietários de ponta.

Imagem de tabela comparando desempenho do Kimi K3 com Claude Fable 5, GPT-5.6 Sol, GLM-5.2 e outros modelos em raciocínio e conhecimento, programação, fluxos de trabalho de agente, visão, entre outros. Os melhores resultados estão em negrito e os segundos melhores sublinhados. Por exemplo, em raciocínio e conhecimento, Kimi K3 se destaca em tarefas como GQA OpenWorld, Critiq, ACLRC, superando alguns modelos como Claude Fable 5. A tabela está diretamente relacionada ao contexto, apresentando visualmente o desempenho do Kimi K3 em diferentes tarefas.

Várias comparações de benchmarks também dependem de diferentes ferramentas de agente, incluindo Kimi Code, Claude Code, Codex e ferramentas de benchmark oficiais.

Portanto, as pontuações de benchmarks de agente não devem ser interpretadas como uma medida pura da capacidade do modelo.

Os resultados. As ferramentas ao redor, prompts, gerenciamento de contexto, mecanismos de fallback e avaliadores impactam substancialmente os resultados.

Estudo de caso de programação de ciclo longo

O relatório fornece vários casos projetados para demonstrar que o K3 é capaz de trabalho de engenharia complexo que vai muito além de tarefas curtas de conclusão de código.

Esses casos são fornecidos pelos desenvolvedores do modelo e devem ser vistos como demonstrações de caso, não como garantias de desempenho universal.

MiniTriton: Construindo um sistema de programação GPU

Moonshot relata que Kimi K3 desenvolveu MiniTriton, um sistema de programação GPU compacto semelhante ao Triton.

O projeto inclui representação intermediária, pipeline do compilador, geração de PTX, linguagem front-end, componentes de tempo de execução, otimização de núcleos GPU e primitivas de treinamento distribuído.

A imagem mostra um estudo de caso de computação GPU desenvolvido com o compilador MiniTriton do Kimi K3 na GPU NVIDIA L20. Inclui gráficos de desempenho dos núcleos CUDA e Tensor, bem como curvas de convergência entre o MiniTriton e o torch eager, e entre as primitivas distribuídas do MiniTriton (NCCL) e o treinamento com uma única GPU. No gráfico de núcleos CUDA, são comparados diferentes compiladores como train, gpt e torch eager; no gráfico de núcleos Tensor, são comparados compiladores como train e gpt; as curvas de convergência mostram a variação da perda de treinamento entre MiniTriton e torch eager, e entre as primitivas distribuídas do MiniTriton e o treinamento com uma única GPU.

A Moonshot afirma que o K3 também otimizou núcleos complexos relacionados à sua própria arquitetura, alcançando acelerações significativas em núcleos selecionados.

Isso demonstra o comportamento esperado do modelo: examinar bases de código complexas, realizar análises de desempenho, escrever código de baixo nível, fazer benchmark dos resultados e iterar melhorias.

No entanto, isso não significa que o compilador ou núcleo gerado por cada modelo possa ser totalmente confiável sem revisão e teste humanos.

Um Experimento de Projeto de Chip de 48 Horas

Em outro estudo de caso, o Kimi K3 foi colocado em um ambiente isolado (sandbox) por 48 horas e solicitado a criar um protótipo de chip de inferência para um modelo pequeno, cuja abordagem de design tem semelhanças com a arquitetura mencionada.

O modelo utilizou ferramentas de automação de projeto eletrônico de código aberto e a biblioteca de células padrão Nangate de 45 nanômetros.

A Moonshot relatou que a simulação final do design foi concluída dentro do orçamento de área de análise de 4 mm², fechando o tempo (timing closure) a uma frequência de clock de 100 MHz, contendo aproximadamente 1,46 milhão de células padrão, usando 0,277 MiB de SRAM, e alcançando uma taxa de transferência de decodificação de mais de 8.700 tokens por segundo na simulação RTL.

A imagem apresenta a introdução relacionada ao protótipo do chip de inferência projetado pelo Kimi K3. Como prova de conceito inicial, o Kimi K3 segue o mesmo design de arquitetura, incluindo mecanismos de atenção como KDA híbrido e NoPE-MLA, Block AttnRes, roteamento MoE baseado em sigmoide, etc. Dentro do orçamento de área de análise de 4mm², o design fecha o tempo a 100MHz, contendo cerca de 1,46 milhão de células padrão, 0,277MiB de SRAM, matriz MAC INT4 com dequantização fundida, e a taxa de transferência de decodificação na simulação RTL é superior a 8.700 tokens/s. Este design, em 48 horas de operação autônoma, foi construído, otimizado e validado usando Kimi Code, e o código está disponível no GitHub.

Esta é uma prova de conceito baseada em simulação, não um chip para produção em massa.

Codificação Científica e Astrofísica

O K3 também foi avaliado em uma tarefa de reprodução em astrofísica computacional.

A Moonshot afirma que o modelo leu e validou de forma cruzada mais de 20 artigos, implementou um pipeline numérico completo, avaliou mais de 300 equações de estado, identificou inconsistências em fórmulas publicadas, escreveu mais de 3.000 linhas de código Python e gerou um painel HTML interativo.

A imagem mostra as conquistas do Kimi K3 na codificação científica. Para reproduzir a relação universal I-Love-Q em astrofísica computacional, o Kimi K3 revisou mais de 20 artigos, validou resultados de forma cruzada, implementou um pipeline numérico completo, avaliou mais de 300 conjuntos de equações de estado, descobriu inconsistências em fórmulas públicas, escreveu mais de 3.000 linhas de código Python e gerou um painel HTML interativo em cerca de 2 horas, enquanto pesquisadores experientes normalmente levam de 1 a 2 semanas. Esta imagem está intimamente relacionada ao contexto, apresentando visualmente os resultados específicos do Kimi K3 na tarefa de codificação científica.

Segundo relatos, o trabalho autônomo acima levou cerca de duas horas, enquanto pesquisadores experientes normalmente precisam de uma a duas semanas.

Para trabalhos de pesquisa, a verificação independente ainda é crucial. O modelo pode gerar o pipeline completo, mas ainda pode cometer erros sutis em hipóteses, unidades, métodos numéricos, citações ou interpretações.

Avaliação de Segurança Cibernética

O relatório técnico também discute avaliações no domínio da segurança cibernética.

A Moonshot afirma que o Kimi K3 descobriu vulnerabilidades anteriormente desconhecidas no kernel do Linux durante testes de segurança controlados, e as descobertas foram revisadas por especialistas humanos.

A importância não reside em usar o K3 para operações de segurança ofensiva não supervisionadas.

Em vez disso, mostra que modelos de codificação de longo ciclo estão cada vez mais aptos a ler grandes bases de código, rastrear comportamentos de baixo nível, formar hipóteses, validá-las, corrigir métodos e continuar após tentativas fracassadas.

Essas capacidades podem apoiar auditorias defensivas e revisões de segurança de código, mas também tornam a autorização, o isolamento em sandbox, o controle de acesso e a supervisão humana ainda mais importantes.

Custo e Eficiência

O valor de um modelo não é determinado apenas pelas pontuações em benchmarks.

Sistemas agênticos de longo ciclo podem gerar milhões de tokens em uma única tarefa.

Portanto, o custo depende do comprimento da entrada, comprimento da saída, complexidade da inferência, taxa de acerto do cache, número de chamadas de ferramentas, número de tentativas, gerenciamento de contexto e do provedor de inferência.

O relatório técnico da Moonshot inclui comparações de pontuações e custos para vários benchmarks de agentes.

Esses gráficos mostram que o K3 tem custo-benefício relativo em algumas cargas de trabalho de teste.

Isso não deve ser interpretado como uma conclusão geral de que o K3 é mais barato que todas as alternativas em todas as situações.

No planejamento de produção, deve-se medir o custo total para completar uma tarefa com sucesso, em vez de apenas olhar para o preço por milhão de tokens.

Significado do Lançamento dos Pesos Abertos

O lançamento do Kimi K3 vai além da classificação de um único modelo.

Ele abre vários campos de pesquisa e engenharia que são difíceis de estudar em sistemas exclusivamente baseados em API.

Os pesquisadores podem inspecionar ou modificar os pesos do modelo, comportamento MoE, mecanismo de atenção baseado em KDA, mecanismos de contexto longo, componentes visuais, comportamento de quantização, sistemas de serviço e estratégias de pós-treinamento para agentes.

As equipes de infraestrutura podem testar diferentes esquemas de serviço.

As empresas podem avaliar a implantação privada quando a economia de hardware for razoável.

A comunidade pode construir:

  • Novos esquemas de inferência.
  • Variantes quantizadas.
  • Modelos derivados por fine-tuning.
  • Sistemas específicos de domínio.
  • Frameworks de avaliação.
  • Ferramentas de roteamento de modelos.
  • Otimizações específicas de hardware.

Se essas construções podem criar um ecossistema comparável aos primeiros lançamentos de modelos abertos importantes dependerá do custo de inferência, hardware acessível, termos de licença, ferramentas da comunidade e qualidade dos modelos derivados menores.

Lista de Verificação Prática Antes de Implantar o Kimi K3

1. Leia o Contrato de Licença

Confirme se seu caso de uso se enquadra em: pesquisa interna, uso empresarial, fine-tuning, aplicações embarcadas, inferência pública ou modelo como serviço.

2. Confirme o Suporte de Hardware

Verifique a arquitetura do acelerador, capacidade HBM, interconexão, versão do CUDA, requisitos de kernel, suporte a quantização, número de dispositivos e topologia de paralelismo de especialistas.

3. Escolha um Motor de Inferência Suportado

Use as soluções específicas do K3 atualmente para vLLM, SGLang ou outros caminhos de serviço oficialmente suportados.

4. Teste o Contexto Completo de 1 Milhão Separadamente

Meça a latência de pré-preenchimento, latência de decodificação, comportamento de cache de prefixo, uso de memória, capacidade de concorrência, taxa de transferência e recuperação de falhas.

5. Mantenha o Histórico de Raciocínio

Para fluxos de trabalho agênticos de múltiplas rodadas, siga as diretrizes da Moonshot para retornar mensagens completas do assistente (incluindo estado de raciocínio e chamadas de ferramentas).

6. Valide Tarefas Reais

Faça benchmark em seus próprios repositórios, fluxos de trabalho de pesquisa, documentos, tarefas visuais, uso de ferramentas e cenários de agentes.

7. Meça o Custo por Tarefa Concluída

Focar apenas no preço do token pode ser enganoso. Calcule o número de tentativas, chamadas de ferramentas, comprimento da saída e custos de intervenção humana.

Perguntas Frequentes

O Kimi K3 é Open Source?

Os pesos completos, base de código, documentação e relatório técnico do Kimi K3 são tornados públicos, e a MoonShot o descreve como um modelo de pesos abertos. O modelo usa um Contrato de Licença Kimi K3 personalizado, não o Apache 2.0.

Protocolos padrão, usuários comerciais precisam revisar cuidadosamente os termos específicos.

Onde baixar o Kimi K3?

Os pesos oficiais podem ser obtidos na Moonshot AI no Hugging Face. O repositório principal do código-fonte e o relatório técnico estão disponíveis no GitHub.

Quantos parâmetros tem o Kimi K3?

O Kimi K3 possui um total de aproximadamente 2,8 trilhões de parâmetros. Devido à arquitetura de modelo especialista esparso misto, cada token ativa cerca de 104 bilhões de parâmetros.

Qual é o tamanho da janela de contexto do Kimi K3?

O modelo oficial suporta um contexto de até 1.048.576 tokens. A implantação de contexto longo ainda requer muita memória e infraestrutura de inferência, especialmente em cenários concorrentes.

O Kimi K3 pode ser executado em GPUs de consumo?

O modelo completo de 2,8T não pode ser executado em GPUs de consumo comuns. Mesmo com ativação esparsa e quantização de baixa precisão, os pesos completos e a pilha de serviços ainda exigem uma grande infraestrutura multiacelerador.

Quais mecanismos de inferência suportam o Kimi K3?

O repositório oficial da Moonshot recomenda o uso de vLLM, SGLang e TokenSpeed por meio do guia de implantação específico para o K3. Como o modelo utiliza otimizações relacionadas a KDA, MLA, MoE e MXFP4, é necessário verificar as versões atualmente suportadas antes da implantação.

O que são MoonEP e FlashKDA?

O MoonEP é uma biblioteca de comunicação paralela de especialistas de código aberto da Moonshot, usada para balancear a carga de tokens MoE entre GPUs. O FlashKDA é um kernel de atenção Kimi Delta de alto desempenho construído sobre o CUTLASS.

O Kimi K3 é superior ao GPT-5.6 Sol e ao Claude Fable 5?

Não em todos os aspectos. O relatório técnico da Moonshot indica que o Kimi K3 atingiu desempenho de ponta e lidera em tarefas específicas, mas, no geral, ainda fica atrás dos sistemas proprietários mais fortes. Os resultados de benchmark também dependem da estrutura do agente, ferramentas, configurações de inferência e métodos de avaliação.

Ferramentas relacionadas

  • Kimi K3 no Hugging Face: Cartão do modelo oficial e pesos completos do Kimi K3.
  • Kimi K3 no GitHub: Repositório oficial com README, licença, ativos e relatório técnico.
  • MoonEP: Biblioteca de comunicação paralela de especialistas da Moonshot para balancear dinamicamente cargas de trabalho MoE.
  • FlashKDA: Kernel de atenção Kimi Delta de alto desempenho construído sobre o CUTLASS.
  • vLLM: Mecanismo de inferência e serviço de código aberto recomendado no guia de implantação do Kimi K3.
  • SGLang: Estrutura de serviço multimodal e LLM de código aberto listada pela Moonshot para implantação do K3.
  • Kimi API: Plataforma de API hospedada pela Moonshot AI, com acesso ao modelo kimi-k3.

Links relacionados

Resumo

A Moonshot AI agora lançou os pesos completos do Kimi K3, transformando seu modelo de ponta de 2,8T de parâmetros em um sistema que pesquisadores e equipes de infraestrutura podem inspecionar, implantar, ajustar e expandir sob a licença Kimi K3.

O modelo combina 104B parâmetros ativados, janela de contexto de 1M tokens, multimodalidade nativa, mecanismo de atenção híbrida KDA/Gated-MLA, resíduo de atenção, MoE latente estável, treinamento consciente de quantização e pós-treinamento de agente de horizonte longo.

Igualmente importante, este lançamento revela parte da engenharia de sistemas por trás do modelo através de projetos como MoonEP e FlashKDA. O K3 ainda é um modelo com requisitos de auto-hospedagem extremamente altos, e seus melhores resultados devem ser interpretados no contexto da escolha da estrutura e da execução do desenvolvedor.

Avaliação.
O verdadeiro marco não é apenas a existência de um modelo de escala 2,8T — mas sim o fato de que um modelo dessa magnitude agora está disponível para a comunidade mais ampla inspecionar, executar e construir sobre ele.

Kimi K3 现已开放权重:探秘月之暗面 AI 的 2.8T 参数前沿模型