Kimi K3 lidera arena de código frontend, constrói compilador de GPU e projeta chip em 48 horas
A Moonshot AI lançou o Kimi K3, um modelo multimodal nativo projetado especificamente para codificação de longa duração, trabalho de conhecimento, raciocínio visual e fluxos de trabalho baseados em agentes. O modelo possui 2,8 trilhões de parâmetros totais, uma janela de contexto de 1 milhão de tokens e uma arquitetura de especialistas mistos altamente esparsa — para cada token, apenas 16 de seus 896 especialistas são ativados. A Moonshot o descreve como o primeiro modelo aberto da escala de 3T, embora o anúncio da empresa indique que os pesos completos do modelo serão lançados em 27 de julho de 2026. O Kimi K3 chamou atenção imediatamente por seus resultados em desenvolvimento front-end, otimização autônoma de kernels GPU, criação de um pequeno compilador GPU chamado MiniTriton e experimentos de design de chip concluídos em 48 horas usando ferramentas de automação de design eletrônico de código aberto. A Moonshot também reconhece que o K3 não lidera em todas as categorias. Sua própria

Kimi K3 lidera arena de código frontend, constrói compilador de GPU e projeta chip em 48 horas
Introdução
A Moonshot AI lançou o Kimi K3, um modelo multimodal nativo projetado especificamente para codificação de longa duração, trabalho de conhecimento, raciocínio visual e fluxos de trabalho baseados em agentes.
O modelo possui 2,8 trilhões de parâmetros totais, uma janela de contexto de 1 milhão de tokens e uma arquitetura de especialistas mistos altamente esparsa — para cada token, apenas 16 de seus 896 especialistas são ativados. A Moonshot o descreve como o primeiro modelo aberto da escala de 3T, embora o anúncio da empresa indique que os pesos completos do modelo serão lançados em 27 de julho de 2026.
O Kimi K3 chamou atenção imediatamente por seus resultados em desenvolvimento front-end, otimização autônoma de kernels GPU, criação de um pequeno compilador GPU chamado MiniTriton e experimentos de design de chip concluídos em 48 horas usando ferramentas de automação de design eletrônico de código aberto.
A Moonshot também reconhece que o K3 não lidera em todas as categorias. Sua própria avaliação mostra que o modelo fica atrás do Claude Fable 5 e do GPT-5.6 Sol em desempenho geral, mas apresenta resultados superiores em várias tarefas de codificação e agentes de longa duração.
Comparação inteligente da Artificial Analysis compartilhada no artigo original, mostrando a posição do Kimi K3.
Um modelo Kimi mais caro
O Kimi K3 eleva os preços da API da Moonshot para um patamar superior ao dos modelos anteriores de codificação Kimi.
A tabela de preços do relatório original lista as seguintes tarifas para a API da China:
| Modelo | Cache hit (entrada) | Cache miss (entrada) | Saída |
|---|---|---|---|
| Kimi K3 | ¥2 por milhão de tokens | ¥20 por milhão de tokens | ¥100 por milhão de tokens |
| Kimi K2.7 Code | ¥1,30 por milhão de tokens | ¥6,50 por milhão de tokens | ¥27 por milhão de tokens |
Comparação de preços entre Kimi K3 e Kimi K2.7 Code no artigo original.
A plataforma internacional de API da Moonshot lista os preços do Kimi K3 como:
- US$ 0,30 por milhão de tokens de entrada com cache hit
- US$ 3,00 por milhão de tokens de entrada com cache miss
- US$ 15,00 por milhão de tokens de saída
Isso é significativamente mais caro que o Kimi K2.7 Code, mas ainda abaixo dos preços do Claude Fable 5 citados pela Moonshot em sua comparação.
com/cms-assets/image/2026/07/2761809f-7dbb-4570-911c-c2867cbb026a-5ef22221-611a-4252-a82e-af74b77e7af1.png)
Tabela de comparação de preços mostra que o preço de saída do Kimi K3 é apenas 30% do valor cobrado pelo Claude Fable 5.
É necessário cautela ao ler comparações de preços. As tarifas da API podem variar conforme região, provedor, comportamento de cache e atualizações futuras do produto. Antes da implantação, a página oficial da API Kimi é a melhor forma de verificar os padrões de cobrança atuais.
Kimi K3 lidera arena de código front-end
O resultado mais marcante inicial vem da área de desenvolvimento front-end.
Até o momento desta publicação, o Kimi K3 está no topo do Ranking WebDev preliminar da Arena Front-End Code. O gráfico original mostra sua taxa de vitórias de 76%, à frente do Claude Fable 5 e do GPT-5.6 Sol.

Kimi K3 lidera os resultados preliminares da arena de código front-end apresentados no relatório.
Em sete categorias de front-end, o relatório original afirma que o K3 ficou em primeiro lugar em seis:
- Sites de marca e marketing
- Design baseado em imagem de referência
- Interface de análise de dados
- Produtos de consumo
- Simulações
- Ferramentas de criação de conteúdo
Segundo o relatório, ele ficou em segundo lugar na categoria de jogos.
Esses resultados são particularmente significativos porque o trabalho front-end não é apenas um problema de geração de código. Um modelo de grande porte competente deve ser capaz de interpretar necessidades visuais, criar aplicações funcionais, executá-las, inspecionar resultados e modificar a implementação quando a interface não corresponder ao design esperado.
Recriando uma interface estilo macOS baseada em navegador
Um exemplo citado no artigo original é a recriação de uma interface estilo macOS 27 usando um cluster de agentes em aproximadamente seis horas.
O resultado não é apenas uma captura de tela estática. O relatório afirma que, com exceção de algumas funcionalidades como navegador e telefone, a maioria dos aplicativos de desktop e interações funcionam corretamente.

Uma interface de navegador gerada por agente, imitando um sistema operacional de desktop moderno.
Outras demonstrações incluem um simulador de braço robótico e um jogo 3D totalmente programático, baseado em navegador, usando Three.js e WebGPU.
Esses exemplos ainda são demonstrações, não benchmarks padronizados, mas mostram o tipo de fluxo de trabalho que a Moonshot espera que o K3 suporte: criação de software de longa duração, visual e iterativa.
Visão no loop
A Moonshot descreve o fluxo de trabalho front-end do K3 como visão no loop.
O modelo não gera código de uma só vez e para; em vez disso, ele é capaz de:
- Escrever ou modificar código da aplicação.
- Executar o projeto.
- Inspecionar capturas de tela em tempo real ou resultados renderizados.
- Detectar problemas de layout, cor, hierarquia ou interação.
- Modificar o código.
- Re-renderizar os resultados atualizados e repetir o processo.
Esse fluxo preenche a lacuna entre a geração de código e a avaliação visual.
O modelo pode gerar HTML, CSS e JavaScript sintaticamente válidos, mas ainda assim produzir interfaces ruins. Ao observar a saída renderizada, o K3 consegue identificar problemas que seriam difíceis de detectar apenas pelo código-fonte.
Para repositórios front-end maiores, a janela de contexto de 1 milhão de tokens também é crucial. Ela permite acomodar um grande número de componentes, definições de tipos, regras de sistema de design, documentação do projeto e dependências entre arquivos em um único contexto de trabalho.
O artigo original também menciona uma compensação: alguns usuários relataram que tarefas front-end complexas levam entre 20 minutos e uma hora. Essas são apenas observações individuais, não medições controladas de latência, mas indicam que o K3
Pode haver uma preferência maior por iterações longas, em vez de saída imediata.
Referências de programação e engenharia de longo prazo
Programação é um dos principais pontos fortes do Kimi K3.
A tabela de referência no relatório original lista os seguintes resultados:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |

Resultados reportados do Kimi K3 em várias avaliações de programação e engenharia de software.
O blog oficial do Kimi K3 fornece notas metodológicas importantes.
Para DeepSWE, a Moonshot relatou os resultados do framework Kimi Code em sua comparação principal, enquanto os resultados do ranking público do mini-SWE-agent são listados como 67,3. Portanto, podem ocorrer pequenas diferenças dependendo do framework e da configuração de avaliação.
Para SWE Marathon, a Moonshot usou o branch de calibração H20 das tarefas oficiais. A empresa também observou que o Claude Fable 5 apresentou comportamento de fallback em algumas avaliações, o que pode ter reduzido sua pontuação medida.
Esses detalhes não invalidam os resultados, mas são importantes ao comparar modelos. Frameworks de agente, permissões de ferramentas, hardware, configurações de inferência, comportamento de fallback e calibração de tarefas podem influenciar a pontuação final.
Otimização autônoma de kernel GPU
A Moonshot testou se o Kimi K3 poderia otimizar kernels GPU com supervisão humana mínima.
Cada modelo recebeu o mesmo ambiente sandbox e teve até 24 horas para analisar, reescrever, fazer benchmark e otimizar os kernels relacionados a seguir:
- Residual de atenção
- Atenção Kimi Delta
- Uma carga de trabalho MLA com dimensão 512 cabeças
- GPU genérica de outro fornecedor
Os testes NVIDIA foram executados em hardware H200.
Otimização AttnRes
Para a carga de trabalho de residual de atenção, o artigo original indica que o K3 projetou um novo algoritmo de kernel de dois estágios, reduzindo
o tempo combinado de execução forward e reverse de 283,6 ms para 114,4 ms.
Isso representa uma aceleração de aproximadamente 59,7% em relação à linha de base, fazendo com que o Kimi K3 se aproximasse do resultado do Claude Fable 5 na configuração experimental da Moonshot.

Gráfico da trajetória de melhoria reportada do Kimi K3 na tarefa de kernel AttnRes.
O gráfico também mostra o processo de melhoria do agente ao longo do tempo. O K3 obteve vários avanços significativos no início da execução e, em seguida, continuou otimizando o kernel por meio de iterações subsequentes.
Kernel MLA-512
Na tarefa MLA-512 partindo do zero, o kernel do Kimi K3 atingiu 517,8 TFLOPS conforme reportado sob carga combinada forward e reverse.
O segundo maior resultado mostrado no relatório foi de aproximadamente 492,7 TFLOPS.

Kimi K3 atingiu 517,8 TFLOPS conforme reportado na tarefa de otimização MLA-512.
A Moonshot afirma que, nos estágios finais do desenvolvimento do modelo, versões iniciais do K3 realizaram a maior parte do trabalho de otimização de kernel da equipe. Este é um fluxo de trabalho auto-relatado pela empresa e não foi auditado de forma independente nos materiais vinculados pela fonte.
MiniTriton: Um compilador GPU construído do zero
O experimento seguinte foi além da otimização de kernels individuais.
A Moonshot explorou se o Kimi K3 poderia construir um pequeno sistema de programação GPU do zero. O resultado foi o MiniTriton, um compilador compacto, semelhante ao Triton, contendo:
- Sua própria representação intermediária em nível de tile
- Uma camada de IR construída sobre MLIR
- Processos de otimização
- Um pipeline de geração de código PTX
- Suporte em tempo de execução para os kernels gerados
A Moonshot relata que o MiniTriton atingiu ou superou o desempenho do Triton e do torch.compile nos benchmarks de roofline suportados, incluindo superar o Triton em algumas cargas de trabalho.

Desempenho do roofline de núcleos CUDA do MiniTriton reportado na GPU NVIDIA L20.
O compilador também suporta treinamento end-to-end do nanoGPT, alcançando convergência estável. De acordo com a Moonshot, suas curvas de perda permanecem próximas à implementação de referência, com apenas pequenos desvios.
Isso é mais significativo do que benchmarks isolados em microescala. Isso indica que o sistema gerado é capaz de conectar linguagem front-end, representação intermediária, pipeline de otimização, geração de PTX e runtime em um fluxo de trabalho coerente.
No entanto, no momento da redação deste artigo, a Moonshot ainda não publicou o código do MiniTriton. Portanto, as alegações de desempenho vêm dos materiais de lançamento do Kimi K3 e ainda não podem ser reproduzidas por meio de código lançado oficialmente.
Um chip projetado em uma execução de 48 horas
O Kimi K3 também foi testado no design de chips.
Em uma execução autônoma de 48 horas, o modelo usou ferramentas EDA de código aberto e o conjunto de design de processo Nangate 45nm para construir, otimizar e validar um chip projetado para servir modelos pequenos baseados na arquitetura K3.
A Moonshot relatou os seguintes resultados de design simulados:
- Área menor que 4 mm²
- 1,46 milhão de células padrão
- 0,277 MB de SRAM
- Timing convergido em 100 MHz
- Throughput de decodificação simulado superior a 8700 tokens por segundo
- Matriz de multiplicação-acumulação INT4 com dequantização integrada

Este estudo de caso de design de chip relatou uma velocidade de processamento de mais de 8700 tokens por segundo na simulação.
A diferença entre um design digital verificado e um chip físico realmente fabricado é importante.
Os materiais públicos descrevem um exercício de design, otimização, timing e simulação de EDA. Eles não afirmam que o chip passou pela tape-out, fabricação, encapsulamento e foi testado em silício.
Mesmo com essa limitação, concluir um pipeline de design de hardware estendido é um caso notável de codificação de longo prazo. Ele exige que o agente coordene decisões arquitetônicas, descrição de hardware, síntese, posicionamento e roteamento, verificação de timing, validação e otimizações iterativas.
As duas principais inovações por trás da escala de 2,8T
O Kimi K3 é construído sobre duas tecnologias desenvolvidas pela Moonshot AI:
- Kimi Delta Attention
- Resíduos de Atenção (Attention Residuals)
O modelo combina essas tecnologias com uma arquitetura de Mistura de Especialistas com ativação mais esparsa.

O Kimi K3 combina KDA, Resíduos de Atenção, Gated MLA e Stable LatentMoE.
Kimi Delta Attention
Kimi Delta Attention, ou KDA, visa tornar o mecanismo de atenção mais eficiente em sequências longas.
Em vez de depender inteiramente da atenção total padrão em todo o contexto, o KDA fornece um mecanismo eficiente para lidar com entradas longas, preservando as informações necessárias para codificação, raciocínio e tarefas de agente.
Esta é uma das bases para o contexto de milhões de tokens do modelo K3.
Mecanismo de Resíduos de Atenção
As camadas tradicionais do Transformer adicionam repetidamente a saída de cada nova camada ao estado oculto acumulado.
O mecanismo de Resíduos de Atenção (AttnRes) muda esse padrão. Ele permite que as camadas subsequentes recuperem representações seletivamente de diferentes profundidades, em vez de tratar todas as camadas anteriores como parte de um fluxo acumulado unificado.
A Moonshot o descreve como uma maneira mais flexível de permitir o fluxo de informações em modelos ultraprofundos.
Arquitetura Stable LatentMoE
O Kimi K3 possui 896 módulos especialistas, mas cada token ativa apenas 16 especialistas.
Essa esparsidade extrema reduz o custo computacional por token (em relação ao tamanho geral do modelo), mas também aumenta a dificuldade de roteamento e balanceamento de carga. O framework Stable LatentMoE da Moonshot visa manter a estabilidade do treinamento sob essa configuração esparsa.
Balanceamento por Quantis
Modelos de Mistura de Especialistas precisam distribuir tokens razoavelmente entre os especialistas para evitar sobrecarregar alguns poucos.
O K3 adota a técnica de balanceamento por quantis, que atribui especialistas com base nos quantis das pontuações do roteador, em vez de depender de estratégias de balanceamento ajustadas manualmente. A Moonshot afirma que isso elimina os hiperparâmetros sensíveis de balanceamento de carga, tornando a alocação de especialistas em grande escala mais estável.
Otimizador por Cabeça
O K3 estende o otimizador Muon, implementando a otimização Muon por cabeça.
Este esquema decompõe os parâmetros de atenção em estruturas independentes, otimizando cada cabeça de atenção separadamente. O objetivo é fornecer um comportamento de otimização mais adaptativo para cada cabeça de atenção no treinamento em larga escala.
SiTU e Gated MLA
Dois componentes adicionais suportam o controle de ativação e atenção:
- Unidade Sigmoid Tanh (SiTU) melhora o controle de ativação
- Gated MLA aumenta a flexibilidade na seleção de atenção
Combinando KDA, AttnRes, Stable LatentMoE, balanceamento por quantis e Muon por cabeça, a Moonshot afirma que essas melhorias proporcionam um ganho geral de eficiência de escalonamento de aproximadamente 2,5 vezes em comparação com o Kimi K2.
Treinamento com Consciência de Quantização e Arquitetura de Inferência
O Kimi K3 adota treinamento com consciência de quantização desde o estágio de ajuste fino supervisionado.
O blog técnico oficial lista:
- Pesos MXFP4
- Ativações MXFP8
O objetivo é melhorar a compatibilidade entre diferentes hardwares aceleradores, mantendo ao mesmo tempo a capacidade de treinar e implantar um modelo desse porte.
A Moonshot também sugere a implantação em supernós com mais de 64 aceleradores para uma inferência eficiente. Isso indica claramente que pesos abertos não equivalem a uma implantação local conveniente — este modelo de 2,8 trilhões de parâmetros continua sendo um sistema de infraestrutura pesada.
Mecanismo de Cache de Prefixo KDA
O KDA traz novos desafios para o cache de prefixo tradicional.
A Moonshot afirma ter desenvolvido uma implementação de cache de pré-preenchimento correspondente e a contribuído para o ecossistema vLLM. Sua API oficial atinge uma taxa de acerto de cache superior a 90% em cargas de trabalho relacionadas a código.
Essa camada de cache explica a enorme diferença de preço entre entradas com cache e sem cache. A implementação será lançada como código aberto junto com o modelo, e os desenvolvedores podem consultar o Kimi e os anúncios oficiais do vLLM para obter o repositório de código com status de disponibilidade e integração atuais.
Limitações Conhecidas
A Moonshot lista três limitações importantes do Kimi K3.
Sensibilidade ao Histórico de Raciocínio
O modo de treinamento do K3 retém o histórico de raciocínio anterior do modelo.
Se o framework do agente não retornar o histórico completo esperado, a qualidade da geração pode se tornar instável. Isso ocorre quando os usuários alternam de outros modelos para o Kimi K3 no meio de uma sessão ativa.
O mesmo problema pode ocorrer no K3.
A Moonshot recomenda o uso de ferramentas compatíveis verificadas (como Kimi Code) e evitar a troca de modelo no meio de uma sessão.
Proatividade excessiva
O K3 foi extensivamente treinado em tarefas longas e de alta dificuldade.
Como resultado, ele pode reagir de forma exagerada a pequenos problemas ou instruções vagas, tomando decisões inesperadas para o usuário.
Aplicações que exigem limites rigorosos devem defini-los claramente no prompt do sistema ou no arquivo AGENTS.md.
Diferença na experiência do usuário
A Moonshot afirma que, comparado ao Claude Fable 5 e ao GPT-5.6 Sol, o K3 ainda apresenta uma diferença significativa na experiência do usuário.
Essa ressalva é valiosa — pontuações de benchmark e demonstrações autônomas de engenharia não abrangem todos os aspectos da experiência de produção, incluindo consistência de resposta, latência, interpretação de instruções, confiabilidade das ferramentas e fluidez da conversa.
Disponibilidade e status de pesos abertos
O Kimi K3 está disponível através dos seguintes canais:
No lançamento, o K3 usa a intensidade de raciocínio máxima por padrão. A Moonshot afirma que atualizações futuras adicionarão opções com intensidades de raciocínio menores e maiores.
A empresa anunciou que os pesos completos do modelo serão lançados até 27 de julho de 2026. Até que esses pesos e o relatório técnico sejam divulgados, parte da arquitetura, configurações de benchmark, implementação MiniTriton e o fluxo de design de chip dependem das descrições já publicadas pela Moonshot.

O Kimi K3 eleva a escala do modelo aberto relatado pela Moonshot para 2,8 trilhões de parâmetros.
Perguntas frequentes
O que é o Kimi K3?
O Kimi K3 é um modelo multimodal nativo de 2,8 trilhões de parâmetros desenvolvido pela Moonshot AI, adequado para codificação de longo ciclo, trabalho de conhecimento, raciocínio visual e tarefas de agente. Ele suporta uma janela de contexto de 1 milhão de tokens, ativando 16 de 896 especialistas por token.
O Kimi K3 é open source?
A Moonshot chama o K3 de um modelo aberto de nível 3T e anunciou que os pesos completos do modelo serão lançados até 27 de julho de 2026. No momento da redação deste artigo, o lançamento dos pesos completos e do relatório técnico do K3 ainda não foi concluído.
Quanto custa a API do Kimi K3?
O preço internacional da API Kimi é: US$ 0,30 por milhão de tokens de entrada em cache, US$ 3,00 por milhão de tokens de entrada sem cache e US$ 15,00 por milhão de tokens de saída. Os preços podem variar.
Portanto, usuários de produção devem verificar as taxas atuais na plataforma oficial da API.
A capacidade de codificação front-end do Kimi K3 realmente é a número um?
O Kimi K3 ficou temporariamente em primeiro lugar no ranking Arena WebDev no lançamento. À medida que mais votos e modelos são adicionados, o ranking muda dinamicamente, portanto, consulte a página Arena em tempo real para a classificação mais recente.
O que é MiniTriton?
MiniTriton é um compilador GPU compacto que a Moonshot afirma ter sido construído do zero pelo Kimi K3. Ele contém uma representação intermediária em nível de bloco baseada em MLIR, passes de otimização, um pipeline de geração de código PTX e suporta treinamento nanoGPT ponta a ponta.
O Kimi K3 fabricou chips físicos?
Não há informações oficiais sobre tape-out físico. A Moonshot descreveu uma execução de automação de design eletrônico (EDA) autônoma de 48 horas, que concluiu o design, otimização, verificação e simulação do chip usando a biblioteca Nangate 45nm.
O Kimi K3 pode ser executado localmente?
O modelo é extremamente grande e a Moonshot recomenda, para configurações de inferência de implantação, pelo menos 64 aceleradores para uma operação eficiente. Mesmo após a abertura dos pesos, a execução local ainda requer infraestrutura especializada substancial ou soluções de implantação significativamente modificadas.
Quais são as principais limitações do Kimi K3?
A Moonshot aponta sua sensibilidade ao histórico de raciocínio retido, proatividade excessiva em tarefas ambíguas e uma diferença na experiência do usuário em comparação com Claude Fable 5 e GPT-5.6 Sol. Recomenda-se o uso de restrições explícitas de agente e estruturas de adaptação compatíveis.
Ferramentas relacionadas
- Kimi: O espaço de trabalho de agente da Moonshot, onde o Kimi K3 pode ser usado em fluxos de codificação, pesquisa, documentos, slides e visualização.
- Kimi Code: O agente de codificação de terminal de código aberto da Moonshot, também a estrutura de adaptação compatível com K3 recomendada.
- Plataforma de API Kimi: Serviço de API oficial para acessar
kimi-k3e outros modelos Kimi. - Ranking Arena WebDev: Ranking de votação da comunidade em tempo real para modelos de front-end e desenvolvimento web.
- Triton: Linguagem e compilador de código aberto para escrever kernels GPU de alto desempenho.
- MLIR: Infraestrutura de compilador reutilizável do LLVM para construir representações intermediárias e pipelines de otimização.
- vLLM: Motor de inferência de LLM de código aberto que suporta inferência de alta taxa de transferência e cache de prefixo.
- OpenROAD: Conjunto de ferramentas de código aberto RTL-to-GDSII relacionado ao fluxo de design automatizado de chips.
Links relacionados
- Blog técnico oficial do Kimi K3: Artigo de lançamento da Moonshot cobrindo arquitetura, casos de codificação, preços, disponibilidade, avaliação e limitações.
- Plataforma de API Kimi K3: Fonte oficial atual para acesso e preços da API K3.
- Repositório GitHub do Kimi Code: Repositório oficial do agente de codificação e documentação de instalação.
- Ranking Arena WebDev: Classificação atual de modelos front-end e dados de votação.
- [DeepSWE
Ranking](https://deepswe.datacurve.ai/): Benchmark público de engenharia de software citado no relatório de avaliação da Moonshot.
- Program Bench: Benchmark de programação usado na comparação de codificação do K3.
- SWE Marathon: Benchmark de engenharia de software de longo ciclo citado pela Moonshot.
Visão geral
O Kimi K3 é o maior modelo da Moonshot até o momento, com um total de 2,8
8 trilhões de parâmetros, suporte nativo para entrada multimodal, janela de contexto de 100 mil tokens e ativação esparsa de 16 entre 896 especialistas.
Seu resultado inicial mais notável está no campo da engenharia de ciclo longo. O K3 ficou em primeiro lugar no ranking preliminar do Frontend Code Arena, otimizou núcleos de GPU, construiu o compilador MiniTriton e concluiu um fluxo de trabalho de design de chip analógico de 48 horas usando ferramentas EDA de código aberto.
A arquitetura incorpora o mecanismo de atenção Kimi Delta, conexão residual de atenção, MoE latente estável, balanceamento por quantis, otimizador Muon por cabeça, SiTU e MLA com portas. A Moonshot AI relata que a eficiência de escalonamento aumentou 2,5 vezes em comparação com o Kimi K2, ao mesmo tempo que reconhece limitações importantes em compatibilidade com agentes, proatividade e experiência geral do usuário.
A declaração mais importante do Kimi K3 não é que ele venceu todos os benchmarks, mas sim que mantém uma produção eficiente em tarefas de engenharia excepcionalmente longas, orientadas por visão e dependentes de ferramentas.