Kimi K3 domina el campo de batalla del código frontend, construye un compilador GPU y diseña un chip en 48 horas
Moonshot AI ha lanzado Kimi K3, un modelo multimodal nativo diseñado específicamente para codificación prolongada, trabajo intelectual, razonamiento visual y flujos de trabajo basados en agentes. El modelo cuenta con un total de 2.8 billones de parámetros, una ventana de contexto de 1 millón de tokens y una arquitectura de mezcla de expertos altamente dispersa: para cada token, solo se activan 16 de sus 896 expertos. Moonshot lo describe como el primer modelo abierto de nivel 3T, aunque el anuncio de la compañía indica que los pesos completos del modelo se lanzarán el 27 de julio de 2026. Kimi K3 ha llamado la atención de inmediato por sus logros en desarrollo frontend, optimización autónoma de núcleos de GPU, la creación de un pequeño compilador de GPU llamado MiniTriton, y experimentos de diseño de chips completados en 48 horas utilizando herramientas de automatización de diseño electrónico de código abierto. Moonshot también reconoce que K3 no lidera en todas las categorías. Su prop

Kimi K3 domina el campo de batalla del código frontend, construye un compilador GPU y diseña un chip en 48 horas
Introducción
Moonshot AI ha lanzado Kimi K3, un modelo multimodal nativo diseñado específicamente para codificación prolongada, trabajo intelectual, razonamiento visual y flujos de trabajo basados en agentes.
El modelo cuenta con un total de 2.8 billones de parámetros, una ventana de contexto de 1 millón de tokens y una arquitectura de mezcla de expertos altamente dispersa: para cada token, solo se activan 16 de sus 896 expertos. Moonshot lo describe como el primer modelo abierto de nivel 3T, aunque el anuncio de la compañía indica que los pesos completos del modelo se lanzarán el 27 de julio de 2026.
Kimi K3 ha llamado la atención de inmediato por sus logros en desarrollo frontend, optimización autónoma de núcleos de GPU, la creación de un pequeño compilador de GPU llamado MiniTriton, y experimentos de diseño de chips completados en 48 horas utilizando herramientas de automatización de diseño electrónico de código abierto.
Moonshot también reconoce que K3 no lidera en todas las categorías. Su propia evaluación muestra que el modelo se queda atrás de Claude Fable 5 y GPT-5.6 Sol en rendimiento general, pero ofrece mejores resultados en múltiples tareas de codificación y agentes de larga duración.
Fuente de la imagen: Comparación inteligente de Artificial Analysis compartida en el artículo, que muestra la posición de Kimi K3.
Un modelo Kimi más costoso
Kimi K3 ha elevado los precios de la API de Moonshot a un nivel superior al de los primeros modelos de codificación Kimi.
La tabla de precios del informe original enumera las siguientes tarifas para la API china:
| Modelo | Entrada con acierto de caché | Entrada sin acierto de caché | Salida |
|---|---|---|---|
| Kimi K3 | ¥2 por millón de tokens | ¥20 por millón de tokens | ¥100 por millón de tokens |
| Kimi K2.7 Code | ¥1.30 por millón de tokens | ¥6.50 por millón de tokens | ¥27 por millón de tokens |
Comparación de precios entre Kimi K3 y Kimi K2.7 Code según el artículo fuente.
La plataforma internacional de API de Moonshot enumera los siguientes precios para Kimi K3:
- $0.30 por millón de tokens de entrada con acierto de caché
- $3.00 por millón de tokens de entrada sin acierto de caché
- $15.00 por millón de tokens de salida
Esto es considerablemente más caro que Kimi K2.7 Code, pero sigue siendo inferior al precio de Claude Fable 5 citado por Moonshot en la comparación de lanzamiento.
com/cms-assets/image/2026/07/2761809f-7dbb-4570-911c-c2867cbb026a-5ef22221-611a-4252-a82e-af74b77e7af1.png)
La tabla comparativa de precios muestra que el precio de salida de Kimi K3 es solo el 30% de la cotización de Claude Fable 5.
Se debe tener precaución al leer las comparaciones de precios. Las tarifas de API pueden variar según la región, el proveedor, el comportamiento de la caché y las actualizaciones posteriores del producto. Antes de la implementación, la página oficial de la API de Kimi es la mejor manera de verificar las tarifas de facturación actuales.
Kimi K3 ocupa el primer lugar en el Arena de Código Frontend
El resultado más llamativo proviene del ámbito del desarrollo frontend.
Hasta el momento de publicación de este artículo, Kimi K3 ocupa el primer lugar en la Clasificación WebDev preliminar del Arena de Código Frontend. El gráfico fuente muestra una tasa de victorias del 76%, superando a Claude Fable 5 y GPT-5.6 Sol.

Kimi K3 ocupa el primer lugar en los resultados preliminares del Arena de Código Frontend presentados en el informe.
En siete categorías frontend, el informe original afirma que K3 ocupa el primer lugar en seis de ellas:
- Sitios web de marca y marketing
- Diseño a partir de imágenes de referencia
- Interfaces de análisis de datos
- Productos de consumo
- Simulaciones
- Herramientas de creación de contenido
Según el informe, ocupa el segundo lugar en la categoría de juegos.
Estos resultados son particularmente importantes porque el trabajo frontend no es solo un problema de generación de código. Un modelo grande competente debe poder interpretar requisitos visuales, crear aplicaciones funcionales, ejecutarlas, inspeccionar los resultados y modificar la implementación cuando la interfaz no coincida con el diseño previsto.
Reconstrucción de una interfaz de estilo macOS en el navegador
Un ejemplo citado en el artículo original es la recreación de una interfaz de estilo macOS 27 utilizando un clúster de agentes en aproximadamente seis horas.
El resultado no es solo una captura de pantalla estática. El informe afirma que, con algunas excepciones como las funciones de navegador y teléfono, la mayoría de las aplicaciones e interacciones de escritorio funcionan correctamente.

Una interfaz de navegador generada por agentes que imita un sistema operativo de escritorio moderno.
Otras demostraciones incluyen un simulador de brazo robótico y un juego 3D completamente programático, basado en navegador, que utiliza Three.js y WebGPU.
Estos ejemplos siguen siendo demostraciones, no evaluaciones comparativas estandarizadas, pero muestran el tipo de flujos de trabajo que Moonshot espera que K3 admita: creación de software de larga duración, visual e iterativa.
Visión en el bucle
Moonshot describe el flujo de trabajo frontend de K3 como visión en el bucle.
El modelo no genera código de una sola vez y se detiene, sino que puede:
- Escribir o modificar código de aplicación.
- Ejecutar el proyecto.
- Inspeccionar capturas de pantalla en tiempo real o resultados renderizados.
- Detectar problemas de diseño, color, jerarquía o interacción.
- Modificar el código.
- Volver a renderizar los resultados actualizados y repetir el proceso.
Este flujo cierra la brecha entre la generación de código y la evaluación visual.
Un modelo puede generar HTML, CSS y JavaScript sintácticamente válidos, pero aún así producir interfaces deficientes. Al observar la salida renderizada, K3 puede identificar problemas que son difíciles de detectar solo con el código fuente.
Para repositorios frontend más grandes, la ventana de contexto de 1 millón de tokens también es crucial. Puede contener una gran cantidad de componentes, definiciones de tipos, reglas de sistemas de diseño, documentación del proyecto y dependencias entre archivos en un solo contexto de trabajo.
El artículo original también menciona una compensación: algunos usuarios informan que las tareas frontend complejas tardan entre 20 minutos y una hora en completarse. Estas son solo observaciones individuales, no mediciones de latencia controladas, pero indican que K3
Puede preferir iteraciones prolongadas en lugar de resultados inmediatos.
Puntos de referencia de programación e ingeniería de ciclo largo
La programación es una de las fortalezas principales de Kimi K3.
La tabla de puntos de referencia del informe original muestra los siguientes resultados:
| Prueba de referencia | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |

Resultados reportados de Kimi K3 en múltiples evaluaciones de programación e ingeniería de software.
El blog oficial de Kimi K3 proporciona aclaraciones metodológicas importantes.
Para DeepSWE, Moonshot reporta en su comparativa principal los resultados del framework Kimi Code, mientras que el resultado en el ranking público de mini-SWE-agent es de 67.3. Por lo tanto, pueden aparecer ligeras diferencias según el framework y la configuración de evaluación.
Para SWE Marathon, Moonshot utilizó la rama de calibración H20 de las tareas oficiales. La compañía también señala que Claude Fable 5 mostró comportamientos de respaldo en algunas evaluaciones, lo que pudo haber reducido su puntuación medida.
Estos detalles no invalidan los resultados, pero son importantes al comparar modelos. El framework del agente, los permisos de herramientas, el hardware, la configuración de inferencia, los comportamientos de respaldo y la calibración de tareas pueden afectar la puntuación final.
Optimización autónoma de kernels de GPU
Moonshot probó si Kimi K3 podía optimizar kernels de GPU con mínima supervisión humana.
Cada modelo recibió el mismo entorno aislado y tuvo un máximo de 24 horas para analizar, reescribir, realizar pruebas comparativas y optimizar los siguientes kernels relacionados:
- Residual de atención
- Atención Kimi Delta
- Una carga de trabajo MLA con 512 cabezas de dimensión
- GPU genérica de otro proveedor
Las pruebas de NVIDIA se ejecutaron en hardware H200.
Optimización de AttnRes
Para la carga de trabajo de residual de atención, el texto original indica que K3 diseñó un nuevo algoritmo de kernel en dos fases, reduciendo el
tiempo combinado de ejecución forward y backward de 283.6 ms a 114.4 ms.
Esto representa una aceleración de aproximadamente el 59.7% sobre la línea base, acercando a Kimi K3 al rendimiento de Claude Fable 5 en la configuración experimental de Moonshot.

Gráfico de la trayectoria de mejora reportada de Kimi K3 en la tarea del kernel AttnRes.
El gráfico también muestra la mejora del agente a lo largo del tiempo. K3 logró varios avances significativos al inicio de la ejecución, y luego continuó optimizando el kernel mediante iteraciones posteriores.
Kernel MLA-512
En la tarea MLA-512, partiendo de cero, el kernel de Kimi K3 alcanzó los 517.8 TFLOPS reportados bajo carga combinada forward y backward.
El segundo resultado más alto mostrado en el informe fue de aproximadamente 492.7 TFLOPS.

Kimi K3 alcanzó los 517.8 TFLOPS reportados en la tarea de optimización MLA-512.
Moonshot indica que, en las etapas posteriores del desarrollo del modelo, las versiones tempranas de K3 asumieron la mayor parte del trabajo de optimización de kernels del equipo. Se trata de un flujo de trabajo reportado por la propia compañía y no ha sido auditado de forma independiente en los materiales enlazados en la fuente.
MiniTriton: Un compilador de GPU construido desde cero
El siguiente experimento fue más allá de la optimización de un solo kernel.
Moonshot exploró si Kimi K3 podía construir un pequeño sistema de programación de GPU desde cero. El resultado fue MiniTriton, un compilador compacto similar a Triton que incluye:
- Su propia representación intermedia a nivel de tile
- Una capa de IR construida sobre MLIR
- Procesos de optimización
- Un pipeline de generación de código PTX
- Soporte en tiempo de ejecución para los kernels generados
Moonshot informa que MiniTriton igualó o superó el rendimiento de Triton y torch.compile en las pruebas de referencia de roofline compatibles, incluida la superación de Triton en algunas cargas de trabajo.

com/cms-assets/image/2026/07/664fc2e9-1b2c-459d-b907-898ed77df1af-2b65c54f-ba91-475a-81e6-9a3472a15637.png)
Rendimiento de la línea de cima de CUDA de MiniTriton informado en una GPU NVIDIA L20.
El compilador también admite el entrenamiento de extremo a extremo de nanoGPT y logra una convergencia estable. Según Moonshot, su curva de pérdida se mantiene cerca de la implementación de referencia, con solo ligeras desviaciones.
Esto es más significativo que las pruebas aisladas de microbenchmarks. Indica que el sistema generado puede conectar el lenguaje frontend, la representación intermedia, el pipeline de optimización, la generación de PTX y el tiempo de ejecución en un flujo de trabajo coherente.
Sin embargo, al momento de redactar este artículo, Moonshot no ha publicado el código de MiniTriton. Por lo tanto, las afirmaciones de rendimiento provienen de los materiales de lanzamiento de Kimi K3 y aún no se pueden reproducir mediante código publicado oficialmente.
Un chip diseñado en una ejecución autónoma de 48 horas
Kimi K3 también fue probado en el diseño de chips.
En una ejecución autónoma de 48 horas, el modelo utilizó herramientas EDA de código abierto y el kit de diseño de proceso Nangate 45nm para construir, optimizar y verificar un chip destinado a servir modelos pequeños basados en la arquitectura K3.
Moonshot informó los siguientes resultados de diseño simulados:
- Área inferior a 4 mm²
- 1,46 millones de celdas estándar
- 0,277 MB de SRAM
- Cierre de temporización a 100 MHz
- Rendimiento de decodificación simulado superior a 8700 tokens por segundo
- Matriz de multiplicación y acumulación INT4 con des-cuantización fusionada

Este estudio de caso de diseño de chips informó una velocidad de procesamiento de más de 8700 tokens por segundo en simulación.
La diferencia entre un diseño digital verificado y un chip físico fabricado es importante.
Los materiales públicos describen un ejercicio de diseño, optimización, temporización y simulación EDA. No indican que el chip haya sido tape-out, fabricado, encapsulado y probado en silicio.
Incluso con esta limitación, completar un pipeline extendido de diseño de hardware es un caso notable de codificación a largo plazo. Requiere que el agente coordine entre decisiones de arquitectura, descripción de hardware, síntesis, colocación y enrutamiento, verificación de temporización, validación y optimización iterativa.
Dos innovaciones centrales detrás de la escala de 2.8T
Kimi K3 se basa en dos tecnologías desarrolladas por Moonshot AI:
- Kimi Delta Attention
- Attention Residuals (Residuos de Atención)
El modelo combina estas tecnologías con una arquitectura de mezcla de expertos con activación más dispersa.

Kimi K3 combina KDA, Residuos de Atención, Gated MLA y Stable LatentMoE.
Kimi Delta Attention
Kimi Delta Attention, abreviado KDA, está diseñado para hacer que el mecanismo de atención sea más eficiente en secuencias largas.
KDA no depende completamente de la atención completa estándar en todo el contexto, sino que proporciona un mecanismo eficiente para manejar entradas largas mientras retiene la información necesaria para tareas de codificación, razonamiento y agente.
Esta es una de las bases del contexto de nivel de millones de tokens del modelo K3.
Mecanismo de Residuos de Atención
Las capas tradicionales de Transformer agregan repetidamente la salida de cada nueva capa al estado oculto acumulado.
El mecanismo de Residuos de Atención (AttnRes) cambia este patrón. Permite que las capas subsiguientes recuperen selectivamente representaciones de diferentes profundidades, en lugar de tratar simplemente todas las capas anteriores como parte de un flujo acumulativo unificado.
Moonshot lo describe como una forma más flexible de flujo de información en modelos ultra profundos.
Arquitectura Stable LatentMoE
Kimi K3 tiene 896 módulos de expertos, pero cada token activa solo 16 expertos.
Esta dispersión extrema reduce el cálculo por token (en relación con el tamaño general del modelo), pero también aumenta la dificultad del enrutamiento y el equilibrio de carga. El marco Stable LatentMoE de Moonshot tiene como objetivo mantener la estabilidad del entrenamiento bajo esta configuración dispersa.
Equilibrio de Cuantiles
Los modelos de mezcla de expertos necesitan distribuir los tokens entre los expertos de manera razonable para evitar la sobrecarga de unos pocos expertos.
K3 adopta la técnica de Equilibrio de Cuantiles, que asigna expertos basándose en los cuantiles de las puntuaciones del enrutador, en lugar de depender de estrategias de equilibrio ajustadas manualmente. Moonshot dice que esto elimina los hiperparámetros sensibles de equilibrio de carga, haciendo que la asignación de expertos a gran escala sea más estable.
Optimizador por Cabeza
K3 extiende el optimizador Muon para implementar la Optimización Muon por Cabeza.
Este esquema descompone los parámetros de atención en estructuras independientes y optimiza cada cabeza de atención por separado. El objetivo es proporcionar un comportamiento de optimización más adaptable para cada cabeza de atención durante el entrenamiento a gran escala.
SiTU y Gated MLA
Dos componentes adicionales apoyan el control de activación y atención:
- Unidad Sigmoid Tanh (SiTU) mejora el control de activación
- Gated MLA aumenta la flexibilidad de selección de atención
Combinados con KDA, AttnRes, Stable LatentMoE, Equilibrio de Cuantiles y Muon por Cabeza, Moonshot afirma que estas mejoras aumentan la eficiencia general de escalado en aproximadamente 2,5 veces en comparación con Kimi K2.
Entrenamiento con Conocimiento de Cuantificación y Arquitectura de Inferencia
Kimi K3 adopta el entrenamiento con conocimiento de cuantificación desde la etapa de ajuste fino supervisado.
El blog técnico oficial enumera:
- Pesos MXFP4
- Activaciones MXFP8
El objetivo es mejorar la compatibilidad entre diferentes hardware aceleradores mientras se mantiene la capacidad de entrenar e implementar un modelo de este tamaño.
Moonshot también recomienda implementaciones con supernodos de más de 64 aceleradores para una inferencia eficiente. Esto indica claramente que los pesos abiertos no equivalen a una implementación local conveniente: este modelo de 2,8 billones de parámetros sigue siendo un sistema de infraestructura pesada.
Mecanismo de Caché de Prefijo KDA
KDA presenta nuevos desafíos para el caché de prefijo tradicional.
Moonshot dice que ha desarrollado una implementación de caché de relleno correspondiente y la ha contribuido al ecosistema vLLM. Su API oficial reporta una tasa de aciertos de caché superior al 90% en cargas de trabajo de tipo código.
Esta capa de caché explica la gran diferencia de precio entre las entradas con y sin caché. La implementación se publicará como código abierto junto con el modelo, y los desarrolladores pueden consultar los anuncios oficiales de Kimi y vLLM.
Los repositorios de código con el estado de disponibilidad e integración actuales.
Limitaciones Conocidas
Moonshot enumera tres limitaciones importantes de Kimi K3.
Sensibilidad al Historial de Pensamiento
El modo de entrenamiento de K3 conserva el historial de pensamiento anterior del modelo.
Si el marco del agente no devuelve el historial completo esperado, la calidad de la generación puede volverse inestable. Cuando los usuarios cambian de otro modelo a
El mismo problema puede ocurrir durante K3.
Moonshot AI recomienda utilizar herramientas compatibles verificadas (como Kimi Code) y evitar cambiar de modelo en medio de una sesión.
Proactividad excesiva
K3 ha sido entrenado intensivamente en tareas largas y de alta dificultad.
Por lo tanto, puede reaccionar de forma exagerada ante problemas menores o instrucciones ambiguas, tomando decisiones que el usuario no esperaba.
Las aplicaciones que requieren límites estrictos deben definir explícitamente estos límites en el prompt del sistema o en el archivo AGENTS.md.
Brecha en la experiencia de usuario
Moonshot AI señala que, en comparación con Claude Fable 5 y GPT-5.6 Sol, K3 todavía presenta una brecha notable en la experiencia de usuario.
Esta limitación es valiosa: las puntuaciones de referencia y las demostraciones de ingeniería autónoma no abarcan todos los aspectos de la experiencia de producción, incluida la consistencia de respuestas, la latencia, la interpretación de instrucciones, la fiabilidad de las herramientas y la fluidez de la conversación.
Disponibilidad y estado de pesos abiertos
Kimi K3 está disponible a través de los siguientes canales:
En su lanzamiento, K3 utiliza por defecto la intensidad de pensamiento máxima. Moonshot AI indica que las actualizaciones posteriores agregarán opciones de intensidad de pensamiento menor y mayor.
La compañía ha anunciado que los pesos completos del modelo se publicarán antes del 27 de julio de 2026. Hasta que estos pesos y el informe técnico se hagan públicos, parte de la arquitectura, la configuración de las pruebas de referencia, la implementación de MiniTriton y el flujo de diseño de chips dependen de las descripciones ya publicadas por Moonshot AI.

Kimi K3 eleva la escala del modelo abierto reportado por Moonshot AI a 2,8 billones de parámetros.
Preguntas frecuentes
¿Qué es Kimi K3?
Kimi K3 es un modelo nativo multimodal de 2,8 billones de parámetros desarrollado por Moonshot AI, adecuado para codificación de ciclo largo, trabajo de conocimiento, razonamiento visual y tareas de agente. Admite una ventana de contexto de 1 millón de tokens, activando 16 de los 896 expertos por token.
¿Kimi K3 es de código abierto?
Moonshot AI denomina a K3 un modelo abierto de nivel 3T y ha anunciado que los pesos completos del modelo se publicarán antes del 27 de julio de 2026. En el momento de redactar este artículo, la publicación de los pesos completos de K3 y el informe técnico aún no se han completado.
¿Cuál es el costo de la API de Kimi K3?
El precio internacional de la API de Kimi es: 0,30 USD por cada millón de tokens de entrada en caché, 3,00 USD por cada millón de tokens de entrada sin caché y 15,00 USD por cada millón de tokens de salida. Los precios pueden variar.
Por lo tanto, los usuarios de producción deben verificar las tarifas actuales en la plataforma oficial de la API.
¿La capacidad de codificación frontend de Kimi K3 es realmente la número uno?
Kimi K3 se ubicó temporalmente en el primer lugar de la lista Arena WebDev en el momento de su lanzamiento. A medida que se agreguen más votos y modelos, la lista cambiará dinámicamente, por lo que para conocer la clasificación más reciente, consulte la página de Arena en tiempo real.
¿Qué es MiniTriton?
MiniTriton es un compilador de GPU compacto que Moonshot AI afirma que Kimi K3 construyó desde cero. Incluye una representación intermedia a nivel de bloque basada en MLIR, pases de optimización, una canalización de generación de código PTX y admite el entrenamiento de nanoGPT de extremo a extremo.
¿Kimi K3 fabricó chips físicos?
No se ha publicado información oficial sobre la fabricación física de chips. Moonshot AI describe una ejecución de automatización de diseño electrónico (EDA) autónoma de 48 horas que completó el diseño, optimización, verificación y simulación de chips utilizando la biblioteca Nangate de 45 nm.
¿Se puede ejecutar Kimi K3 localmente?
El modelo es extremadamente grande. Moonshot AI recomienda que la configuración de inferencia para implementación requiera al menos 64 aceleradores para un funcionamiento eficiente. Incluso después de la publicación de los pesos abiertos, la ejecución local aún requiere una infraestructura profesional sustancial o esquemas de implementación significativamente modificados.
¿Cuáles son las principales limitaciones de Kimi K3?
Moonshot AI señala que es sensible al historial de pensamiento retenido, es demasiado proactivo en tareas ambiguas y tiene una brecha en la experiencia de usuario en comparación con Claude Fable 5 y GPT-5.6 Sol. Se recomienda el uso de restricciones explícitas para los agentes y marcos de adaptación compatibles.
Herramientas relacionadas
- Kimi: El espacio de trabajo de agente de Moonshot AI, que permite usar Kimi K3 en flujos de codificación, investigación, documentos, presentaciones y visualización.
- Kimi Code: El agente de codificación de terminal de código abierto de Moonshot AI y el marco de adaptación compatible con K3 recomendado.
- Plataforma API de Kimi: Servicio de API oficial para acceder a
kimi-k3y otros modelos de Kimi. - Lista Arena WebDev: Lista de clasificación comunitaria en tiempo real con votos para modelos frontend y de desarrollo web.
- Triton: Lenguaje y compilador de código abierto para escribir kernels de GPU de alto rendimiento.
- MLIR: Infraestructura de compilador reutilizable de LLVM para construir representaciones intermedias y canalizaciones de optimización.
- vLLM: Motor de inferencia de modelos de lenguaje grandes de código abierto que admite inferencia de alto rendimiento y almacenamiento en caché de prefijos.
- OpenROAD: Cadena de herramientas RTL-to-GDSII de código abierto relacionada con flujos de diseño de chips automatizados.
Enlaces relacionados
- Blog técnico oficial de Kimi K3: Artículo de lanzamiento de Moonshot AI que cubre arquitectura, casos de codificación, precios, disponibilidad, evaluación y limitaciones.
- Plataforma API de Kimi K3: Fuente oficial actual para el acceso y los precios de la API de K3.
- Repositorio GitHub de Kimi Code: Repositorio oficial del agente de codificación y documentación de instalación.
- Lista Arena WebDev: Clasificaciones actuales de modelos frontend y datos de votación.
- [DeepSWE
Leaderboard](https://deepswe.datacurve.ai/): Prueba de referencia pública de ingeniería de software citada en el informe de evaluación de Moonshot AI.
- Program Bench: Prueba de referencia de programación utilizada en la comparación de codificación de K3.
- SWE Marathon: Prueba de referencia de ingeniería de software de ciclo largo citada por Moonshot AI.
Resumen
Kimi K3 es el modelo más grande de Moonshot AI hasta la fecha, con un total de 2.
8 billones de parámetros, admite entrada multimodal nativa, posee una ventana de contexto de 1 millón de tokens y activa de forma dispersa 16 de 896 expertos.
Su resultado temprano más destacado se refleja en el ámbito de la ingeniería de ciclo largo. K3 ocupa el primer lugar en el ranking preliminar del campo de front-end code arena, ha optimizado núcleos de GPU, ha construido el compilador MiniTriton y ha completado un flujo de trabajo de diseño de chips analógicos de 48 horas utilizando herramientas EDA de código abierto.
La arquitectura integra el mecanismo de atención Kimi Delta, conexiones residuales de atención, MoU latente estable, equilibrio por cuantiles, optimizador Muon por cabeza, SiTU y MLA con compuerta. Moon's Dark Side reporta que, en comparación con Kimi K2, la eficiencia de escalado ha mejorado 2.5 veces, aunque también reconoce limitaciones importantes en compatibilidad con agentes, proactividad y experiencia de usuario general.
La afirmación más importante de Kimi K3 no es que haya ganado todos los puntos de referencia, sino que puede mantener un rendimiento eficiente en tareas de ingeniería excepcionalmente largas, impulsadas visualmente y dependientes de cadenas de herramientas.