Kimi K3 ya tiene pesos abiertos: Explorando el modelo de frontera de 2.8T parámetros de Moonshot AI

Moonshot AI ha cumplido su promesa al publicar los pesos completos de Kimi K3, su modelo más grande y ambicioso hasta la fecha. El modelo ya está disponible en las páginas oficiales de Hugging Face y GitHub de Moonshot AI, junto con un informe técnico detallado y proyectos de infraestructura complementarios. Kimi K3 es un modelo nativo multimodal de mezcla de expertos, con 2,8 billones de parámetros totales, aproximadamente 104 mil millones de parámetros activados por token y una ventana de contexto de 1 millón de tokens. Moonshot

发布于 2026年7月30日generalGEO 评分: 06 次阅读
Esta imagen es una ilustración promocional del lanzamiento del gran modelo Kimi K3 por Moonshot AI, con un fondo negro profundo combinado con un diseño tecnológico en azul violeta. En el centro destaca el texto blanco 'Kimi K3 Is Now Open-Weight', con el logotipo semitransparente de 'Kimi' arriba y el nombre de la marca 'moonshot AI' abajo. A la derecha, hay un icono de candado tecnológico violeta brillante con patrones de conexión de nodos geométricos en la superficie, flotando sobre una plataforma con un halo, rodeado de trazos de puntos luminosos. A la izquierda, hay una tarjeta de modelo con un símbolo de código, destacando la característica de pesos abiertos de este modelo de frontera de 2,8T parámetros.

Kimi K3 ya tiene pesos abiertos: Explorando el modelo de frontera de 2.8 billones de parámetros de Moonshot AI

Introducción

Moonshot AI ha cumplido su promesa y ha lanzado oficialmente los pesos completos de su modelo más grande y ambicioso hasta la fecha: Kimi K3.

El modelo ya está disponible para su descarga a través de las páginas oficiales de Moonshot AI en Hugging Face y GitHub, acompañado de un informe técnico detallado y un proyecto de infraestructura complementario.

Kimi K3 es un modelo nativo multimodal de mezcla de expertos, con 2.8 billones de parámetros totales, aproximadamente 104 mil millones de parámetros activados por token, y una ventana de contexto de 1 millón de tokens.

Moonshot lo posiciona como un modelo de frontera de pesos abiertos, diseñado para programación de larga duración, investigación, comprensión multimodal, trabajo de conocimiento de agentes y tareas de razonamiento que pueden abarcar cientos o miles de pasos.

La importancia de este lanzamiento se refleja en dos aspectos.

En primer lugar, el modelo en sí mismo lleva la escala de pesos abiertos al nivel de 3 billones de parámetros.

En segundo lugar, Moonshot ha revelado mucho más que los puntos de control del modelo. Los materiales públicos detallan su arquitectura, estrategia de post-entrenamiento, infraestructura de aprendizaje por refuerzo de contexto largo, sistema de entrenamiento paralelo de expertos, optimización de inferencia, resultados de evaluaciones comparativas y múltiples estudios de casos de ingeniería de larga duración.

Esta imagen muestra la página del proyecto GitHub de Moonshot AI para el lanzamiento del modelo de código abierto Kimi K3, con la rama principal del proyecto, 1 rama, 0 etiquetas, y la última confirmación fue una confirmación inicial hace 7 minutos. En la página se puede ver que el proyecto contiene una carpeta de activos, un archivo LICENSE, un archivo README.md, y un archivo de informe técnico llamado k3_tech_report.pdf. Estos son los materiales complementarios mencionados en el documento que se publican junto con Kimi K3. Los usuarios pueden ver el contenido relacionado con el código del proyecto a través del botón "Code" de la página.

Pesos completos de Kimi K3 ahora disponibles

Moonshot anunció anteriormente el lanzamiento de Kimi K3 y prometió publicar los pesos completos antes del 27 de julio de 2026.

Ese lanzamiento ya se ha completado.

El modelo oficial se puede obtener a través de los siguientes canales:

El repositorio de GitHub contiene un archivo README, la licencia de Kimi K3, el informe técnico completo, recursos de arquitectura y evaluaciones comparativas, guías de implementación e instrucciones de uso del modelo.

La tarjeta del modelo en Hugging Face proporciona la configuración del modelo y el acceso a los pesos publicados.

Esto significa que el modelo ha pasado de ser un sistema de frontera alojado con planes de publicación abierta, a ser un modelo que los investigadores y los equipos de infraestructura calificados pueden descargar, inspeccionar, implementar, ajustar y adaptar según los términos de la licencia de Kimi K3.

La imagen muestra información sobre Kimi K3. Kimi K3 está disponible hoy en Kimi.com, Kimi Work, Kimi Code y Kimi API. Al inicio, Kimi K3 usará el máximo esfuerzo de pensamiento de forma predeterminada, y las actualizaciones posteriores introducirán modos de esfuerzo bajo-alto. Actualmente se está trabajando estrechamente con socios de inferencia y mantenedores de código abierto para garantizar la coherencia de los detalles técnicos y lograr una implementación confiable del ecosistema. Los pesos completos del modelo se publicarán el 27 de julio de 2026, y los detalles de la arquitectura, el entrenamiento y la evaluación se publicarán junto con el informe técnico de Kimi K3.

¿Qué significa "abierto" para Kimi K3?

Kimi K3 se describe mejor como un modelo de pesos abiertos con código y documentación públicos.

La licencia otorga derechos amplios, permitiendo a los usuarios usar, copiar, modificar, ajustar, implementar, crear trabajos derivados, redistribuir, sublicenciar y vender copias de acuerdo con los términos de la licencia.

Sin embargo,

la licencia incluye requisitos comerciales adicionales.

Por ejemplo, una empresa que opera un negocio de Modelo como Servicio (MaaS) con ingresos totales superiores a 20 millones de dólares en un período consecutivo de 12 meses debe firmar un acuerdo por separado con Moonshot AI antes de usar Kimi K3 o sus derivados con fines comerciales.

La licencia también tiene requisitos de visualización para ciertos productos o servicios comerciales extremadamente grandes que superan los umbrales especificados de usuarios o ingresos.

El uso interno y el uso a través de productos oficiales de Moonshot o socios de inferencia certificados se tratarán de manera diferente.

Por lo tanto, cualquier persona que use Kimi K3 con fines comerciales debe leer la licencia real cuidadosamente, en lugar de asumir que es igual a Apache 2.0, MIT u otras licencias permisivas estándar.

Un modelo de 2.8 billones de parámetros con 104 mil millones de parámetros activados

La capacidad total de Kimi K3 es extremadamente grande, pero su diseño de mezcla de expertos (MoE) significa que no todos los tokens activan los 2.8 billones de parámetros completos.

La tarjeta oficial del modelo enumera la siguiente información:

Especificación Kimi K3
Arquitectura Mezcla de expertos (MoE)
Parámetros totales 2.8T
Parámetros activados 104B
Número de capas 93
Capas densas 1
Expertos enrutados 896
Expertos seleccionados por token 16
Expertos compartidos 2
Tamaño del vocabulario 160K
Longitud del contexto 1,048,576 tokens
Codificador visual MoonViT-V2
Parámetros del codificador visual 401M
Método de cuantificación MXFP4 pesos / MXFP8 activaciones
Modalidades Texto e imagen

El informe técnico proporciona una comparación de arquitectura más precisa con Kimi K2.

La imagen es una tabla de comparación de arquitectura entre Kimi K2 y Kimi K3, que muestra las diferencias en el número de capas, parámetros totales, parámetros activados, dimensiones ocultas, dimensiones de expertos, etc. Kimi K3 tiene mejoras en el número de capas, parámetros totales, parámetros activados, dimensiones de expertos, etc., como un aumento del 52% en el número de capas, un aumento del 167% en los parámetros totales y un aumento del 220% en los parámetros activados. Al mismo tiempo, Kimi K3 introduce nuevos mecanismos de atención y residuales, y hay cambios en la longitud del contexto de entrenamiento, el mecanismo de atención, la función de activación, etc. Esta tabla está estrechamente relacionada con el contexto y muestra visualmente las mejoras arquitectónicas de Kimi K3 en comparación con Kimi K2.

En comparación con Kimi K2, K3 ha aumentado la profundidad del modelo y la dispersión de expertos, al tiempo que introduce nuevos mecanismos de atención y residuales.

Moonshot afirma que, sobre la base de Kimi K2, mediante mejoras integrales en la arquitectura y el método de entrenamiento, la eficiencia general de escalado ha mejorado aproximadamente 2.5 veces.

Esta afirmación se refiere a la eficiencia con la que la capacidad computacional adicional se convierte en capacidad del modelo, no a una mejora general de 2.5 veces en la velocidad de inferencia.

Multimodalidad nativa y ventana de contexto de un millón de tokens

Kimi K3 está diseñado como un modelo nativo multimodal, no como un modelo de lenguaje con un módulo visual añadido al final del entrenamiento.

Su codificador visual MoonViT-V2 tiene aproximadamente 401 millones de parámetros.

El informe técnico señala que MoonViT-V2 se entrenó desde cero con el objetivo de predicción del siguiente token del modelo, en lugar de inicializarse a partir de un modelo visual preentrenado contrastivo como SigLIP.

Moonshot informa que este método se mantuvo estable durante el entrenamiento y logró un rendimiento visual competitivo.

![La imagen muestra Moonshot

En los experimentos de ablación de preentrenamiento de IA, se muestra la variación de la norma del gradiente de la torre visual de diferentes modelos con respecto al número de pasos de entrenamiento. La figura (a) muestra la trayectoria completa del entrenamiento, mientras que la figura (b) es una ampliación de los pasos 14k a 16k. La línea azul representa MoonViT-3D inicializado desde SigLIP, y la línea roja representa MoonViT-V2 entrenado desde cero. En comparación con el modelo inicializado con SigLIP, MoonViT-V2 entrenado desde cero mantiene una norma de gradiente más baja y menos fluctuaciones, lo que indica una optimización más estable. Esta figura está estrechamente relacionada con el contexto y muestra de manera intuitiva la estabilidad de MoonViT-V2 durante el proceso de entrenamiento.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/63b386e9-0be5-4813-a254-4665269d9469-a3cea91a-babc-4ab7-9d22-af510c0efa46.jpeg)

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b6691c45-6229-4970-8a27-4e5a6deb00e1-dc511091-a635-4fc2-a80b-ab2e008b1415.png)

La longitud de contexto que admite este modelo es:

1,048,576 tokens

Esta escala es particularmente importante para los sistemas de agentes, ya que una tarea de codificación o investigación de larga duración puede acumular contenido del repositorio, salidas de herramientas, registros, capturas de pantalla, materiales de investigación, planes intermedios, registros de fallos de prueba, resultados de razonamientos anteriores y múltiples rondas de información corregida.

Un contexto de un millón de tokens no elimina la necesidad de gestionar el contexto, pero permite que K3 conserve un historial de trabajo mucho más extenso que los sistemas tradicionales de contexto corto.

Tres cambios arquitectónicos principales

El informe técnico atribuye la escala y estabilidad de K3 a varias modificaciones arquitectónicas.

Las tres más destacadas son:

  1. Mecanismo de atención híbrida KDA + MLA con puerta.
  2. Residuos de atención.
  3. Modelo de mezcla de expertos latente estable.

La imagen muestra la arquitectura de Kimi K3, dividida en tres partes. A la izquierda, se encuentran los módulos Stable Normalized LatentMoE y KDA, que incluyen componentes como Shared Expert, Routed Expert, Router, Linear, Norm, etc. En la parte superior derecha, se muestra la operación AttnRes, con Output, Stable LatentMoE, Gated MLA, Stable LatentMoE y KDA. A la derecha, está la columna vertebral de Block Attention Residuals, con Block n-1, Block n-2, Block n-3, etc. Esta figura está estrechamente relacionada con el contexto y muestra de manera intuitiva la estructura modular de los tres cambios principales en la arquitectura de Kimi K3.

1. Mecanismo de atención híbrida: KDA + MLA con puerta

Kimi K3 adopta un diseño de atención híbrida.

La tarjeta oficial del modelo indica:

69 capas KDA + 24 capas MLA con puerta

La arquitectura sigue un patrón repetitivo en el que múltiples capas de atención Kimi Delta se combinan con capas periódicas de atención latente multicabeza con puerta.

Atención Kimi Delta

KDA es un mecanismo de atención lineal diseñado para reducir la carga de memoria y computación asociada con contextos extremadamente largos.

En lugar de utilizar una caché KV tradicional que crece con cada token como en la atención completa estándar, KDA mantiene un estado recurrente.

Esto lo hace atractivo para secuencias de un millón de tokens.

Moonshot introdujo previamente KDA a través de la serie de investigación lineal Kimi, y el equipo informó que, en sus condiciones de evaluación, KDA redujo los requisitos de caché KV y mejoró el rendimiento de decodificación en contextos largos en comparación con la atención completa.

MLA con puerta

K3 no reemplaza por completo la atención global.

Las capas periódicas de MLA con puerta preservan la capacidad del modelo para recuperar información globalmente dentro del contexto.

Por lo tanto, este diseño híbrido intenta equilibrar dos objetivos:

  • Procesamiento eficiente de secuencias largas.
  • Recuperación global sólida.

La idea no es que la atención lineal sea siempre superior a la atención global, sino que cada mecanismo aborda diferentes partes del problema del contexto largo.

2. Residuos de atención

Las redes neuronales profundas necesitan transmitir información a través de múltiples capas, evitando al mismo tiempo la pérdida gradual de representaciones útiles.

Kimi K3 introduce residuos de atención (AttnRes) para cambiar la forma en que la información fluye a través de la profundidad.

Este mecanismo no depende de un flujo residual secuencial uniforme, sino que permite que los módulos posteriores recuperen selectivamente representaciones generadas por módulos anteriores.

Conceptualmente, esto proporciona un mecanismo de aprendizaje para la red, permitiéndole decidir qué información temprana debe mantenerse directamente accesible.

El objetivo es mejorar el flujo de información en un modelo de 93 capas sin obligar a cada característica a pasar estrictamente por la misma ruta residual exacta.

3. LatentMoE estable

Kimi K3 aumenta significativamente la dispersión de MoE.

El modelo incluye:

896 expertos enrutados

Pero cada token solo activa:

16 expertos enrutados

Además, el modelo incluye dos expertos compartidos.

Esto da como resultado un número total de parámetros muy grande, pero la cantidad de cálculo activo es mucho menor que el total de parámetros.

Con este nivel de dispersión, la estabilidad del entrenamiento y el equilibrio de expertos se convierten en problemas difíciles.

El diseño de LatentMoE estable de Moonshot incorpora varios mecanismos destinados a resolver estos problemas.

SiTU-GLU

Kimi K3 reemplaza SwiGLU con SiTU-GLU, una función de activación diseñada para evitar el crecimiento ilimitado bajo una expansión extrema.

La imagen muestra las estructuras de la rama de puerta y la rama ascendente de GLU, SwiGLU y SiTU-GLU, así como sus curvas de respuesta escalar. Todas las ramas reciben una entrada escalar x, y las curvas comparten un dominio de x ∈ [−10, 100]. La esquina inferior derecha muestra una ampliación del área cercana al origen. Cuando β1 = 4 y β2 = 25, la curva de SiTU-GLU se aproxima a la de SwiGLU cerca del origen, y cuando x es un número positivo grande, |f(x)| de SiTU-GLU ≤ β1β2 = 100, mientras que SwiGLU sigue sin límite. Esta figura está relacionada con el contenido de la introducción sobre el reemplazo de SwiGLU por SiTU-GLU en Kimi K3 para evitar el crecimiento ilimitado bajo una expansión extrema.

Equilibrio por cuantiles

El sistema también emplea un método de equilibrio de carga basado en sesgos de enrutamiento dinámicos, en lugar de depender completamente de las funciones de pérdida de equilibrio auxiliar tradicionales.

El objetivo es lograr una distribución más uniforme de los tokens enrutados entre los expertos sin introducir demasiada interferencia en el entrenamiento.

Entrenamiento de agentes con un millón de tokens

El informe técnico de Kimi K3 destaca especialmente el post-entrenamiento orientado a agentes de larga duración.

El modelo se entrenó en tres áreas:

  • Razonamiento general.
  • Tareas generales de agente.
  • Agente de programación.

También admite múltiples niveles de precisión de razonamiento:

  • Bajo.
  • Alto.
  • Máximo.

El modelo final combina múltiples estrategias especializadas a través de destilación en línea con múltiples maestros (MOPD).

Moonshot no entrena modelos permanentes independientes para cada dominio y nivel de precisión, sino que entrena modelos maestros especializados e integra su comportamiento en una política unificada de K3.

AgentENV: entrenamiento en caja de arena de larga duración

El informe técnico describe AgentENV, una capa de infraestructura construida para el despliegue persistente de agentes.

El sistema se basa en Firecracker

El entorno de micro-máquinas virtuales permite que los agentes ejecuten secuencias largas de operaciones en un sandbox reproducible.

Una tarea de entrenamiento puede incluir:

  1. Leer un archivo.
  2. Escribir código.
  3. Ejecutar comandos.
  4. Abrir aplicaciones.
  5. Tomar capturas de pantalla.
  6. Usar herramientas simuladas de oficina.
  7. Depurar errores.
  8. Regresar tras largos retrasos.
  9. Continuar desde el estado previo del entorno.

Esto difiere del aprendizaje por refuerzo basado en rondas breves de preguntas y respuestas.

Un agente puede realizar cientos de llamadas a herramientas y mantener estado en el entorno simulado durante varios días virtuales.

El artículo original describe entornos simulados que incluyen aplicaciones como Slack, Notion y Gmail.

El principal desafío de entrenamiento es la persistencia: tanto el entorno como el contexto largo del modelo deben mantenerse disponibles.

Durante procesos de despliegue prolongados.

Síntesis de tareas guiada por grafos de conocimiento

El entrenamiento en ciclos largos también requiere una gran cantidad de tareas difíciles.

Moonshot describe un pipeline de generación de tareas organizado en torno a un grafo de conocimiento jerárquico.

Este grafo abarca campos como ciencias de la computación, inteligencia artificial, programación, matemáticas, física, química, biomedicina y humanidades.

Los conceptos relacionados se pueden muestrear juntos, recuperar materiales públicos relevantes y luego sintetizar nuevas tareas de evaluación o entrenamiento a partir de esos materiales.

El objetivo del grafo es crear tareas que requieran uso real de herramientas y razonamiento en múltiples pasos, no solo memorizar respuestas.

Infraestructura para un modelo MoE de nivel 3T

Un modelo de 2.8T con una ventana de contexto de un millón de tokens no puede ser entrenado y servido eficientemente solo con la arquitectura del modelo.

El informe técnico de Moonshot describe trabajo sistémico que abarca núcleos KDA, paralelismo de contexto, paralelismo de expertos, gestión de memoria, planificación de RL de ciclo largo, caché de prefijo, decodificación especulativa y control de admisión de servicio.

Parte de este contenido ya se ha hecho público.

MoonEP: Paralelismo equilibrado de expertos

MoonEP es una biblioteca de comunicación para paralelismo de expertos de código abierto de Moonshot.

En el entrenamiento MoE, el enrutamiento puede volverse severamente desequilibrado.

Debido a la preferencia del enrutador por ciertos expertos, un rango puede recibir muchos más tokens que otro. Cuando esto ocurre, el dispositivo más rápido debe esperar al más lento.

MoonEP utiliza expertos dinámicos redundantes para resolver este problema.

Puede crear copias temporales de expertos según el patrón de enrutamiento actual, equilibrando así la carga de trabajo de tokens entre los rangos.

El proyecto describe su objetivo como mantener exactamente la carga esperada de tokens enrutados en cada rango, reduciendo al mismo tiempo la sobrecarga de comunicación.

Esto es crucial a escala K3, ya que distribuir 896 expertos en un clúster grande genera enormes problemas de sincronización.

FlashKDA: Núcleo KDA de alto rendimiento

FlashKDA proporciona núcleos de atención Kimi Delta de alto rendimiento basados en CUTLASS.

El repositorio público actualmente enumera los siguientes requisitos:

SM90 o posterior
CUDA 12.9 o posterior
PyTorch 2.4 o posterior

El repositorio incluye pruebas de corrección y datos de referencia para hardware compatible.

FlashKDA está diseñado para acelerar el mecanismo de atención que hace práctica la arquitectura de contexto largo de K3.

Cuantización nativa MXFP4

Kimi K3 utiliza entrenamiento consciente de cuantización desde la etapa de ajuste fino supervisado.

La configuración oficial incluye:

Pesos MXFP4
Activaciones MXFP8

Esto difiere de entrenar primero un modelo completo de alta precisión y luego cuantizar después del entrenamiento.

El modelo se entrena para operar directamente con estos formatos de menor precisión dentro del pipeline.

Esto ayuda a reducir la sobrecarga de memoria y comunicación.

Requisito, pero esto no convierte al modelo de 2.8T en un modelo de escritorio común.

¿Se puede ejecutar Kimi K3 localmente?

Los pesos son públicos, pero "descargable" no significa "que se pueda ejecutar fácilmente en una laptop".

Kimi K3 tiene un total de 2,8 billones de parámetros.

Incluso con activación dispersa y formatos de baja precisión, ejecutar el modelo completo requiere una gran cantidad de memoria aceleradora agregada, interconexiones de dispositivos de alto ancho de banda, ejecución paralela de expertos, un motor de inferencia compatible y soporte eficiente para KDA, MLA y MoE.

El repositorio oficial de Moonshot recomienda:

  • vLLM
  • SGLang
  • TokenSpeed a través del esquema de despliegue de Moonshot

El ecosistema aún está evolucionando rápidamente. El soporte puede depender de esquemas, núcleos, patrones de cuantización y hardware específicos.

Antes de construir un entorno autogestionado, consulte la documentación más reciente de despliegue de Kimi K3 y no asuma que la configuración estándar de Transformer funcionará correctamente.

Para la mayoría de individuos y equipos pequeños, la API alojada puede ser mucho más sencilla que ejecutar el modelo completo.

API de Kimi K3 y nivel de esfuerzo de inferencia

Moonshot también ofrece Kimi K3 a través de su plataforma API oficial:

https://platform.kimi.ai/

El identificador del modelo es:

kimi-k3

Kimi K3 utiliza razonamiento y devuelve el campo reasoning_content.

La tarjeta oficial del modelo describe tres niveles de esfuerzo de inferencia:

low
high
max

Un detalle importante de implementación es el historial de pensamiento conservado.

Para flujos de trabajo de agente en múltiples rondas, Moonshot indica que los desarrolladores deben pasar de vuelta el mensaje completo del asistente anterior (incluyendo reasoning_content, content y tool_calls) en la siguiente solicitud.

Descartar parte de este estado podría dañar la continuidad, ya que K3 está entrenado para conservar el historial de razonamiento.

Rendimiento en benchmarks

El informe técnico de Moonshot evalúa a Kimi K3 en razonamiento y conocimiento, programación, flujos de trabajo de agente y visión.

El propio conjunto de evaluación de la compañía posiciona a K3 como uno de los modelos más potentes disponibles y líder en tareas específicas frente a muchos sistemas de pesos abiertos y propietarios.

Al mismo tiempo, el informe señala explícitamente que el modelo en general sigue por detrás de los sistemas propietarios más potentes, especialmente Claude Fable 5 y GPT-5.6 Sol.

Esta salvedad es importante.

La afirmación no es que K3 haya ganado todos los benchmarks.

La conclusión más defendible es que Kimi K3 ha llevado los pesos abiertos a un rango de rendimiento que hasta hace poco estaba principalmente asociado con sistemas propietarios de frontera.

Imagen de tabla que compara el rendimiento de Kimi K3 con modelos como Claude Fable 5, GPT-5.6 Sol, GLM-5.2, etc., en aspectos como razonamiento y conocimiento, programación, flujos de trabajo de agente y visión. En la tabla, los mejores resultados están en negrita y los segundos mejores subrayados. Por ejemplo, en razonamiento y conocimiento, Kimi K3 destaca en tareas como GQA OpenWorld, Critiq y ACLRC, superando en algunas a modelos como Claude Fable 5. Esta tabla está estrechamente relacionada con el contexto y presenta visualmente el rendimiento de Kimi K3 en diferentes tareas.

Varias comparaciones de benchmarks también dependen de diferentes herramientas de agente, incluyendo Kimi Code, Claude Code, Codex y herramientas oficiales de benchmarking.

Por lo tanto, las puntuaciones en benchmarks de agentes no deben interpretarse como una medición pura de la capacidad del modelo.

Las herramientas circundantes, las instrucciones, la gestión de contexto, los mecanismos de respaldo y los evaluadores tienen un impacto sustancial en los resultados.

Estudio de caso de codificación en ciclo largo

El informe presenta varios casos diseñados para demostrar que K3 es capaz de trabajos de ingeniería complejos que van mucho más allá de la simple finalización de código corto.

Estos casos son proporcionados por los desarrolladores del modelo y deben considerarse como demostraciones ilustrativas, no como garantías de rendimiento general.

MiniTriton: Construcción de un sistema de programación GPU

Moonshot informa que Kimi K3 desarrolló MiniTriton, un sistema compacto de programación GPU similar a Triton.

El proyecto incluye representación intermedia, flujo del compilador, generación de PTX, lenguaje front-end, componentes en tiempo de ejecución, optimización de núcleos GPU y primitivas de entrenamiento distribuido.

La imagen muestra un caso de computación GPU desarrollado por Kimi K3 en una GPU NVIDIA L20 utilizando el compilador MiniTriton. Incluye gráficos de rendimiento de núcleos CUDA y núcleos tensoriales, así como curvas de convergencia entre MiniTriton y torch eager, y entre las primitivas distribuidas de MiniTriton (NCCL) y el entrenamiento con una sola GPU. En el gráfico de núcleos CUDA se comparan los rendimientos de diferentes compiladores como train, gpt y torch eager; en el de núcleos tensoriales se comparan compiladores como train y gpt; las curvas de convergencia muestran la pérdida de entrenamiento de MiniTriton frente a torch eager, y de las primitivas distribuidas de MiniTriton frente al entrenamiento con una sola GPU.

Moonshot indica que K3 también optimiza núcleos complejos relacionados con su propia arquitectura y logra aceleraciones significativas en núcleos seleccionados.

Esto demuestra el comportamiento esperado del modelo: revisar bases de código complejas, realizar análisis de rendimiento, escribir código de bajo nivel, comparar resultados e iterar para mejorar.

Sin embargo, esto no significa que el compilador o los núcleos generados por cada modelo sean totalmente fiables sin revisión y prueba humana.

Un experimento de diseño de chips de 48 horas

En otro caso de estudio, Kimi K3 fue colocado en un entorno aislado durante 48 horas con la tarea de crear un prototipo de chip de inferencia para un modelo pequeño, cuyo enfoque de diseño comparte similitudes con la arquitectura mencionada.

El modelo utilizó herramientas de automatización de diseño electrónico de código abierto y la biblioteca de celdas estándar Nangate de 45 nanómetros.

Moonshot informó que el diseño final simulado se completó dentro de un presupuesto de área de análisis de 4 mm², logrando cierre de tiempo a una frecuencia de reloj de 100 MHz, con aproximadamente 1,46 millones de celdas estándar, 0,277 MiB de SRAM, y alcanzó un rendimiento de descodificación de más de 8.700 tokens por segundo mediante simulación RTL.

La imagen presenta la introducción del prototipo de chip de inferencia diseñado por Kimi K3. Como prueba de concepto inicial, Kimi K3 sigue la misma arquitectura de diseño, incluyendo mecanismos de atención KDA híbrida y NoPE-MLA, Block AttnRes, enrutamiento MoE basado en sigmoide, etc. Dentro del presupuesto de área de análisis de 4 mm², el diseño cierra el tiempo a 100 MHz de reloj, contiene aproximadamente 1,46 millones de celdas estándar, 0,277 MiB de SRAM, una matriz MAC INT4 con des-cuantización fusionada, y la simulación RTL logra un rendimiento de descodificación superior a 8.700 tokens/s. El diseño, en un funcionamiento autónomo de 48 horas, fue construido, optimizado y verificado utilizando Kimi Code; el código está disponible en GitHub.

Esta es una prueba de concepto basada en simulación, no un chip para producción.

Codificación científica y astrofísica

K3 también fue evaluado en una tarea de reproducción en astrofísica computacional.

Moonshot indicó que el modelo leyó y verificó de forma cruzada más de 20 artículos, implementó un flujo de trabajo numérico completo, evaluó más de 300 ecuaciones de estado, identificó inconsistencias en fórmulas publicadas, escribió más de 3.000 líneas de código Python y generó un panel HTML interactivo.

![La imagen muestra los logros de Kimi K3 en codificación científica. Para reproducir la relación universal I-Love-Q en astrofísica computacional, Kimi K3 revisó más de 20 artículos, verificó resultados de forma cruzada, implementó un pipeline numérico completo, evaluó más de 300 ecuaciones de estado, encontró inconsistencias en fórmulas públicas, escribió más de 3.000 líneas de código Python y generó un panel HTML interactivo en aproximadamente 2 horas, mientras que investigadores experimentados suelen tardar entre 1 y 2 semanas. La imagen está estrechamente relacionada con el contexto y muestra de forma intuitiva los resultados concretos de Kimi K3 en esta tarea de codificación científica.]

Según el informe, este trabajo autónomo tomó aproximadamente dos horas, mientras que un investigador experimentado normalmente necesitaría de una a dos semanas.

Para el trabajo científico, la verificación independiente sigue siendo crucial. El modelo puede generar un flujo de trabajo completo, pero aún puede cometer errores sutiles en hipótesis, unidades, métodos numéricos, citas o interpretaciones.

Evaluación de ciberseguridad

El informe técnico también aborda la evaluación en ciberseguridad.

Moonshot afirma que Kimi K3 descubrió vulnerabilidades previamente desconocidas en el núcleo de Linux durante pruebas de seguridad controladas, y los hallazgos fueron revisados por expertos humanos.

La importancia no radica en que K3 deba utilizarse para operaciones de seguridad ofensivas no supervisadas.

Más bien, indica que los modelos de codificación de ciclo largo están cada vez más capacitados para leer grandes bases de código, rastrear comportamientos subyacentes, formular hipótesis, verificarlas, corregir métodos y continuar avanzando tras intentos fallidos.

Estas capacidades pueden respaldar auditorías defensivas y revisiones de seguridad de código, pero también hacen más importantes la autorización, el aislamiento en entornos controlados, el control de acceso y la supervisión humana.

Costo y eficiencia

El valor de un modelo no está determinado únicamente por las puntuaciones en pruebas de referencia.

Los sistemas de agente de ciclo largo pueden generar millones de tokens en una sola tarea.

Por lo tanto, el costo depende de la longitud de entrada, la longitud de salida, la complejidad de la inferencia, la tasa de aciertos de caché, el número de llamadas a herramientas, los reintentos, la gestión del contexto y el proveedor de inferencia.

El informe técnico de Moonshot incluye comparaciones de puntuaciones y costos en múltiples pruebas de referencia de agentes.

Estos gráficos muestran que K3 tiene una relación costo-eficiencia relativa en algunas cargas de trabajo de prueba.

No debe interpretarse como una conclusión universal de que K3 es más barato que todas las alternativas en cualquier situación.

En la planificación de producción, se debe medir el costo total de completar con éxito una tarea, no solo el precio por millón de tokens.

Significado de la publicación de pesos abiertos

El lanzamiento de Kimi K3 va más allá del ranking de un solo modelo.

Abre múltiples campos de investigación e ingeniería que son difíciles de estudiar en sistemas solo con API.

Los investigadores pueden examinar o modificar los pesos del modelo, el comportamiento de MoE, los mecanismos de atención basados en KDA, los mecanismos de contexto largo, los componentes visuales, el comportamiento de cuantización, los sistemas de servicio y las estrategias de post-entrenamiento de agentes.

Los equipos de infraestructura pueden probar diferentes esquemas de servicio.

Las empresas pueden evaluar el despliegue privado cuando la economía del hardware sea razonable.

La comunidad puede construir:

  • Nuevos esquemas de inferencia.

  • Variantes cuantizadas.

  • Modelos derivados ajustados.

  • Sistemas para dominios específicos.

  • Marcos de evaluación

  • Herramientas de enrutamiento de modelos

  • Optimizaciones específicas de hardware

Si esto puede construir un ecosistema comparable al de los primeros lanzamientos de modelos abiertos importantes, dependerá del costo de inferencia, el hardware disponible, los términos de licencia, las herramientas comunitarias y la calidad de los modelos derivados más pequeños.

Lista de verificación práctica antes de desplegar Kimi K3

1. Leer el acuerdo de licencia

Confirma que tu caso de uso sea: investigación interna, uso empresarial, ajuste fino, aplicaciones integradas, inferencia pública o modelo como servicio.

2. Confirmar el soporte de hardware

Verifica la arquitectura del acelerador, la capacidad de HBM, la interconexión, la versión de CUDA, los requisitos del núcleo, el soporte de cuantización, la cantidad de dispositivos y la topología de paralelismo experto.

3. Elegir un motor de inferencia compatible

Utiliza las soluciones específicas para K3 actualmente soportadas por vLLM, SGLang u otras rutas de servicio oficiales.

4. Probar el contexto completo de 1 millón por separado

Mide la latencia de prefijado, la latencia de descodificación, el comportamiento de caché de prefijos, el uso de memoria, la capacidad de concurrencia, el rendimiento y la recuperación de fallos.

5. Mantener el historial de inferencia

Para flujos de trabajo de agente en múltiples rondas, sigue las guías de Moonshot para devolver mensajes de asistente completos (incluyendo el estado de inferencia y las llamadas a herramientas).

6. Verificar tareas reales

Realiza pruebas de referencia en repositorios propios, flujos de trabajo de investigación, documentación, tareas visuales, uso de herramientas y escenarios de agente.

7. Medir el costo por tarea completada

Centrarse solo en el precio del token puede ser engañoso. Calcula los reintentos, las llamadas a herramientas, la longitud de salida y los costos de intervención humana.

Preguntas frecuentes

¿Kimi K3 es de código abierto?

Los pesos completos, el código base, la documentación y el informe técnico de Kimi K3 se han publicado. MoonShot lo describe como un modelo de pesos abiertos. Utiliza la licencia personalizada de Kimi K3, no Apache 2.0.

protocolos estándar, los usuarios comerciales deben revisar cuidadosamente los términos específicos.

¿Dónde descargar Kimi K3?

Los pesos oficiales están disponibles en Moonshot AI en Hugging Face. El repositorio principal del código fuente y el informe técnico pueden consultarse en GitHub.

¿Cuántos parámetros tiene Kimi K3?

Kimi K3 tiene aproximadamente 2.8 billones de parámetros en total. Debido a su arquitectura de modelo experto disperso mixto, cada token activa unos 104 mil millones de parámetros.

¿Cuál es la ventana de contexto de Kimi K3?

El modelo oficial admite un contexto de hasta 1,048,576 tokens. La implementación de contextos largos aún requiere una gran cantidad de memoria e infraestructura de inferencia, especialmente en escenarios concurrentes.

¿Puede Kimi K3 ejecutarse en GPU de consumo?

El modelo completo de 2.8T no puede ejecutarse prácticamente en GPU de consumo común. Incluso con activación dispersa y cuantificación de baja precisión, los pesos completos y la pila de servicio requieren una infraestructura grande de múltiples aceleradores.

¿Qué motores de inferencia admiten Kimi K3?

El repositorio oficial de Moonshot recomienda usar vLLM, SGLang y TokenSpeed a través de la guía de implementación específica para K3. Dado que el modelo emplea optimizaciones relacionadas con KDA, MLA, MoE y MXFP4, es necesario confirmar las versiones compatibles actualmente antes de la implementación.

¿Qué son MoonEP y FlashKDA?

MoonEP es una biblioteca de comunicación paralela de expertos de código abierto de Moonshot, utilizada para equilibrar la carga de tokens MoE entre GPUs. FlashKDA es un kernel de atención Kimi Delta de alto rendimiento construido sobre CUTLASS.

¿Es Kimi K3 superior a GPT-5.6 Sol y Claude Fable 5?

No supera en todos los aspectos. El informe técnico de Moonshot indica que Kimi K3 ha alcanzado un rendimiento de vanguardia y lidera en tareas específicas, pero en general sigue por detrás de los sistemas propietarios más potentes. Los resultados de las evaluaciones comparativas también dependen del marco de agentes, herramientas, configuraciones de inferencia y métodos de evaluación.

Herramientas relacionadas

  • Kimi K3 en Hugging Face: Ficha oficial del modelo y pesos completos de Kimi K3.
  • Kimi K3 en GitHub: Repositorio oficial que incluye README, licencia, activos e informe técnico.
  • MoonEP: Biblioteca de comunicación paralela de expertos de Moonshot para equilibrar dinámicamente las cargas de trabajo MoE.
  • FlashKDA: Kernel de atención Kimi Delta de alto rendimiento construido sobre CUTLASS.
  • vLLM: Motor de inferencia y servicio de código abierto recomendado en la guía de implementación de Kimi K3.
  • SGLang: Marco de servicio multimodal y LLM de código abierto listado por Moonshot para la implementación de K3.
  • Kimi API: Plataforma API alojada por Moonshot AI, que permite acceder al modelo kimi-k3.

Enlaces relacionados

Resumen

Moonshot AI ha lanzado los pesos completos de Kimi K3, transformando su modelo de vanguardia de 2.8T parámetros en un sistema que investigadores y equipos de infraestructura pueden inspeccionar, implementar, ajustar y expandir bajo la licencia de Kimi K3.

El modelo combina 104B parámetros activos, una ventana de contexto de 1M tokens, multimodalidad nativa, mecanismo de atención mixta KDA/Gated-MLA, residuos de atención, MoE latente estable, entrenamiento consciente de cuantificación y post-entrenamiento para agentes de largo horizonte.

Igualmente importante, este lanzamiento revela parte de la ingeniería de sistemas detrás del modelo a través de proyectos como MoonEP y FlashKDA. K3 sigue siendo un modelo que exige un alto nivel de autoalojamiento, y sus mejores resultados deben interpretarse en el contexto de la selección del marco y la ejecución del desarrollador.

Evaluación.
El verdadero hito no es simplemente la existencia de un modelo de 2.8T, sino que un modelo de tal escala ahora está disponible para que una comunidad más amplia lo examine, ejecute y construya sobre él.

Kimi K3 现已开放权重:探秘月之暗面 AI 的 2.8T 参数前沿模型