Kimi K3 ya tiene pesos abiertos: Explorando el modelo de frontera de 2.8T parámetros de Moonshot AI
Moonshot AI ha cumplido su promesa al publicar los pesos completos de Kimi K3, su modelo más grande y ambicioso hasta la fecha. El modelo ya está disponible en las páginas oficiales de Hugging Face y GitHub de Moonshot AI, junto con un informe técnico detallado y proyectos de infraestructura complementarios. Kimi K3 es un modelo nativo multimodal de mezcla de expertos, con 2,8 billones de parámetros totales, aproximadamente 104 mil millones de parámetros activados por token y una ventana de contexto de 1 millón de tokens. Moonshot

Kimi K3 ya tiene pesos abiertos: Explorando el modelo de frontera de 2.8 billones de parámetros de Moonshot AI
Introducción
Moonshot AI ha cumplido su promesa y ha lanzado oficialmente los pesos completos de su modelo más grande y ambicioso hasta la fecha: Kimi K3.
El modelo ya está disponible para su descarga a través de las páginas oficiales de Moonshot AI en Hugging Face y GitHub, acompañado de un informe técnico detallado y un proyecto de infraestructura complementario.
Kimi K3 es un modelo nativo multimodal de mezcla de expertos, con 2.8 billones de parámetros totales, aproximadamente 104 mil millones de parámetros activados por token, y una ventana de contexto de 1 millón de tokens.
Moonshot lo posiciona como un modelo de frontera de pesos abiertos, diseñado para programación de larga duración, investigación, comprensión multimodal, trabajo de conocimiento de agentes y tareas de razonamiento que pueden abarcar cientos o miles de pasos.
La importancia de este lanzamiento se refleja en dos aspectos.
En primer lugar, el modelo en sí mismo lleva la escala de pesos abiertos al nivel de 3 billones de parámetros.
En segundo lugar, Moonshot ha revelado mucho más que los puntos de control del modelo. Los materiales públicos detallan su arquitectura, estrategia de post-entrenamiento, infraestructura de aprendizaje por refuerzo de contexto largo, sistema de entrenamiento paralelo de expertos, optimización de inferencia, resultados de evaluaciones comparativas y múltiples estudios de casos de ingeniería de larga duración.

Pesos completos de Kimi K3 ahora disponibles
Moonshot anunció anteriormente el lanzamiento de Kimi K3 y prometió publicar los pesos completos antes del 27 de julio de 2026.
Ese lanzamiento ya se ha completado.
El modelo oficial se puede obtener a través de los siguientes canales:
El repositorio de GitHub contiene un archivo README, la licencia de Kimi K3, el informe técnico completo, recursos de arquitectura y evaluaciones comparativas, guías de implementación e instrucciones de uso del modelo.
La tarjeta del modelo en Hugging Face proporciona la configuración del modelo y el acceso a los pesos publicados.
Esto significa que el modelo ha pasado de ser un sistema de frontera alojado con planes de publicación abierta, a ser un modelo que los investigadores y los equipos de infraestructura calificados pueden descargar, inspeccionar, implementar, ajustar y adaptar según los términos de la licencia de Kimi K3.

¿Qué significa "abierto" para Kimi K3?
Kimi K3 se describe mejor como un modelo de pesos abiertos con código y documentación públicos.
La licencia otorga derechos amplios, permitiendo a los usuarios usar, copiar, modificar, ajustar, implementar, crear trabajos derivados, redistribuir, sublicenciar y vender copias de acuerdo con los términos de la licencia.
Sin embargo,
la licencia incluye requisitos comerciales adicionales.
Por ejemplo, una empresa que opera un negocio de Modelo como Servicio (MaaS) con ingresos totales superiores a 20 millones de dólares en un período consecutivo de 12 meses debe firmar un acuerdo por separado con Moonshot AI antes de usar Kimi K3 o sus derivados con fines comerciales.
La licencia también tiene requisitos de visualización para ciertos productos o servicios comerciales extremadamente grandes que superan los umbrales especificados de usuarios o ingresos.
El uso interno y el uso a través de productos oficiales de Moonshot o socios de inferencia certificados se tratarán de manera diferente.
Por lo tanto, cualquier persona que use Kimi K3 con fines comerciales debe leer la licencia real cuidadosamente, en lugar de asumir que es igual a Apache 2.0, MIT u otras licencias permisivas estándar.
Un modelo de 2.8 billones de parámetros con 104 mil millones de parámetros activados
La capacidad total de Kimi K3 es extremadamente grande, pero su diseño de mezcla de expertos (MoE) significa que no todos los tokens activan los 2.8 billones de parámetros completos.
La tarjeta oficial del modelo enumera la siguiente información:
| Especificación | Kimi K3 |
|---|---|
| Arquitectura | Mezcla de expertos (MoE) |
| Parámetros totales | 2.8T |
| Parámetros activados | 104B |
| Número de capas | 93 |
| Capas densas | 1 |
| Expertos enrutados | 896 |
| Expertos seleccionados por token | 16 |
| Expertos compartidos | 2 |
| Tamaño del vocabulario | 160K |
| Longitud del contexto | 1,048,576 tokens |
| Codificador visual | MoonViT-V2 |
| Parámetros del codificador visual | 401M |
| Método de cuantificación | MXFP4 pesos / MXFP8 activaciones |
| Modalidades | Texto e imagen |
El informe técnico proporciona una comparación de arquitectura más precisa con Kimi K2.

En comparación con Kimi K2, K3 ha aumentado la profundidad del modelo y la dispersión de expertos, al tiempo que introduce nuevos mecanismos de atención y residuales.
Moonshot afirma que, sobre la base de Kimi K2, mediante mejoras integrales en la arquitectura y el método de entrenamiento, la eficiencia general de escalado ha mejorado aproximadamente 2.5 veces.
Esta afirmación se refiere a la eficiencia con la que la capacidad computacional adicional se convierte en capacidad del modelo, no a una mejora general de 2.5 veces en la velocidad de inferencia.
Multimodalidad nativa y ventana de contexto de un millón de tokens
Kimi K3 está diseñado como un modelo nativo multimodal, no como un modelo de lenguaje con un módulo visual añadido al final del entrenamiento.
Su codificador visual MoonViT-V2 tiene aproximadamente 401 millones de parámetros.
El informe técnico señala que MoonViT-V2 se entrenó desde cero con el objetivo de predicción del siguiente token del modelo, en lugar de inicializarse a partir de un modelo visual preentrenado contrastivo como SigLIP.
Moonshot informa que este método se mantuvo estable durante el entrenamiento y logró un rendimiento visual competitivo.

La longitud de contexto que admite este modelo es:
1,048,576 tokens
Esta escala es particularmente importante para los sistemas de agentes, ya que una tarea de codificación o investigación de larga duración puede acumular contenido del repositorio, salidas de herramientas, registros, capturas de pantalla, materiales de investigación, planes intermedios, registros de fallos de prueba, resultados de razonamientos anteriores y múltiples rondas de información corregida.
Un contexto de un millón de tokens no elimina la necesidad de gestionar el contexto, pero permite que K3 conserve un historial de trabajo mucho más extenso que los sistemas tradicionales de contexto corto.
Tres cambios arquitectónicos principales
El informe técnico atribuye la escala y estabilidad de K3 a varias modificaciones arquitectónicas.
Las tres más destacadas son:
- Mecanismo de atención híbrida KDA + MLA con puerta.
- Residuos de atención.
- Modelo de mezcla de expertos latente estable.

1. Mecanismo de atención híbrida: KDA + MLA con puerta
Kimi K3 adopta un diseño de atención híbrida.
La tarjeta oficial del modelo indica:
69 capas KDA + 24 capas MLA con puerta
La arquitectura sigue un patrón repetitivo en el que múltiples capas de atención Kimi Delta se combinan con capas periódicas de atención latente multicabeza con puerta.
Atención Kimi Delta
KDA es un mecanismo de atención lineal diseñado para reducir la carga de memoria y computación asociada con contextos extremadamente largos.
En lugar de utilizar una caché KV tradicional que crece con cada token como en la atención completa estándar, KDA mantiene un estado recurrente.
Esto lo hace atractivo para secuencias de un millón de tokens.
Moonshot introdujo previamente KDA a través de la serie de investigación lineal Kimi, y el equipo informó que, en sus condiciones de evaluación, KDA redujo los requisitos de caché KV y mejoró el rendimiento de decodificación en contextos largos en comparación con la atención completa.
MLA con puerta
K3 no reemplaza por completo la atención global.
Las capas periódicas de MLA con puerta preservan la capacidad del modelo para recuperar información globalmente dentro del contexto.
Por lo tanto, este diseño híbrido intenta equilibrar dos objetivos:
- Procesamiento eficiente de secuencias largas.
- Recuperación global sólida.
La idea no es que la atención lineal sea siempre superior a la atención global, sino que cada mecanismo aborda diferentes partes del problema del contexto largo.
2. Residuos de atención
Las redes neuronales profundas necesitan transmitir información a través de múltiples capas, evitando al mismo tiempo la pérdida gradual de representaciones útiles.
Kimi K3 introduce residuos de atención (AttnRes) para cambiar la forma en que la información fluye a través de la profundidad.
Este mecanismo no depende de un flujo residual secuencial uniforme, sino que permite que los módulos posteriores recuperen selectivamente representaciones generadas por módulos anteriores.
Conceptualmente, esto proporciona un mecanismo de aprendizaje para la red, permitiéndole decidir qué información temprana debe mantenerse directamente accesible.
El objetivo es mejorar el flujo de información en un modelo de 93 capas sin obligar a cada característica a pasar estrictamente por la misma ruta residual exacta.
3. LatentMoE estable
Kimi K3 aumenta significativamente la dispersión de MoE.
El modelo incluye:
896 expertos enrutados
Pero cada token solo activa:
16 expertos enrutados
Además, el modelo incluye dos expertos compartidos.
Esto da como resultado un número total de parámetros muy grande, pero la cantidad de cálculo activo es mucho menor que el total de parámetros.
Con este nivel de dispersión, la estabilidad del entrenamiento y el equilibrio de expertos se convierten en problemas difíciles.
El diseño de LatentMoE estable de Moonshot incorpora varios mecanismos destinados a resolver estos problemas.
SiTU-GLU
Kimi K3 reemplaza SwiGLU con SiTU-GLU, una función de activación diseñada para evitar el crecimiento ilimitado bajo una expansión extrema.
![La imagen muestra las estructuras de la rama de puerta y la rama ascendente de GLU, SwiGLU y SiTU-GLU, así como sus curvas de respuesta escalar. Todas las ramas reciben una entrada escalar x, y las curvas comparten un dominio de x ∈ [−10, 100]. La esquina inferior derecha muestra una ampliación del área cercana al origen. Cuando β1 = 4 y β2 = 25, la curva de SiTU-GLU se aproxima a la de SwiGLU cerca del origen, y cuando x es un número positivo grande, |f(x)| de SiTU-GLU ≤ β1β2 = 100, mientras que SwiGLU sigue sin límite. Esta figura está relacionada con el contenido de la introducción sobre el reemplazo de SwiGLU por SiTU-GLU en Kimi K3 para evitar el crecimiento ilimitado bajo una expansión extrema.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/fefa954c-d8a3-4294-a43b-b222b3386796-9daf2fb4-86f3-4c9a-96cf-f477c6f49b97.png)
Equilibrio por cuantiles
El sistema también emplea un método de equilibrio de carga basado en sesgos de enrutamiento dinámicos, en lugar de depender completamente de las funciones de pérdida de equilibrio auxiliar tradicionales.
El objetivo es lograr una distribución más uniforme de los tokens enrutados entre los expertos sin introducir demasiada interferencia en el entrenamiento.
Entrenamiento de agentes con un millón de tokens
El informe técnico de Kimi K3 destaca especialmente el post-entrenamiento orientado a agentes de larga duración.
El modelo se entrenó en tres áreas:
- Razonamiento general.
- Tareas generales de agente.
- Agente de programación.
También admite múltiples niveles de precisión de razonamiento:
- Bajo.
- Alto.
- Máximo.
El modelo final combina múltiples estrategias especializadas a través de destilación en línea con múltiples maestros (MOPD).
Moonshot no entrena modelos permanentes independientes para cada dominio y nivel de precisión, sino que entrena modelos maestros especializados e integra su comportamiento en una política unificada de K3.
AgentENV: entrenamiento en caja de arena de larga duración
El informe técnico describe AgentENV, una capa de infraestructura construida para el despliegue persistente de agentes.
El sistema se basa en Firecracker
El entorno de micro-máquinas virtuales permite que los agentes ejecuten secuencias largas de operaciones en un sandbox reproducible.
Una tarea de entrenamiento puede incluir:
- Leer un archivo.
- Escribir código.
- Ejecutar comandos.
- Abrir aplicaciones.
- Tomar capturas de pantalla.
- Usar herramientas simuladas de oficina.
- Depurar errores.
- Regresar tras largos retrasos.
- Continuar desde el estado previo del entorno.
Esto difiere del aprendizaje por refuerzo basado en rondas breves de preguntas y respuestas.
Un agente puede realizar cientos de llamadas a herramientas y mantener estado en el entorno simulado durante varios días virtuales.
El artículo original describe entornos simulados que incluyen aplicaciones como Slack, Notion y Gmail.
El principal desafío de entrenamiento es la persistencia: tanto el entorno como el contexto largo del modelo deben mantenerse disponibles.
Durante procesos de despliegue prolongados.
Síntesis de tareas guiada por grafos de conocimiento
El entrenamiento en ciclos largos también requiere una gran cantidad de tareas difíciles.
Moonshot describe un pipeline de generación de tareas organizado en torno a un grafo de conocimiento jerárquico.
Este grafo abarca campos como ciencias de la computación, inteligencia artificial, programación, matemáticas, física, química, biomedicina y humanidades.
Los conceptos relacionados se pueden muestrear juntos, recuperar materiales públicos relevantes y luego sintetizar nuevas tareas de evaluación o entrenamiento a partir de esos materiales.
El objetivo del grafo es crear tareas que requieran uso real de herramientas y razonamiento en múltiples pasos, no solo memorizar respuestas.
Infraestructura para un modelo MoE de nivel 3T
Un modelo de 2.8T con una ventana de contexto de un millón de tokens no puede ser entrenado y servido eficientemente solo con la arquitectura del modelo.
El informe técnico de Moonshot describe trabajo sistémico que abarca núcleos KDA, paralelismo de contexto, paralelismo de expertos, gestión de memoria, planificación de RL de ciclo largo, caché de prefijo, decodificación especulativa y control de admisión de servicio.
Parte de este contenido ya se ha hecho público.
MoonEP: Paralelismo equilibrado de expertos
MoonEP es una biblioteca de comunicación para paralelismo de expertos de código abierto de Moonshot.
En el entrenamiento MoE, el enrutamiento puede volverse severamente desequilibrado.
Debido a la preferencia del enrutador por ciertos expertos, un rango puede recibir muchos más tokens que otro. Cuando esto ocurre, el dispositivo más rápido debe esperar al más lento.
MoonEP utiliza expertos dinámicos redundantes para resolver este problema.
Puede crear copias temporales de expertos según el patrón de enrutamiento actual, equilibrando así la carga de trabajo de tokens entre los rangos.
El proyecto describe su objetivo como mantener exactamente la carga esperada de tokens enrutados en cada rango, reduciendo al mismo tiempo la sobrecarga de comunicación.
Esto es crucial a escala K3, ya que distribuir 896 expertos en un clúster grande genera enormes problemas de sincronización.
FlashKDA: Núcleo KDA de alto rendimiento
FlashKDA proporciona núcleos de atención Kimi Delta de alto rendimiento basados en CUTLASS.
El repositorio público actualmente enumera los siguientes requisitos:
SM90 o posterior
CUDA 12.9 o posterior
PyTorch 2.4 o posterior
El repositorio incluye pruebas de corrección y datos de referencia para hardware compatible.
FlashKDA está diseñado para acelerar el mecanismo de atención que hace práctica la arquitectura de contexto largo de K3.
Cuantización nativa MXFP4
Kimi K3 utiliza entrenamiento consciente de cuantización desde la etapa de ajuste fino supervisado.
La configuración oficial incluye:
Pesos MXFP4
Activaciones MXFP8
Esto difiere de entrenar primero un modelo completo de alta precisión y luego cuantizar después del entrenamiento.
El modelo se entrena para operar directamente con estos formatos de menor precisión dentro del pipeline.
Esto ayuda a reducir la sobrecarga de memoria y comunicación.
Requisito, pero esto no convierte al modelo de 2.8T en un modelo de escritorio común.
¿Se puede ejecutar Kimi K3 localmente?
Los pesos son públicos, pero "descargable" no significa "que se pueda ejecutar fácilmente en una laptop".
Kimi K3 tiene un total de 2,8 billones de parámetros.
Incluso con activación dispersa y formatos de baja precisión, ejecutar el modelo completo requiere una gran cantidad de memoria aceleradora agregada, interconexiones de dispositivos de alto ancho de banda, ejecución paralela de expertos, un motor de inferencia compatible y soporte eficiente para KDA, MLA y MoE.
El repositorio oficial de Moonshot recomienda:
El ecosistema aún está evolucionando rápidamente. El soporte puede depender de esquemas, núcleos, patrones de cuantización y hardware específicos.
Antes de construir un entorno autogestionado, consulte la documentación más reciente de despliegue de Kimi K3 y no asuma que la configuración estándar de Transformer funcionará correctamente.
Para la mayoría de individuos y equipos pequeños, la API alojada puede ser mucho más sencilla que ejecutar el modelo completo.
API de Kimi K3 y nivel de esfuerzo de inferencia
Moonshot también ofrece Kimi K3 a través de su plataforma API oficial:
El identificador del modelo es:
kimi-k3
Kimi K3 utiliza razonamiento y devuelve el campo reasoning_content.
La tarjeta oficial del modelo describe tres niveles de esfuerzo de inferencia:
low
high
max
Un detalle importante de implementación es el historial de pensamiento conservado.
Para flujos de trabajo de agente en múltiples rondas, Moonshot indica que los desarrolladores deben pasar de vuelta el mensaje completo del asistente anterior (incluyendo reasoning_content, content y tool_calls) en la siguiente solicitud.
Descartar parte de este estado podría dañar la continuidad, ya que K3 está entrenado para conservar el historial de razonamiento.
Rendimiento en benchmarks
El informe técnico de Moonshot evalúa a Kimi K3 en razonamiento y conocimiento, programación, flujos de trabajo de agente y visión.
El propio conjunto de evaluación de la compañía posiciona a K3 como uno de los modelos más potentes disponibles y líder en tareas específicas frente a muchos sistemas de pesos abiertos y propietarios.
Al mismo tiempo, el informe señala explícitamente que el modelo en general sigue por detrás de los sistemas propietarios más potentes, especialmente Claude Fable 5 y GPT-5.6 Sol.
Esta salvedad es importante.
La afirmación no es que K3 haya ganado todos los benchmarks.
La conclusión más defendible es que Kimi K3 ha llevado los pesos abiertos a un rango de rendimiento que hasta hace poco estaba principalmente asociado con sistemas propietarios de frontera.

Varias comparaciones de benchmarks también dependen de diferentes herramientas de agente, incluyendo Kimi Code, Claude Code, Codex y herramientas oficiales de benchmarking.
Por lo tanto, las puntuaciones en benchmarks de agentes no deben interpretarse como una medición pura de la capacidad del modelo.
Las herramientas circundantes, las instrucciones, la gestión de contexto, los mecanismos de respaldo y los evaluadores tienen un impacto sustancial en los resultados.
Estudio de caso de codificación en ciclo largo
El informe presenta varios casos diseñados para demostrar que K3 es capaz de trabajos de ingeniería complejos que van mucho más allá de la simple finalización de código corto.
Estos casos son proporcionados por los desarrolladores del modelo y deben considerarse como demostraciones ilustrativas, no como garantías de rendimiento general.
MiniTriton: Construcción de un sistema de programación GPU
Moonshot informa que Kimi K3 desarrolló MiniTriton, un sistema compacto de programación GPU similar a Triton.
El proyecto incluye representación intermedia, flujo del compilador, generación de PTX, lenguaje front-end, componentes en tiempo de ejecución, optimización de núcleos GPU y primitivas de entrenamiento distribuido.

Moonshot indica que K3 también optimiza núcleos complejos relacionados con su propia arquitectura y logra aceleraciones significativas en núcleos seleccionados.
Esto demuestra el comportamiento esperado del modelo: revisar bases de código complejas, realizar análisis de rendimiento, escribir código de bajo nivel, comparar resultados e iterar para mejorar.
Sin embargo, esto no significa que el compilador o los núcleos generados por cada modelo sean totalmente fiables sin revisión y prueba humana.
Un experimento de diseño de chips de 48 horas
En otro caso de estudio, Kimi K3 fue colocado en un entorno aislado durante 48 horas con la tarea de crear un prototipo de chip de inferencia para un modelo pequeño, cuyo enfoque de diseño comparte similitudes con la arquitectura mencionada.
El modelo utilizó herramientas de automatización de diseño electrónico de código abierto y la biblioteca de celdas estándar Nangate de 45 nanómetros.
Moonshot informó que el diseño final simulado se completó dentro de un presupuesto de área de análisis de 4 mm², logrando cierre de tiempo a una frecuencia de reloj de 100 MHz, con aproximadamente 1,46 millones de celdas estándar, 0,277 MiB de SRAM, y alcanzó un rendimiento de descodificación de más de 8.700 tokens por segundo mediante simulación RTL.

Esta es una prueba de concepto basada en simulación, no un chip para producción.
Codificación científica y astrofísica
K3 también fue evaluado en una tarea de reproducción en astrofísica computacional.
Moonshot indicó que el modelo leyó y verificó de forma cruzada más de 20 artículos, implementó un flujo de trabajo numérico completo, evaluó más de 300 ecuaciones de estado, identificó inconsistencias en fórmulas publicadas, escribió más de 3.000 líneas de código Python y generó un panel HTML interactivo.
![La imagen muestra los logros de Kimi K3 en codificación científica. Para reproducir la relación universal I-Love-Q en astrofísica computacional, Kimi K3 revisó más de 20 artículos, verificó resultados de forma cruzada, implementó un pipeline numérico completo, evaluó más de 300 ecuaciones de estado, encontró inconsistencias en fórmulas públicas, escribió más de 3.000 líneas de código Python y generó un panel HTML interactivo en aproximadamente 2 horas, mientras que investigadores experimentados suelen tardar entre 1 y 2 semanas. La imagen está estrechamente relacionada con el contexto y muestra de forma intuitiva los resultados concretos de Kimi K3 en esta tarea de codificación científica.]
Según el informe, este trabajo autónomo tomó aproximadamente dos horas, mientras que un investigador experimentado normalmente necesitaría de una a dos semanas.
Para el trabajo científico, la verificación independiente sigue siendo crucial. El modelo puede generar un flujo de trabajo completo, pero aún puede cometer errores sutiles en hipótesis, unidades, métodos numéricos, citas o interpretaciones.
Evaluación de ciberseguridad
El informe técnico también aborda la evaluación en ciberseguridad.
Moonshot afirma que Kimi K3 descubrió vulnerabilidades previamente desconocidas en el núcleo de Linux durante pruebas de seguridad controladas, y los hallazgos fueron revisados por expertos humanos.
La importancia no radica en que K3 deba utilizarse para operaciones de seguridad ofensivas no supervisadas.
Más bien, indica que los modelos de codificación de ciclo largo están cada vez más capacitados para leer grandes bases de código, rastrear comportamientos subyacentes, formular hipótesis, verificarlas, corregir métodos y continuar avanzando tras intentos fallidos.
Estas capacidades pueden respaldar auditorías defensivas y revisiones de seguridad de código, pero también hacen más importantes la autorización, el aislamiento en entornos controlados, el control de acceso y la supervisión humana.
Costo y eficiencia
El valor de un modelo no está determinado únicamente por las puntuaciones en pruebas de referencia.
Los sistemas de agente de ciclo largo pueden generar millones de tokens en una sola tarea.
Por lo tanto, el costo depende de la longitud de entrada, la longitud de salida, la complejidad de la inferencia, la tasa de aciertos de caché, el número de llamadas a herramientas, los reintentos, la gestión del contexto y el proveedor de inferencia.
El informe técnico de Moonshot incluye comparaciones de puntuaciones y costos en múltiples pruebas de referencia de agentes.
Estos gráficos muestran que K3 tiene una relación costo-eficiencia relativa en algunas cargas de trabajo de prueba.
No debe interpretarse como una conclusión universal de que K3 es más barato que todas las alternativas en cualquier situación.
En la planificación de producción, se debe medir el costo total de completar con éxito una tarea, no solo el precio por millón de tokens.
Significado de la publicación de pesos abiertos
El lanzamiento de Kimi K3 va más allá del ranking de un solo modelo.
Abre múltiples campos de investigación e ingeniería que son difíciles de estudiar en sistemas solo con API.
Los investigadores pueden examinar o modificar los pesos del modelo, el comportamiento de MoE, los mecanismos de atención basados en KDA, los mecanismos de contexto largo, los componentes visuales, el comportamiento de cuantización, los sistemas de servicio y las estrategias de post-entrenamiento de agentes.
Los equipos de infraestructura pueden probar diferentes esquemas de servicio.
Las empresas pueden evaluar el despliegue privado cuando la economía del hardware sea razonable.
La comunidad puede construir:
Nuevos esquemas de inferencia.
Variantes cuantizadas.
Modelos derivados ajustados.
Sistemas para dominios específicos.
Marcos de evaluación
Herramientas de enrutamiento de modelos
Optimizaciones específicas de hardware
Si esto puede construir un ecosistema comparable al de los primeros lanzamientos de modelos abiertos importantes, dependerá del costo de inferencia, el hardware disponible, los términos de licencia, las herramientas comunitarias y la calidad de los modelos derivados más pequeños.
Lista de verificación práctica antes de desplegar Kimi K3
1. Leer el acuerdo de licencia
Confirma que tu caso de uso sea: investigación interna, uso empresarial, ajuste fino, aplicaciones integradas, inferencia pública o modelo como servicio.
2. Confirmar el soporte de hardware
Verifica la arquitectura del acelerador, la capacidad de HBM, la interconexión, la versión de CUDA, los requisitos del núcleo, el soporte de cuantización, la cantidad de dispositivos y la topología de paralelismo experto.
3. Elegir un motor de inferencia compatible
Utiliza las soluciones específicas para K3 actualmente soportadas por vLLM, SGLang u otras rutas de servicio oficiales.
4. Probar el contexto completo de 1 millón por separado
Mide la latencia de prefijado, la latencia de descodificación, el comportamiento de caché de prefijos, el uso de memoria, la capacidad de concurrencia, el rendimiento y la recuperación de fallos.
5. Mantener el historial de inferencia
Para flujos de trabajo de agente en múltiples rondas, sigue las guías de Moonshot para devolver mensajes de asistente completos (incluyendo el estado de inferencia y las llamadas a herramientas).
6. Verificar tareas reales
Realiza pruebas de referencia en repositorios propios, flujos de trabajo de investigación, documentación, tareas visuales, uso de herramientas y escenarios de agente.
7. Medir el costo por tarea completada
Centrarse solo en el precio del token puede ser engañoso. Calcula los reintentos, las llamadas a herramientas, la longitud de salida y los costos de intervención humana.
Preguntas frecuentes
¿Kimi K3 es de código abierto?
Los pesos completos, el código base, la documentación y el informe técnico de Kimi K3 se han publicado. MoonShot lo describe como un modelo de pesos abiertos. Utiliza la licencia personalizada de Kimi K3, no Apache 2.0.
protocolos estándar, los usuarios comerciales deben revisar cuidadosamente los términos específicos.
¿Dónde descargar Kimi K3?
Los pesos oficiales están disponibles en Moonshot AI en Hugging Face. El repositorio principal del código fuente y el informe técnico pueden consultarse en GitHub.
¿Cuántos parámetros tiene Kimi K3?
Kimi K3 tiene aproximadamente 2.8 billones de parámetros en total. Debido a su arquitectura de modelo experto disperso mixto, cada token activa unos 104 mil millones de parámetros.
¿Cuál es la ventana de contexto de Kimi K3?
El modelo oficial admite un contexto de hasta 1,048,576 tokens. La implementación de contextos largos aún requiere una gran cantidad de memoria e infraestructura de inferencia, especialmente en escenarios concurrentes.
¿Puede Kimi K3 ejecutarse en GPU de consumo?
El modelo completo de 2.8T no puede ejecutarse prácticamente en GPU de consumo común. Incluso con activación dispersa y cuantificación de baja precisión, los pesos completos y la pila de servicio requieren una infraestructura grande de múltiples aceleradores.
¿Qué motores de inferencia admiten Kimi K3?
El repositorio oficial de Moonshot recomienda usar vLLM, SGLang y TokenSpeed a través de la guía de implementación específica para K3. Dado que el modelo emplea optimizaciones relacionadas con KDA, MLA, MoE y MXFP4, es necesario confirmar las versiones compatibles actualmente antes de la implementación.
¿Qué son MoonEP y FlashKDA?
MoonEP es una biblioteca de comunicación paralela de expertos de código abierto de Moonshot, utilizada para equilibrar la carga de tokens MoE entre GPUs. FlashKDA es un kernel de atención Kimi Delta de alto rendimiento construido sobre CUTLASS.
¿Es Kimi K3 superior a GPT-5.6 Sol y Claude Fable 5?
No supera en todos los aspectos. El informe técnico de Moonshot indica que Kimi K3 ha alcanzado un rendimiento de vanguardia y lidera en tareas específicas, pero en general sigue por detrás de los sistemas propietarios más potentes. Los resultados de las evaluaciones comparativas también dependen del marco de agentes, herramientas, configuraciones de inferencia y métodos de evaluación.
Herramientas relacionadas
- Kimi K3 en Hugging Face: Ficha oficial del modelo y pesos completos de Kimi K3.
- Kimi K3 en GitHub: Repositorio oficial que incluye README, licencia, activos e informe técnico.
- MoonEP: Biblioteca de comunicación paralela de expertos de Moonshot para equilibrar dinámicamente las cargas de trabajo MoE.
- FlashKDA: Kernel de atención Kimi Delta de alto rendimiento construido sobre CUTLASS.
- vLLM: Motor de inferencia y servicio de código abierto recomendado en la guía de implementación de Kimi K3.
- SGLang: Marco de servicio multimodal y LLM de código abierto listado por Moonshot para la implementación de K3.
- Kimi API: Plataforma API alojada por Moonshot AI, que permite acceder al modelo
kimi-k3.
Enlaces relacionados
- Repositorio oficial de Kimi K3 en GitHub: Repositorio principal con detalles de arquitectura, instrucciones de implementación, uso del modelo, licencia y activos técnicos.
- Ficha de modelo de Kimi K3 en Hugging Face: Resumen oficial del modelo y pesos completos descargables.
- Informe técnico de Kimi K3: Informe de investigación completo que cubre arquitectura, entrenamiento, infraestructura, evaluación y estudios de caso.
- Licencia de Kimi K3: Licencia oficial que regula los pesos del modelo, código, obras derivadas, implementación y usos comerciales específicos.
- Repositorio de MoonEP: Implementación de código abierto del sistema de equilibrio de expertos paralelos de Moonshot.
- Repositorio de FlashKDA: Recursos de referencia e implementación del kernel KDA de código abierto.
- Organización Kimi K3 en ModelScope: Modelos de Moonshot AI distribuidos a través de ModelScope.
Resumen
Moonshot AI ha lanzado los pesos completos de Kimi K3, transformando su modelo de vanguardia de 2.8T parámetros en un sistema que investigadores y equipos de infraestructura pueden inspeccionar, implementar, ajustar y expandir bajo la licencia de Kimi K3.
El modelo combina 104B parámetros activos, una ventana de contexto de 1M tokens, multimodalidad nativa, mecanismo de atención mixta KDA/Gated-MLA, residuos de atención, MoE latente estable, entrenamiento consciente de cuantificación y post-entrenamiento para agentes de largo horizonte.
Igualmente importante, este lanzamiento revela parte de la ingeniería de sistemas detrás del modelo a través de proyectos como MoonEP y FlashKDA. K3 sigue siendo un modelo que exige un alto nivel de autoalojamiento, y sus mejores resultados deben interpretarse en el contexto de la selección del marco y la ejecución del desarrollador.
Evaluación.
El verdadero hito no es simplemente la existencia de un modelo de 2.8T, sino que un modelo de tal escala ahora está disponible para que una comunidad más amplia lo examine, ejecute y construya sobre él.