Kimi K3 detiene nuevas suscripciones tras llevar la demanda la capacidad de GPU al límite

Kimi K3 había estado disponible solo unas 48 horas cuando Moonshot AI anunció que detendría temporalmente la aceptación de nuevas suscripciones de consumidores.

发布于 2026年7月22日generalGEO 评分: 010 次阅读
Imagen de portada del artículo «Kimi K3 detiene nuevas suscripciones tras llevar la demanda la capacidad de GPU al límite»

Kimi K3 detiene nuevas suscripciones tras llevar la demanda la capacidad de GPU al límite

Introducción

Kimi K3 había estado disponible solo unas 48 horas cuando Moonshot AI anunció que detendría temporalmente la aceptación de nuevas suscripciones de consumidores.

La razón no fue un cambio planificado del producto ni una falta de demanda. Fue todo lo contrario. Según Moonshot, las solicitudes para Kimi K3 superaron con creces sus pronósticos y se acercaron al límite de capacidad de sus clústeres de cómputo existentes.

Los usuarios de pago existentes pudieron continuar usando el servicio. Moonshot indicó que dirigiría los recursos informáticos disponibles hacia los suscriptores actuales mientras ampliaba la capacidad, y luego reabriría nuevas plazas de suscripción por lotes.

Ilustración: Kimi K3 Pausa Nuevas Suscripciones Tras Superar la Demanda la Capacidad de GPU

Aviso del 19 de julio de Moonshot explicando la escasez de cómputo y la pausa temporal de suscripciones.

El repentino problema de capacidad siguió a un lanzamiento inusualmente fuerte de Kimi K3, un modelo multimodal nativo de 2,8 billones de parámetros diseñado para codificación de largo horizonte, creación visual, trabajo de conocimiento y tareas basadas en agentes.

Moonshot describe a K3 como el primer modelo abierto de clase 3T. Su artículo de lanzamiento también indica que los pesos completos del modelo están programados para publicarse antes del 27 de julio de 2026, por lo que "abierto" en el lanzamiento debe entenderse en el contexto de ese cronograma de publicación anunciado.

Kimi K3 se Volvió Popular en Dos Días

El aumento en la demanda es más fácil de entender al observar el rendimiento temprano del modelo y la cantidad de demostraciones de usuarios que aparecieron poco después del lanzamiento.

Kimi K3 ingresó al mercado con una ventana de contexto de 1 millón de tokens, capacidades de visión nativas y una arquitectura dispersa de Mezcla de Expertos con 2,8 billones de parámetros totales. Está dirigido a tareas que pueden continuar durante largos períodos y requieren llamadas repetidas a herramientas, ejecución de código, inspección visual o razonamiento de múltiples pasos.

El blog técnico de Moonshot reconoce que K3 aún está por detrás de Claude Fable 5 y GPT-5.6 Sol en rendimiento general. Al mismo tiempo, el modelo obtuvo resultados sólidos en varias evaluaciones de codificación y orientadas a agentes.

Primer Lugar en el Arena de Código Frontend Preliminar

Al momento del informe original, Kimi K3 ocupaba el primer lugar en la tabla de clasificación preliminar de WebDev de Arena con una puntuación de aproximadamente 1,679.

La tabla de clasificación en vivo del 21 de julio mostraba a Kimi K3 en primer lugar con una puntuación preliminar de 1,678, por delante de Claude Fable 5 y GPT-5.6 Sol.

Ilustración: Kimi K3 Pausa Nuevas Suscripciones Tras Superar la Demanda la Capacidad de GPU

Resultado preliminar de primer lugar de Kimi K3 en la clasificación de desarrollo frontend de Arena.

Las evaluaciones de frontend son útiles porque prueban más que si un modelo puede generar código válido. Un resultado sólido a menudo requiere que el modelo comprenda un objetivo visual, cree una interfaz funcional, inspeccione el resultado renderizado y revise el

implementación.

Kimi K3 está diseñado para este tipo de flujo de trabajo de "visión en el bucle". Puede moverse entre el código fuente y las capturas de pantalla en vivo, utilizando el resultado renderizado como retroalimentación para otra pasada de desarrollo.

Debido a que la tabla de clasificación se basa en votación continua, sus puntuaciones y posiciones pueden cambiar. La página en vivo de Arena debe tratarse como la fuente actual, en lugar de cualquier gráfico de lanzamiento estático.

Resultados de codificación sólidos pero mixtos

El informe original también destacó tres evaluaciones de ingeniería de software:

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol
DeepSWE 67.5 70.0 73.0
Program Bench 77.8 76.8 77.6
SWE Marathon 42.0 35.0 39.0

Ilustración: Kimi K3 pausa nuevas suscripciones después de que la demanda lleva la capacidad de GPU al límite

Resultados reportados de Kimi K3 en benchmarks de codificación y de ingeniería de software a largo plazo.

Los resultados muestran un panorama más equilibrado que una simple afirmación de "mejor modelo".

K3 se mantuvo por detrás de Claude Fable 5 y GPT-5.6 Sol en DeepSWE, se adelantó ligeramente en Program Bench y obtuvo la puntuación más alta reportada en la comparación SWE Marathon de Moonshot.

La metodología de los benchmarks es importante aquí. Moonshot utilizó diferentes configuraciones de agente según el modelo y señala que su evaluación de SWE Marathon utilizó una rama calibrada con H20 de las tareas oficiales. También informa que Claude Fable 5 encontró un comportamiento de respaldo en parte de esa evaluación.

Estas diferencias no hacen que los resultados sean inútiles, pero significan que las puntuaciones de diferentes configuraciones no deben tratarse como condiciones de laboratorio perfectamente idénticas.

Los desarrolladores convirtieron rápidamente a Kimi K3 en un campo de juego creativo

Las tablas de clasificación fueron solo una parte del lanzamiento. Los desarrolladores también comenzaron a publicar sitios web, herramientas interactivas, juegos, escenas 3D y experimentos visuales creados con K3.

Un ejemplo incluyó un juego de mundo abierto que un usuario dijo que habría sido difícil de imaginar generando a partir de una indicación solo unos meses antes.

Ilustración: Kimi K3 pausa nuevas suscripciones después de que la demanda lleva la capacidad de GPU al límite

Demostración de un usuario de un juego de mundo abierto creado con Kimi K3.

Otro usuario comparó a Kimi K3 y Claude Opus 4.8 en la tarea de generar un entorno de almacén virtual. En la comparación publicada, el resultado de Kimi contenía más iluminación, objetos, estructura ambiental y detalles visibles.

Ilustración: Kimi K3 pausa nuevas suscripciones después de que la demanda lleva la capacidad de GPU al límite

Comparación publicada por un usuario de escenas de almacén virtual generadas por dos modelos.

Estos ejemplos son demostraciones anecdóticas, no benchmarks controlados. La redacción de la indicación, la configuración del agente, el acceso a herramientas, los límites de tiempo y la intervención manual pueden influir en el resultado.

Aun así, la rápida aparición

Estos proyectos ayudaron a generar interés. Los usuarios no solo hacían preguntas a K3; muchos realizaban largas sesiones de codificación que implicaban construir, renderizar, probar y revisar proyectos sustanciales.

Esa distinción es importante para la infraestructura.

Una respuesta corta de un chatbot puede requerir una sola solicitud al modelo. Un agente de codificación puede leer archivos repetidamente, planificar, escribir código, llamar herramientas, ejecutar comandos, inspeccionar resultados y comenzar otro ciclo de razonamiento. Por lo tanto, una sola tarea de usuario puede consumir mucha más capacidad de inferencia que una conversación convencional.

El Volumen de Solicitudes se Acercó al Límite del Clúster Existente

El 19 de julio, Moonshot dijo que Kimi K3 había recibido mucho más interés del esperado.

En las 48 horas anteriores, las solicitudes de usuarios habían superado ampliamente los pronósticos y se acercaban al límite de capacidad de los clústeres existentes de la empresa.

Ilustración: Kimi K3 pausa nuevas suscripciones tras la demanda que lleva la capacidad de GPU al límite

Moonshot dijo que la demanda se había acercado al límite de su capacidad de cómputo actual.

Cuando demasiadas solicitudes de inferencia llegan a un clúster al mismo tiempo, pueden aparecer varios problemas:

  • Las respuestas pueden volverse más lentas.
  • Las solicitudes pueden esperar en una cola.
  • Las tareas de agente de larga duración pueden ocupar capacidad durante períodos prolongados.
  • Los usuarios pueden experimentar tiempos de espera o fallos temporales del servicio.
  • El proveedor puede necesitar limitar el acceso para proteger la calidad del servicio.

Kimi K3 agrava el problema debido a su escala y enfoque de producto.

El modelo contiene 2,8 billones de parámetros totales, y muchos de sus casos de uso más atractivos implican contextos largos, razonamiento repetido, capturas de pantalla, operaciones con archivos y llamadas a herramientas. Aunque su arquitectura dispersa activa solo una parte del modelo completo para cada token, servirlo con alto volumen sigue requiriendo una infraestructura sustancial.

Por lo tanto, Moonshot anunció tres medidas inmediatas:

  1. Pausar nuevas suscripciones de consumo.
  2. Priorizar el cómputo para los miembros de pago existentes.
  3. Ampliar la capacidad y reabrir gradualmente los lugares de suscripción.

No se esperaba que los suscriptores actuales perdieran sus beneficios existentes debido a la pausa temporal.

Nota de estado: La pausa se aplicó a nuevas suscripciones de consumo, no necesariamente a todas las cuentas gratuitas, productos API, acuerdos empresariales o membresías existentes. La disponibilidad del producto puede cambiar rápidamente, por lo que los usuarios deben consultar las páginas oficiales de precios y membresía de Kimi para conocer el estado actual.

Las Membresías de Kimi y Kimi Code se Separarán

Moonshot también dijo que su estructura de membresía futura cambiaría.

La empresa planea separar los beneficios principales de Kimi (incluyendo Kimi Web, la aplicación Kimi y Kimi Work) de los beneficios de Kimi Code.

Esto apunta hacia dos categorías de uso diferentes.

Uso General de Kimi

La membresía principal de Kimi está destinada a una productividad personal más amplia, que incluye:

  • Conversaciones generales
  • Investigación y trabajo de conocimiento
  • Documentos y presentaciones
  • Tareas visuales y multimodales
  • Flujos de trabajo del agente Kimi Work

Uso de Kimi Code

Kimi Code está diseñado para tareas sostenidas de ingeniería de software,

incluyendo:

  • Leer y editar repositorios
  • Ejecutar comandos de terminal
  • Depurar y refactorizar
  • Ejecutar herramientas de desarrollo
  • Lanzar subagentes
  • Gestionar sesiones largas de codificación

El perfil informático de estos productos puede ser muy diferente.

Un desarrollador puede dejar un agente de codificación ejecutándose mientras explora un repositorio, modifica varios archivos, ejecuta pruebas, investiga fallos y repite el ciclo. Separar los planes le da a Moonshot un mayor control sobre los límites de velocidad, precios y asignación de recursos para usuarios con cargas de trabajo sustancialmente diferentes.

El anuncio no proporcionó precios finales, cuotas ni una fecha confirmada para el nuevo sistema de membresía.

El desafío de infraestructura detrás de la pausa

La suspensión de suscripciones ilustra un problema más amplio para los proveedores de IA avanzada: un lanzamiento de modelo exitoso puede generar demanda más rápido de lo que se puede expandir la infraestructura física.

Añadir capacidad no es tan simple como actualizar una configuración de software. Los proveedores pueden necesitar obtener aceleradores, desplegar servidores, conectar redes y almacenamiento, configurar software de inferencia, validar la confiabilidad y reequilibrar el tráfico entre clústeres.

Kimi ha publicado previamente investigación sobre Mooncake, su arquitectura de servicio centrada en caché KV. El sistema separa las cargas de trabajo de relleno y decodificación y utiliza memoria CPU distribuida, DRAM y recursos SSD para mejorar la eficiencia del servicio de contexto largo.

El artículo de Mooncake informa que la arquitectura permitió a Kimi manejar un 75% más de solicitudes bajo las cargas de trabajo reales probadas en ese momento.

Kimi K3 crea un desafío más nuevo y mayor. Un servicio más eficiente puede aumentar el trabajo manejado por el hardware existente, pero no elimina la necesidad de potencia informática adicional cuando la demanda aumenta lo suficiente.

Por eso la pausa temporal se entiende mejor como una decisión de gestión de capacidad. Moonshot optó por limitar la nueva demanda paga en lugar de seguir vendiendo suscripciones que sus clústeres actuales podrían no servir de manera confiable.

Crecimiento de ingresos y preparativos para la OPI

El informe original conecta la popularidad de K3 con el impulso comercial más amplio de Moonshot AI.

Según informes de medios que citan a personas familiarizadas con la empresa, las ventas diarias de Moonshot aumentaron al menos seis veces después del lanzamiento de K3.

Informes de Bloomberg también dijeron que los ingresos anuales recurrentes de Moonshot alcanzaron aproximadamente 300 millones de dólares en junio de 2026**, frente a los 200 millones de dólares en abril.

El ingreso anual recurrente no es lo mismo que el ingreso anual auditado. Es una métrica de tasa de ejecución prospectiva basada en ingresos actuales por suscripciones y contratos.

Los informes también indicaron que Moonshot había distribuido una resolución de accionistas buscando apoyo para una cotización en Hong Kong y podría buscar una OPI en aproximadamente seis meses.

Reuters informó por separado que:

  • Moonshot estaba deshaciendo su estructura offshore antes de una posible OPI en Hong Kong.
  • La empresa había contratado asesores, incluidos Goldman Sachs y China International Capital Corporation.
  • Había recaudado más de 2 mil millones de dólares en mayo.
  • La recaudación histórica total había superado los 5,5 mil millones de dólares.
  • Su valoración alcanzó aproximadamente 30 mil millones de dólares en junio.
  • Había comenzado a buscar otros 2 mil millones de dólares.

Estos detalles fueron

reportado a través de fuentes anónimas o materiales de recaudación de fondos en lugar de una presentación oficial de Moonshot. La empresa declinó hacer comentarios a Reuters sobre el proceso de OPI.

Posteriormente, informes basados en fuentes de Bloomberg indicaron que Moonshot estaba discutiendo una ronda de financiamiento previa a la OPI con una valoración de hasta 50 mil millones de dólares. Esa cifra representa un objetivo reportado en discusión, no una financiación completada ni una valoración confirmada en el mercado público.

Por qué el momento es importante

El rendimiento del modelo, la demanda de los usuarios, el crecimiento de los ingresos, la recaudación de fondos y los preparativos para la cotización llegaron casi al mismo tiempo.

Para una startup de IA, esa combinación puede fortalecer la historia presentada a los inversores:

  • El modelo tiene un impulso técnico visible.
  • Los usuarios están probando activamente el producto.
  • La demanda es lo suficientemente fuerte como para crear un problema de capacidad.
  • Los ingresos por suscripciones y API están creciendo.
  • La empresa tiene un camino hacia capital adicional.

Al mismo tiempo, la escasez de cómputo revela el costo de ese crecimiento.

Un modelo de codificación sólido es costoso de servir. Cuanto más exitosas se vuelvan sus funciones de agente, es más probable que los usuarios inicien cargas de trabajo de larga duración en lugar de conversaciones cortas.

Eso crea un equilibrio difícil. Moonshot necesita suficiente capacidad para preservar la experiencia del usuario, pero también necesita gestionar el costo de capital de agregar hardware rápidamente.

La decisión de detener la venta de nuevas suscripciones de consumo, al menos temporalmente, sugiere que la fiabilidad para los usuarios existentes tuvo prioridad sobre maximizar el crecimiento inmediato de membresías.

Lo que los usuarios existentes y nuevos necesitan saber

Para los miembros de pago existentes, Moonshot dijo que los beneficios del servicio seguirían disponibles y que la escasez actual no eliminaría sus derechos de suscripción.

Para las personas que aún no se habían suscrito, la situación práctica era diferente:

  • Las nuevas suscripciones de consumo no estaban disponibles temporalmente.
  • Se reabrirían lugares adicionales por lotes a medida que aumentara la capacidad de cómputo.
  • Los planes futuros de Kimi general y Kimi Code estarían separados.
  • Los detalles finales del plan aún no se habían anunciado.

Los desarrolladores que necesitan acceso programático aún pueden consultar la plataforma API de Kimi. La disponibilidad de la API, los precios y los límites de velocidad se gestionan por separado de la membresía de consumo y pueden seguir reglas de capacidad diferentes.

Actualmente, la API de Kimi lista K3 en:

Tipo de uso Precio por millón de tokens
Entrada en caché $0.30
Entrada sin caché $3.00
Salida $15.00

Estos precios son los listados actuales de la plataforma en el momento en que se preparó este archivo y pueden cambiar más adelante.

Preguntas frecuentes

¿Por qué Kimi pausó las nuevas suscripciones?

Moonshot dijo que la demanda de Kimi K3 superó con creces sus pronósticos y se acercó al límite de capacidad de sus clústeres de cómputo existentes. La empresa pausó las nuevas suscripciones de consumo para priorizar la experiencia de los miembros de pago actuales.

¿Los suscriptores existentes de Kimi se ven afectados?

Moonshot dijo que los suscriptores existentes conservarían sus beneficios y no se verían afectados por la pausa de suscripciones. La velocidad real del servicio puede variar durante períodos de demanda inusualmente alta.

¿Cuándo reabrirá Kimi las nuevas suscripciones?

No se anunció una fecha fija de reapertura. Moonshot dijo que agregaría capacidad de cómputo y lanzaría nuevas

colocación de suscripciones por lotes hasta que se puedan reanudar las suscripciones normales.

¿Sigue siendo gratuito Kimi K3?

La pausa afectó a las nuevas suscripciones de consumo, no necesariamente a todas las formas de acceso. El acceso gratuito, el acceso a la API de Kimi, los productos empresariales y las suscripciones existentes pueden tener límites y reglas de disponibilidad separados.

¿Por qué Kimi K3 requiere tanta capacidad de cómputo?

K3 es un modelo de 2,8 billones de parámetros diseñado para contextos largos, entrada multimodal, agentes de codificación y uso repetido de herramientas. Los flujos de trabajo de codificación pueden generar muchas llamadas secuenciales al modelo durante una sola tarea de usuario, lo que aumenta la demanda total de inferencia.

¿Qué cambiará con los planes de membresía de Kimi?

Moonshot dijo que planea separar los beneficios generales de Kimi de los beneficios de Kimi Code. Esto permitiría a la empresa asignar diferentes precios, límites de uso y recursos de cómputo a los usuarios generales y a los usuarios intensivos de agentes de codificación.

¿Es Kimi K3 el mejor modelo de codificación frontend?

Kimi K3 ocupó el primer lugar en la tabla de clasificación preliminar de WebDev de Arena en el momento de la publicación. Los resultados de Arena se actualizan continuamente, por lo que se debe consultar la tabla de clasificación en vivo para conocer el ranking más reciente.

¿Definitivamente Moonshot AI saldrá a bolsa en seis meses?

No se ha confirmado ninguna OPI final. Informes de prensa indican que Moonshot se está preparando para una posible cotización en Hong Kong y ha discutido un plazo de aproximadamente seis meses, pero Reuters señaló que el cronograma sigue siendo flexible.

Herramientas relacionadas

  • Kimi: El espacio de trabajo principal de Moonshot AI para conversaciones, investigaciones, tareas visuales y flujos de trabajo de agentes basados en K3.
  • Kimi Work: El entorno de propósito general de Kimi para documentos, diapositivas, investigación y trabajo de varios pasos.
  • Kimi Code: El producto de agente de codificación de Moonshot para terminales, repositorios, depuración y tareas de ingeniería de larga duración.
  • Plataforma API de Kimi: El servicio API oficial para Kimi K3 y otros modelos de Moonshot.
  • Precios de membresía de Kimi: La página oficial con información actual sobre disponibilidad y planes de membresía para consumidores.
  • Tabla de clasificación WebDev de Arena: La clasificación en vivo por votación comunitaria para modelos de desarrollo frontend.
  • DeepSWE: Un punto de referencia público de ingeniería de software mencionado en la evaluación técnica de K3.
  • SWE Marathon: Un punto de referencia centrado en tareas de ingeniería de software a largo plazo.

Enlaces relacionados

Actualmente, el ranking de frontend de Kimi K3 y el recuento de votos.

  • Plataforma API de Kimi: Precios oficiales, documentación e información de acceso de la API de K3.
  • Kimi Code: Información oficial del producto y guía de instalación para el agente de codificación.
  • Artículo de investigación de Mooncake: Investigación de Moonshot sobre la arquitectura de servicio centrada en la caché KV utilizada para las cargas de trabajo de Kimi.

Resumen

El lanzamiento de Kimi K3 generó una demanda suficiente para llevar los clústeres de GPU existentes de Moonshot AI cerca de su límite de capacidad en aproximadamente 48 horas. La empresa respondió pausando temporalmente las nuevas suscripciones de consumidores y priorizando a los miembros de pago existentes.

El aumento siguió a sólidos resultados en codificación, una primera posición preliminar en el ranking de frontend de Arena y una ola de sitios web, juegos y aplicaciones 3D creados por usuarios. Las tareas de codificación y agente de larga duración también consumen considerablemente más capacidad de inferencia que las sesiones de chat ordinarias.

Moonshot planea separar la membresía general de Kimi de los beneficios de Kimi Code, lo que le dará más control sobre la asignación de cómputo y los precios futuros. Al mismo tiempo, informes de medios indican un rápido crecimiento de ingresos, nuevas discusiones de recaudación de fondos y preparativos para una posible OPI en Hong Kong, aunque esos detalles financieros se basan en gran medida en fuentes anónimas.

El lanzamiento demostró ambas caras de la demanda de IA de frontera: Kimi K3 atrajo usuarios rápidamente, pero atender a esos usuarios de manera confiable se convirtió de inmediato en un desafío de infraestructura.

Kimi K3 detiene nuevas suscripciones tras llevar la demanda la capacidad de GPU al límite