Qingcheng.ai construye una «super red» de tokens en WAIC 2026, afirmando reducir en un 75 % los costos de implementación de DeepSeek.
En la Conferencia Mundial de Inteligencia Artificial de 2026, las empresas de modelos llenan los pabellones con la cantidad de parámetros, mientras que los proveedores de infraestructura muestran clústeres de cómputo cada vez más grandes. Sin embargo, en el stand de Qingcheng.ai, el principal atractivo no es un modelo individual o un servidor, sino un diagrama completo que ilustra cómo los tokens se producen, enrutan, distribuyen, miden y gestionan a lo largo de todo el ciclo de vida de un agente de IA. Qingcheng.ai denomina a este modelo como **"tienda frontal y fábrica trasera" de tokens**. Este marco consta de tres capas:

Qingcheng.ai construye una «super red» de tokens en WAIC 2026, afirmando reducir en un 75 % los costos de implementación de DeepSeek.
Introducción
En la exposición WAIC 2026, las empresas de modelos llenan los pabellones con la cantidad de parámetros, mientras que los proveedores de infraestructura muestran sus crecientes clústeres de computación. Sin embargo, el protagonista del stand de Qingcheng Intelligence no es un modelo único ni un servidor.
Sino un diagrama completo que muestra cómo los Tokens son producidos, enrutados, distribuidos, medidos y gobernados a lo largo del ciclo de vida completo de un Agente de IA.
Qingcheng Intelligence denomina a este modelo "Fábrica y Tienda" de Tokens. Este marco integra tres capas:
- La capa de producción de Tokens en la parte trasera
- La capa de enrutamiento y servicio en el medio
- La capa de aplicaciones y gobernanza de Agentes
La compañía describe su arquitectura como el sistema eléctrico de la era de la inteligencia artificial. El hardware de cómputo y el software de inferencia actúan como plantas generadoras, AI Ping desempeña el papel de la red eléctrica, y las herramientas de Agentes son los dispositivos que consumen electricidad.
El stand de Qingcheng Intelligence muestra el flujo de trabajo completo de producción, enrutamiento y gobernanza de Tokens.
Según el informe original, este sistema está diseñado para resolver tres problemas recurrentes: la inestabilidad de las API de modelos, la baja utilización de aceleradores heterogéneos nacionales y la falta de una contabilidad clara de Tokens en implementaciones a gran escala de Agentes.
Cuellos de botella de Tokens antes de las aplicaciones masivas de Agentes
A medida que los Agentes de IA pasan de la fase de demostración a entornos de producción, una sola solicitud de usuario puede desencadenar múltiples invocaciones de modelos.
Un Agente puede necesitar recuperar archivos, buscar en bases de datos, invocar herramientas, generar código, evaluar resultados, revisar planes y luego invocar a otro Agente. El usuario solo ve la respuesta final. Detrás de escena, el sistema puede consumir una gran cantidad de Tokens a través de múltiples servicios.
El artículo original señala tres problemas principales de infraestructura que se agravan a medida que los flujos de trabajo se expanden.
Suministro inestable de Tokens
La capacidad de las API de modelos puede fluctuar durante los picos de demanda.
Una misma solicitud puede responder rápidamente en un momento y volverse lenta o no disponible en otro. En escenarios de charla informal, una breve demora puede ser aceptable, pero en flujos de trabajo de múltiples pasos donde cada acción depende de la respuesta anterior, esta latencia puede interrumpir el proceso.
Por lo tanto, los sistemas empresariales necesitan más que simplemente acceder a un modelo. Necesitan latencia predecible, rendimiento, confiabilidad y calidad de salida.
Dificultad para utilizar eficientemente los aceleradores nacionales
Muchas instituciones han adquirido una mezcla de GPU, NPU y servidores de computación inteligente nacionales. El hardware puede estar listo, pero implementar modelos grandes de manera eficiente en ellos sigue siendo un desafío.
Marcos de inferencia populares como vLLM fueron inicialmente optimizados para NVIDIA y el ecosistema CUDA. Aunque admiten cada vez más dispositivos, adaptar cada función y optimización a diferentes arquitecturas de aceleradores requiere un esfuerzo de ingeniería considerable.
Qingcheng Intelligence cree que los motores de inferencia nativos y las pilas de software con conciencia de hardware pueden extraer más salida utilizable de Tokens de estos clústeres.
Dificultad para rastrear el gasto de Agentes
Cuando una empresa opera múltiples Agentes, la factura mensual de modelos no siempre muestra qué flujo de trabajo generó los costos.
Un solo Agente puede invocar múltiples modelos, usar
múltiples proveedores, iniciar subagentes y ejecutarse durante horas. Sin un seguimiento detallado, las organizaciones pueden tener dificultades para responder preguntas básicas:
- ¿Qué Agente consumió los Tokens?
- ¿Qué modelo y proveedor invocó?
- ¿Qué herramienta o paso causó el mayor costo?
- ¿Algún flujo de trabajo superó el presupuesto esperado?
- ¿Podría la solicitud enrutarse a un servicio más barato?
Qingcheng Intelligence posiciona su arquitectura de tres capas como una infraestructura integrada que conecta producción, distribución, aplicación y facturación.

El plano de la exposición describe el flujo de trabajo desde la computación subyacente hasta las aplicaciones de Agentes.
Arquitectura de tres capas "Fábrica y Tienda"
La arquitectura se construye en torno a una analogía industrial simple.
La fábrica trasera transforma el hardware de computación en Tokens. La tienda agrega y enruta los servicios de Tokens. Los nodos de aplicación distribuyen Agentes y controlan cómo se consumen los Tokens.
La arquitectura de Qingcheng Intelligence conecta la producción de Tokens, el enrutamiento de servicios y la gobernanza de Agentes.
Estas tres capas están diseñadas para trabajar juntas, no como productos aislados.
Fábrica trasera: Capa de producción de Tokens
La fábrica trasera se encarga de convertir los recursos de cómputo físico en capacidades de inferencia de modelos estandarizadas.
Sus componentes principales incluyen:
- Socios de hardware y computación
- Motor de inferencia Chitu
- Pila de software inteligente Bagua Lu
Qingcheng Intelligence compara esta capa con una planta de energía. Su objetivo es generar la mayor cantidad posible de Tokens estables y utilizables a partir del hardware disponible, reduciendo al mismo tiempo la complejidad de la implementación.
Chitu: Motor de inferencia orientado a la producción
Chitu es el marco de inferencia de alto rendimiento de código abierto de Qingcheng Intelligence.
El repositorio oficial lo describe como un motor orientado a la producción, centrado en la eficiencia, flexibilidad y usabilidad. Admite implementaciones desde CPU y un solo acelerador hasta clústeres a gran escala, y está optimizado para múltiples plataformas de hardware nacionales.
El proyecto también admite modelos como DeepSeek, Qwen, GLM y Kimi, así como la interfaz HTTP estándar compatible con OpenAI.

Chitu se utiliza para mejorar la capacidad de inferencia de modelos grandes en plataformas de computación heterogéneas.
Qingcheng Intelligence cree que adaptar un marco diseñado para un ecosistema de hardware único puede ser como usar la herramienta equivocada. La analogía de la compañía es: un horno diseñado para tostar pan puede modificarse para...
cocinar al vapor, pero una vaporera especializada puede aprovechar más eficientemente el calor existente.
Aunque la comparación es simplificada, los desafíos de ingeniería subyacentes son reales. Las arquitecturas de aceleradores difieren en memoria, comunicación, operadores, formatos numéricos, compilación y comportamiento de programación.
Chitu incluye optimizaciones específicas de hardware y soporte para inferencia de baja precisión, incluidas configuraciones FP4 y FP8.
Afirmación del 75% del costo de DeepSeek
El informe original indica que implementar el modelo DeepSeek con FP4 reduce el hardware necesario de cuatro máquinas a una.
En esta configuración específica, reducir de cuatro máquinas a una significa una disminución del 75% en el número de máquinas necesarias. El artículo traduce esta reducción en un ahorro de costos del 75%.
El informe atribuye la implementación de DeepSeek de cuatro máquinas a una a la optimización FP4.
Este resultado no debe interpretarse como una garantía de una reducción universal del 75% en los costos para todas las implementaciones de DeepSeek.
El ahorro real depende de los siguientes factores:
- El modelo DeepSeek seleccionado y el esquema de cuantización
- El tipo de acelerador y la capacidad de memoria
- La configuración del servidor
- La longitud del contexto
- El tamaño del lote y la concurrencia
- Los objetivos de latencia
- Los requisitos de precisión
- La versión del software
- Los costos de electricidad y operación
El código abierto de Chitu
El repositorio también señala que los resultados de rendimiento pueden variar según el hardware, el software y la carga de prueba.
Bagua Furnace: Ocultando la complejidad de la infraestructura
Bagua Furnace es la pila de software de Qingcheng.ai para el entrenamiento, inferencia, despliegue, programación y operación de modelos.
La empresa lo presenta como una forma de empaquetar el complejo trabajo de infraestructura en una plataforma empresarial más manejable.
Bagua Furnace se sitúa sobre hardware heterogéneo, proporcionando herramientas de despliegue y operación.
Bagua Furnace está diseñado para reducir la carga de trabajo manual en los siguientes aspectos:
- Gestión de recursos del clúster
- Despliegue de modelos y aplicaciones
- Entrenamiento distribuido
- Optimización de inferencia
- Evaluación de rendimiento
- Entrega de aplicaciones
- Monitoreo y operación
Qingcheng.ai también ha colaborado con Inspur Information para lanzar el YuanNao Bagua Furnace All-in-One optimizado conjuntamente. En una prueba publicada con Qwen3-32B, los socios informaron que, tras la optimización con Chitu, el rendimiento total de inferencia aumentó hasta 14.45 veces, y después de la optimización integral de la pila completa, el rendimiento de extremo a extremo mejoró aproximadamente 10 veces.
Estos datos provienen del entorno de pruebas de la propia empresa colaboradora y no son equivalentes al caso de DeepSeek FP4 descrito en la WAIC.
Optimización de clústeres heterogéneos
La capa del backend de fábrica está diseñada para gestionar múltiples tipos de aceleradores.
Una de las estrategias mencionadas en el informe original es
separar las cargas de trabajo de prellenado y decodificación.
En la fase de prellenado, el sistema procesa las indicaciones de entrada y construye la caché interna del modelo. En la fase de decodificación, el sistema genera los tokens de salida paso a paso. Estas dos fases difieren en sus características de memoria, ancho de banda y cómputo.
Un clúster heterogéneo puede asignar cada fase al hardware que la maneje de manera más eficiente. Esta práctica a veces se denomina "separación de prellenado y decodificación".
El objetivo no es que todos los aceleradores se comporten de manera uniforme, sino que diferentes hardwares manejen las partes de la carga de trabajo que mejor se adaptan a sus fortalezas.
Tienda: AI Ping como centro de enrutamiento de tokens
Una vez que se generan los tokens, las aplicaciones aún necesitan una forma estable de obtenerlos.
La capa intermedia es AI Ping, la plataforma de evaluación de servicios de modelos y enrutamiento de API de Qingcheng Zhiyun.
AI Ping monitorea continuamente los servicios de modelos y proporciona una interfaz unificada sobre múltiples proveedores de servicios.

AI Ping evalúa las API de modelos y enruta las solicitudes entre proveedores de servicios.
El informe original señala que AI Ping monitorea lo siguiente:
- Más de 30 proveedores de servicios
- Más de 600 interfaces de servicios de modelos
- Latencia
- Rendimiento
- Fiabilidad
- Tasa de aciertos de caché
- Calidad de los tokens
- Precios y disponibilidad del servicio
La plataforma está diseñada para reducir la necesidad de que los desarrolladores creen cuentas, gestionen diferentes formatos de API y comparen manualmente entre proveedores.
Los usuarios pueden priorizar objetivos, como por ejemplo:
- Reducir costos
- Acelerar el tiempo de respuesta
- Mejorar la fiabilidad
- Mejorar la calidad de salida
Si no se especifica una preferencia, AI Ping puede utilizar su lógica de enrutamiento para seleccionar un servicio disponible.
Enrutamiento dinámico ante congestión del servicio
La integración estática enviaría cada solicitud al mismo proveedor hasta que el desarrollador cambie la configuración.
El enrutamiento dinámico es diferente. Si un proveedor se vuelve lento o no está disponible, la capa de enrutamiento puede dirigir las solicitudes posteriores a otros servicios que tengan un mejor rendimiento en ese momento.
Esto es útil para cargas de trabajo de agentes, ya que una interrupción puede provocar el fracaso de tareas largas.
El ciclo de retroalimentación previsto para la plataforma es el siguiente:
- AI Ping mide continuamente la calidad del servicio.
- Las decisiones de enrutamiento utilizan los datos de medición más recientes.
- El tráfico real de usuarios proporciona datos de rendimiento adicionales.
- Los nuevos datos mejoran las evaluaciones y el enrutamiento futuros.
Qingcheng Zhiyun afirma que la API unificada permite a equipos más pequeños acceder a capacidades de enrutamiento y monitoreo que normalmente requerirían un equipo de plataforma interno.
La empresa reportó por separado las mejoras promedio en costo, rendimiento y latencia logradas a través de AI Ping. Estos porcentajes son resultados publicados por la plataforma; los resultados reales variarán según el modelo, proveedor, patrón de tráfico y estrategia de enrutamiento seleccionados.
Nodo de aplicación: Tienda de Agentes y ATM
La capa final se centra en cómo los agentes...
distribuyen sus tokens y las reglas de gobernanza de uso.
El sistema consta de dos componentes principales:
- Tienda de Agentes
- ATM (Administrador de Tokens de Agentes)
Tienda de Agentes
La Tienda de Agentes se posiciona como una capa de distribución y reutilización para agentes de uso general y específicos de la industria.
Su valor fundamental reside en conectar a los desarrolladores de agentes con las organizaciones que necesitan flujos de trabajo implementables, al mismo tiempo que permite que estos agentes accedan a una infraestructura de tokens más amplia.
El informe original la compara con un mercado de electrodomésticos conectados a una red eléctrica compartida. Al momento de redactar este documento, la documentación pública sobre la estrategia de precios, los criterios de revisión, los formatos de implementación y los términos comerciales de la Tienda de Agentes sigue siendo muy limitada.
ATM: Administrador de Tokens de Agentes
ATM significa Administrador de Tokens de Agentes.
Qingcheng Technology lo presentó en la Conferencia Mundial de Inteligencia Artificial 2026 como una herramienta local de gestión y gobernanza de tokens para sistemas multi-agente.
Esta herramienta ofrece las siguientes funcionalidades:
- Gestión unificada de credenciales de API
- Seguimiento del uso de tokens
- Contabilidad de asignación de costos
- Control de cuotas de consumo
- Cambio de proveedor y recuperación ante fallos
- Aislamiento de recursos entre múltiples agentes
- Alertas por uso anómalo
- Monitoreo localizado/sensible a la privacidad
La documentación original indica que el ATM puede observar la actividad de los agentes a través de mecanismos como ganchos de comportamiento, escaneo de archivos locales y puertas de enlace de privacidad.
En la práctica, el ATM funciona como un "medidor eléctrico" para las cargas de trabajo de IA. Su objetivo es correlacionar la facturación de tokens con el agente, la operación, el modelo y la herramienta que generaron ese consumo.
Esto está altamente relacionado con la filosofía de FinOps en la nube, la disciplina de medición y control del gasto en la nube. En los sistemas de agentes, el desafío es más granular, ya que un solo proceso de negocio puede contener múltiples niveles de llamadas anidadas a modelos.
Un registro de costos de agente efectivo debe incluir:
- Usuario o flujo de trabajo iniciador
- Agentes y subagentes involucrados
- Modelo seleccionado
- Número de tokens de entrada/salida
- Herramientas invocadas en la tarea
- Precios del proveedor
- Número de reintentos y llamadas fallidas
- Costo total y tiempo empleado
Qingcheng Technology posiciona al ATM como una capa de FinOps orientada a tokens para este nuevo tipo de cargas de trabajo.
Por qué Qingcheng Technology enfatiza la neutralidad
El artículo original señala que la neutralidad es una de las ventajas principales de Qingcheng Technology.
Las grandes empresas de computación en la nube y hardware tienden naturalmente a priorizar la promoción de sus propias plataformas, socios o inversiones. Por lo tanto, las organizaciones que operan clústeres híbridos prefieren elegir proveedores de software independientes que admitan múltiples aceleradores y proveedores de servicios competidores.
Qingcheng Technology afirma que su plataforma no está vinculada a un único proveedor de chips.
Esta filosofía se refleja en la capacidad de Chitu para admitir diversos entornos de hardware y en el modelo de enrutamiento multi-proveedor de AI Ping.
La neutralidad aún debe validarse en la práctica. Los clientes deben examinar los siguientes elementos:
- Versiones de hardware y software compatibles
- Reglas de enrutamiento
- Asociaciones comerciales
- Metodología de pruebas comparativas
- Políticas de retención de datos
- Opciones de selección de proveedores
- Mecanismos de conmutación por error y respaldo
Los antecedentes técnicos de la empresa constituyen otra de sus ventajas de posicionamiento.
Qingcheng Technology fue fundada en diciembre de 2023, y su equipo central proviene del Instituto de Computación de Alto Rendimiento del Departamento de Ciencias de la Computación de la Universidad de Tsinghua.
La empresa afirma que este equipo ha realizado trabajos de evaluación y optimización de rendimiento para centros de supercomputación y centros de computación inteligente.
Convertir la capacidad de cómputo nacional en un servicio de tokens exportable
Qingcheng AI también ve el servicio de tokens como una ruta viable para que la capacidad de cómputo nacional llegue a usuarios en el extranjero.
La lógica es la siguiente: el desarrollador no necesita saber qué acelerador generó la respuesta. El desarrollador compra la API del modelo y obtiene tokens.
Si el hardware nacional puede soportar modelos competitivos de manera estable y eficiente, entonces su salida puede venderse a través de una API unificada, y los clientes en el extranjero no necesitan implementar ni conocer la arquitectura de hardware subyacente.
Qingcheng AI ve el servicio de tokens como una forma de distribuir la capacidad de cómputo nacional a nivel global.
El informe original indica que el período pico de tráfico de desarrollo en el extranjero suele ocurrir entre las 10 p. m. y las 8 a. m. (hora de Pekín).
Esto crea una oportunidad potencial de utilización. La capacidad de cómputo que permanece inactiva durante las horas de menor actividad nacional puede emplearse para atender a usuarios de otras zonas horarias.
El flujo de trabajo descrito en el artículo es el siguiente:
- El acelerador nacional genera tokens a través de Chitu.
- AI Ping mide la calidad del servicio y dirige las solicitudes.
- Los socios distribuyen el servicio a desarrolladores en el extranjero.
- Los usuarios utilizan el modelo a través de una API estándar.
Esto no elimina los requisitos habituales de la prestación de servicios internacionales. Los proveedores de servicios aún deben gestionar latencia, cumplimiento normativo, gobernanza de datos, licencias de modelos, facturación, soporte técnico y disponibilidad regional.
Preparando el camino para la economía de agentes
En la exposición de inteligencia artificial, los productos más visibles suelen ser los modelos y las aplicaciones.
La infraestructura recibe menos atención, ya que gran parte de su trabajo ocurre bajo la interfaz de usuario. Determina si el modelo puede ejecutarse de manera estable, si el agente puede completar tareas y si el costo final es claro y comprensible.
El concepto de "tienda frontal con fábrica trasera" de Qingcheng AI conecta tres cuestiones:
- ¿Cómo producir tokens de manera eficiente?
- ¿Cómo enrutar tokens de manera confiable?
- ¿Cómo consumen y gestionan los agentes los tokens?
La "fábrica trasera" combina hardware, Chitu y Bagualu. La "tienda frontal" utiliza AI Ping para evaluar y enrutar servicios de modelos. Los nodos de aplicación utilizan Agent Store y ATM para distribuir agentes y gestionar su consumo de tokens.
La analogía de la red eléctrica no es un estándar técnico, pero ofrece a las empresas una perspectiva práctica para comprender la arquitectura integral.
Esta arquitectura no trata cada API de modelo, clúster de aceleradores y agente como productos aislados, sino como componentes interconectados dentro de la cadena de suministro de tokens.
Preguntas frecuentes
¿Qué es la arquitectura de "tienda frontal con fábrica trasera" de tokens de Qingcheng AI?
Es un modelo de infraestructura de IA de tres capas que abarca producción de tokens, enrutamiento de API y aplicaciones de agentes. La "fábrica trasera" utiliza hardware de cómputo, Chitu y Bagualu; la capa intermedia emplea AI Ping; y la capa de aplicación incluye Agent Store y ATM.
¿Qué es el motor de inferencia Chitu?
Chitu es un framework de inferencia de modelos de lenguaje grandes, de código abierto y orientado a producción. Admite múltiples plataformas de aceleradores nacionales e internacionales, diversas escalas de despliegue, inferencia de baja precisión e interfaces de servicio HTTP compatibles con OpenAI.
¿Chitu redujo todos los costos de despliegue de DeepSeek en un 75%?
No se ha publicado una promesa general de reducción del 75%. Ese dato proviene de un escenario específico de despliegue FP4, donde la necesidad de servidores se redujo de cuatro a uno, es decir, una disminución del 75% en la cantidad de máquinas.
¿Se puede desplegar Chitu mediante Docker?
Sí. El repositorio oficial de Chitu ya proporciona Dockerfiles adaptados a diversos entornos de hardware, como Ascend, Hygon y MetaX, junto con documentación general de instalación y despliegue.
¿Para qué sirve AI Ping?
AI Ping se utiliza para monitorear y comparar servicios de API de modelos, y para enrutar solicitudes según objetivos de costo, velocidad, confiabilidad o calidad. Ofrece una API unificada sobre múltiples proveedores de servicios.
¿Qué es Agent Token Manager?
Agent Token Manager (ATM) es una herramienta de gobernanza de tokens diseñada por Qingcheng AI para sistemas de agentes. Se utiliza para rastrear el uso, distribuir costos, gestionar credenciales, establecer límites, aislar cargas de trabajo y alertar a los equipos ante consumos anormales.
¿Es Bagualu un motor de inferencia?
Bagualu es una pila de software más amplia, no solo un motor de inferencia. Abarca áreas como entrenamiento, despliegue de inferencia, programación, monitoreo, entrega de aplicaciones y operación de clústeres, mientras que Chitu se encarga de la capa central de inferencia de modelos.
¿El resultado de "reducción del 75% en costos" ha sido verificado de forma independiente?
Dicho resultado fue proporcionado por Qingcheng AI y el informe original. Los detalles específicos de despliegue necesarios para una reproducción independiente aún no se han divulgado por completo. Se recomienda a los lectores que realicen sus propias pruebas con sus modelos, hardware y cargas de trabajo.
Herramientas relacionadas
- Chitu: Framework de inferencia de código abierto orientado a producción para modelos de lenguaje grandes y hardware heterogéneo.
- AI Ping: Plataforma de evaluación de servicios de modelos y enrutamiento inteligente de API operada por Qingcheng AI.
- Bagualu: Pila de software de Qingcheng AI para entrenamiento, inferencia, despliegue y operación de clústeres de modelos.
- vLLM: Motor de servicio de código abierto ampliamente utilizado para modelos de lenguaje grandes de alto rendimiento.
- SGLang: Framework de servicio de código abierto para modelos de lenguaje y multimodales.
- DeepSeek: Plataforma oficial de la serie de modelos DeepSeek mencionada en los casos de despliegue.
- Especificación de API de OpenAI: Formato de API utilizado por la mayoría de los motores de servicio de modelos para compatibilidad de aplicaciones.
Enlaces relacionados
- Sitio web oficial de Qingcheng AI: Información oficial de productos y empresa sobre Chitu, Bagualu y AI Ping.
- Repositorio de GitHub de Chitu: Incluye código fuente, Dockerfiles, modelos compatibles, versiones, pruebas de referencia y documentación de despliegue.
- Página de producto de Chitu: Resumen de Qingcheng AI sobre hardware compatible, modelos, interfaces y declaraciones de rendimiento.
- Página de producto de Bagualu: Información oficial sobre entrenamiento e infraestructura.
Software.
- Página de producto de Bagualu: Información oficial sobre entrenamiento e infraestructura.
- AI Ping: Plataforma oficial de evaluación de modelos y enrutamiento unificado de API.
- Informe de Science and Technology Daily: Reportaje independiente que cubre la solución integral de tokens de Qingcheng AI y las métricas de AI Ping.
- Dispositivo Bagualu de Inspur Yuan Brain: Publicación de resultados de pruebas de dispositivos empresariales optimizados conjuntamente con Chitu y Bagualu.
Resumen
En la Conferencia Mundial de Inteligencia Artificial 2026, Qingcheng AI presentó una infraestructura de tokens de tres capas diseñada para conectar inferencia de modelos, enrutamiento de API, distribución de agentes y gobernanza de costos.
La capa de fábrica trasera utiliza Chitu y Bagualu para optimizar el despliegue de modelos en hardware de cómputo heterogéneo. Según el informe de la empresa, en una configuración FP4 de DeepSeek, la cantidad de máquinas necesarias se redujo de cuatro a una, logrando una reducción del 75% en costos.
AI Ping constituye la capa de enrutamiento intermedio, mientras que Agent Store y ATM cubren la distribución de agentes y las operaciones financieras de tokens. Cada producto contribuye a hacer que el suministro de tokens sea más estable, cuantificable e independiente de un único proveedor de hardware o API.
La idea central es sencilla: los agentes de IA no solo necesitan modelos, sino también una capa de infraestructura capaz de generar, enrutar, medir y controlar cada token que consumen.