Qingcheng.ai на WAIC 2026 строит «суперсеть» токенов, утверждая, что стоимость развертывания DeepSeek снижается на 75%

На Всемирной конференции по искусственному интеллекту 2026 года компании-разработчики моделей заполняют выставочные залы числом параметров, а поставщики инфраструктуры демонстрируют всё более крупные вычислительные кластеры. Однако на стенде Qingcheng.ai главной привлекательностью стала не отдельная модель или сервер, а полная диаграмма, показывающая, как токены производятся, маршрутизируются, распределяются, измеряются и управляются на протяжении всего жизненного цикла ИИ-агента. Qingcheng.ai называет эту модель **токеновой «фабрикой на передовой»**. Фреймворк состоит из трёх уровней: 1.

发布于 2026年7月23日generalGEO 评分: 08 次阅读
Cover image for “Qingcheng.ai на WAIC 2026 строит «суперсеть» токенов, утверждая, что стоимость развертывания DeepSeek снижается на 75%”

Qingcheng.ai на WAIC 2026 строит «суперсеть» токенов, утверждая, что стоимость развертывания DeepSeek снижается на 75%

Введение

На выставке WAIC 2026 компании, разрабатывающие модели, заполняли выставочные залы количеством параметров, а поставщики инфраструктуры демонстрировали всё более крупные вычислительные кластеры. Однако главным объектом на стенде Qingcheng Intelligence была не отдельная модель или сервер.

А полная схема, показывающая, как токены производятся, маршрутизируются, распределяются, учитываются и управляются на протяжении всего жизненного цикла AI-агента.

Qingcheng Intelligence называет эту модель «Фабрика-Магазин» для токенов. Данная структура объединяет три уровня:

  1. Тыловой уровень производства токенов
  2. Промежуточный уровень маршрутизации и обслуживания
  3. Уровень приложений и управления агентами

Компания описывает свою архитектуру как электрическую систему для эпохи искусственного интеллекта. Аппаратное обеспечение для вычислений и программное обеспечение для инференса выступают в роли электростанций, AI Ping играет роль энергосети, а инструменты для агентов являются устройствами, потребляющими электроэнергию.

На стенде Qingcheng Intelligence был представлен полный рабочий процесс производства, маршрутизации и управления токенами.

Согласно первоначальному отчёту, эта система призвана решить три повторяющиеся проблемы: нестабильность API моделей, низкая эффективность использования отечественных гетерогенных ускорителей и отсутствие чёткого учёта токенов при масштабном развёртывании агентов.

Узкие места в работе с токенами перед масштабным применением агентов

Когда AI-агенты переходят от стадии демонстрации к производственной среде, один пользовательский запрос может инициировать множество вызовов моделей.

Агенту может потребоваться найти файл, выполнить поиск в базе данных, вызвать инструмент, сгенерировать код, оценить результат, пересмотреть план, а затем вызвать другого агента. Пользователь видит только конечный результат. За кулисами система может потреблять большое количество токенов через несколько сервисов.

В исходной статье были обозначены три основные проблемы инфраструктуры, которые обостряются по мере расширения рабочих процессов.

Нестабильное снабжение токенами

Пропускная способность API моделей может колебаться в периоды пикового спроса.

Один и тот же запрос может быть выполнен быстро в один момент и стать медленным или недоступным в другой. В сценариях непринуждённого общения небольшая задержка может быть приемлема, но в многошаговых рабочих процессах агентов, где каждый последующий шаг зависит от ответа предыдущего, такая задержка может привести к сбою всего процесса.

Таким образом, корпоративным системам требуется не просто доступ к одной модели. Им нужны предсказуемая задержка, пропускная способность, надёжность и качество вывода.

Трудности эффективного использования отечественных ускорителей

Многие организации уже закупили смешанный парк отечественных GPU, NPU и серверов для интеллектуальных вычислений. Аппаратное обеспечение может быть на месте, но развёртывание на нём больших моделей с высокой эффективностью остаётся сложной задачей.

Популярные фреймворки для инференса, такие как vLLM, изначально оптимизировались под NVIDIA и экосистему CUDA. Хотя они поддерживают всё больше устройств, адаптация каждой функции и оптимизации к разным архитектурам ускорителей требует значительных инженерных усилий.

Qingcheng Intelligence считает, что собственные нативные движки для инференса и программные стеки с учётом аппаратных особенностей способны извлекать больше полезных токенов из таких кластеров.

Сложность отслеживания расходов на агентов

Когда компания управляет несколькими агентами, ежемесячные счета за модели не всегда показывают, какой именно рабочий процесс генерирует затраты.

Отдельный агент может вызывать несколько моделей, использовать нескольких поставщиков, запускать под-агентов и работать непрерывно в течение нескольких часов. Без детального отслеживания организация может с трудом ответить на основные вопросы:

  • Какой агент потребил токены?
  • Какую модель и какого поставщика он вызвал?
  • Какой инструмент или шаг привёл к наибольшим затратам?
  • Не превысил ли какой-то рабочий процесс ожидаемый бюджет?
  • Можно ли было направить этот запрос к более дешёвому сервису?

Qingcheng Intelligence позиционирует свою трёхуровневую систему как единую инфраструктурную архитектуру, объединяющую производство, распределение, применение и выставление счетов.

Изображение демонстрирует зону магазина AI Ping Token на стенде Qingcheng Intelligence на выставке WAIC 2026. Магазин оформлен в зелёных и розовых тонах, имеются вывески «Магазин AI Ping Token», «AI Ping Token – много, быстро, дёшево», «Магазин агентов». На прилавке представлены различные товары, такие как блокноты, USB-накопители, под прилавком – надпись «Покупай токены на aiping.cn». На заднем плане также видны вывески «Фабрика токенов», «LTHPC», а также табличка «Помощник отечественных токенов №000030». Изображение наглядно демонстрирует связанные с AI Ping Token продукты и рекламные материалы, представленные Qingcheng Intelligence на выставке.

План выставки описывает рабочий процесс от базовых вычислений до приложений агентов.

Трёхуровневая архитектура «Фабрика-Магазин»

Архитектура построена вокруг простой промышленной аналогии.

Фабрика отвечает за преобразование вычислительного оборудования в токены. Магазин агрегирует и маршрутизирует услуги по работе с токенами. Узлы приложений распространяют агентов и контролируют способы потребления токенов.

Архитектура Qingcheng Intelligence связывает производство токенов, маршрутизацию услуг и управление агентами.

Эти три уровня предназначены для совместной работы, а не как изолированные продукты.

Фабрика: уровень производства токенов

Фабрика отвечает за преобразование физических вычислительных ресурсов в стандартизированные возможности инференса моделей.

Её основные компоненты включают:

  • Аппаратное обеспечение и вычислительных партнёров
  • Движок инференса Chitu
  • Интеллектуальный программный стек Bagua Lu

Qingcheng Intelligence сравнивает этот уровень с электростанцией. Его цель – генерировать как можно больше стабильных и готовых к использованию токенов из доступного оборудования, одновременно снижая сложность развёртывания.

Chitu: производственный движок для инференса

Chitu – это высокопроизводительный фреймворк для инференса с открытым исходным кодом от Qingcheng Intelligence.

Официальный репозиторий описывает его как движок, ориентированный на производство, эффективность, гибкость и удобство использования. Он поддерживает развёртывание от CPU и одного ускорителя до крупных кластеров и оптимизирован для нескольких отечественных аппаратных платформ.

Проект также поддерживает модели DeepSeek, Qwen, GLM и Kimi, а также стандартный HTTP-интерфейс, совместимый с OpenAI.

Изображение демонстрирует информацию о Qingcheng Intelligence как универсальном поставщике услуг по работе с токенами. Фон – градиент синего и белого цветов, в левом верхнем углу – логотип и название Qingcheng Intelligence. В центре крупным заголовком указано «Qingcheng Intelligence – универсальный поставщик услуг по работе с токенами», ниже описывается, что компания является профессиональным универсальным поставщиком решений для работы с токенами по полному циклу, опирается на собственные разработанные движки для инференса больших моделей и интеллектуальные алгоритмы маршрутизации для повышения эффективности использования интеллектуальных вычислительных мощностей, предоставляя отрасли высококачественные и недорогие услуги по работе с токенами больших моделей. Внизу расположены три значка сервисов: «Движок инференса Chitu», «Универсальная платформа услуг по работе с токенами AI Ping» и «Серия программ Bagua Lu». В правом верхнем углу – QR-код с предложением отсканировать его и подписаться на официальный аккаунт Qingcheng Intelligence в WeChat.

Chitu используется для повышения производительности инференса больших моделей на гетерогенных вычислительных платформах.

Qingcheng Intelligence полагает, что адаптация фреймворка, разработанного для одной аппаратной экосистемы, может быть похожа на использование неподходящего инструмента. Аналогия компании: духовку, предназначенную для выпечки хлеба, можно переделать… для варки пельменей на пару, но специальная пароварка может более эффективно использовать имеющееся тепло.

Хотя это сравнение упрощено, стоящие за ним инженерные проблемы реальны. Архитектуры ускорителей различаются по памяти, коммуникациям, операторам, числовым форматам, поведению компилятора и планировщика.

Chitu включает аппаратно-специфичные оптимизации и поддержку инференса с низкой точностью, включая конфигурации FP4 и FP8.

Заявление о снижении затрат на DeepSeek на 75%

В исходном отчёте утверждается, что развёртывание модели DeepSeek в конфигурации FP4 позволило сократить необходимое количество машин с четырёх до одной.

В этой конкретной конфигурации сокращение с четырёх машин до одной означает уменьшение потребности в количестве машин на 75%. Статья переводит это сокращение в снижение затрат на 75%.

В отчёте снижение количества машин при развёртывании DeepSeek с четырёх до одной объясняется оптимизацией FP4.

Этот результат не следует интерпретировать как гарантию всеобщего снижения затрат на 75% для каждого развёртывания DeepSeek.

Фактическая экономия зависит от следующих факторов:

  • Выбранной модели DeepSeek и схемы квантизации
  • Типа и объёма памяти ускорителя
  • Конфигурации сервера
  • Длины контекста
  • Размера пакета и уровня параллелизма
  • Целевых показателей задержки
  • Требований к точности
  • Версии программного обеспечения
  • Стоимости электроэнергии и эксплуатационных расходов

Chitu с открытым исходным кодом

Репозиторий также отмечает, что результаты производительности могут различаться в зависимости от аппаратного обеспечения, программного обеспечения и тестовой нагрузки.

Багуалу: скрытие инфраструктурной сложности

Багуалу — это программный стек Qingcheng.ai для обучения моделей, инференса, развертывания, планирования и эксплуатации.

Компания представляет его как способ упаковки сложных инфраструктурных задач в более управляемую корпоративную платформу.

Багуалу размещается поверх гетерогенного оборудования, предоставляя инструменты для развертывания и эксплуатации.

Багуалу предназначен для сокращения ручного труда в следующих областях:

  • Управление ресурсами кластера
  • Развертывание моделей и приложений
  • Распределенное обучение
  • Оптимизация инференса
  • Оценка производительности
  • Доставка приложений
  • Мониторинг и эксплуатация

Qingcheng.ai также совместно с Inspur Information выпустила совместно оптимизированный все-в-одном аппаратно-программный комплекс Юаньнао Багуалу. В опубликованном тесте Qwen3-32B партнеры сообщили, что после оптимизации с помощью Chitu общая пропускная способность инференса увеличилась до 14,45 раз, а после полной стековой оптимизации сквозная производительность повысилась примерно в 10 раз.

Эти данные получены из собственной тестовой среды партнерских компаний и не эквивалентны случаю DeepSeek FP4, описанному на WAIC.

Оптимизация гетерогенного кластера

Уровень бэкенд-фабрики предназначен для управления несколькими типами ускорителей.

Одной из стратегий, упомянутых в оригинальном отчете, является

разделение рабочих нагрузок префиллинг и декодинг.

На этапе префиллинга система обрабатывает входные подсказки и строит внутренний кеш модели. На этапе декодинга система последовательно генерирует выходные токены. Эти два этапа различаются по характеристикам памяти, пропускной способности и вычислений.

Гетерогенный кластер может назначить каждый этап тому оборудованию, которое обрабатывает его наиболее эффективно. Такая практика иногда называется "разделение префиллинга и декодинга".

Цель состоит не в том, чтобы все ускорители работали одинаково, а в том, чтобы разное оборудование обрабатывало те части рабочей нагрузки, которые лучше всего соответствуют его сильным сторонам.

Магазин: AI Ping в качестве хаба маршрутизации токенов

Как только токены сгенерированы, приложению все еще требуется стабильный способ их получения.

Промежуточный уровень — это AI Ping, платформа оценки сервисов моделей и маршрутизации API от Qingcheng.ai.

AI Ping постоянно мониторит сервисы моделей и предоставляет унифицированный интерфейс поверх нескольких поставщиков услуг.

Это рекламное изображение платформы токен-сервиса AI Ping от Qingcheng.ai. Ключевые функции платформы включают унифицированный интерфейс для связи с несколькими модельными сервисами, оценку качества токенов и производительности, а также интеллектуальную маршрутизацию, помогающую пользователям выбирать наиболее экономичные токен-сервисы. На изображении показано, что платформа может подключаться к основным моделям, таким как DeepSeek, Owen, MiniMax, GLM, Kimi. Также представлены результаты фактических измерений, указано, что использование платформы позволяет снизить затраты более чем на 37%, повысить пропускную способность более чем на 90% и снизить задержку более чем на 20%. По бокам изображения расположены QR-коды для вступления в группу в Feishu и для отслеживания оценки сервисов больших моделей. URL платформы: aiping.cn.

AI Ping оценивает API моделей и маршрутизирует запросы между поставщиками услуг.

В оригинальном отчете указывается, что AI Ping мониторит:

  • Более 30 поставщиков услуг
  • Более 600 интерфейсов модельных сервисов
  • Задержку
  • Пропускную способность
  • Надежность
  • Процент попаданий в кеш
  • Качество токенов
  • Ценообразование и доступность сервисов

Платформа предназначена для снижения потребности разработчиков в создании учетных записей, управлении различными форматами API и ручном сравнении поставщиков услуг.

Пользователи могут устанавливать приоритетные цели, например:

  • Снижение затрат
  • Ускорение времени отклика
  • Повышение надежности
  • Улучшение качества вывода

Если предпочтения не указаны, AI Ping может использовать свою логику маршрутизации для выбора доступного сервиса.

Динамическая маршрутизация при перегрузке сервиса

Статическая интеграция отправляет каждый запрос одному и тому же поставщику услуг, пока разработчик не изменит конфигурацию.

Динамическая маршрутизация работает иначе. Если какой-либо поставщик услуг замедляется или становится недоступным, уровень маршрутизации может перенаправить последующие запросы к другим поставщикам, которые в данный момент работают лучше.

Это полезно для рабочих нагрузок агентов, поскольку один сбой может привести к сбою длительной задачи.

Ожидаемый цикл обратной связи платформы выглядит следующим образом:

  1. AI Ping постоянно измеряет качество сервиса.
  2. Решения о маршрутизации используют последние данные измерений.
  3. Реальный пользовательский трафик предоставляет дополнительные данные о производительности.
  4. Новые данные улучшают будущие оценки и маршрутизацию.

Qingcheng.ai заявляет, что унифицированный API позволяет небольшим командам получить доступ к возможностям маршрутизации и мониторинга, которые обычно требуют внутренней платформенной команды.

Компания отдельно сообщила о средних улучшениях затрат, пропускной способности и задержки, достигнутых с помощью AI Ping. Эти проценты являются опубликованными результатами платформы; фактические результаты могут варьироваться в зависимости от выбранной модели, поставщика услуг, структуры трафика и стратегии маршрутизации.

Узел приложения: Магазин агентов и ATM

Конечный уровень фокусируется на том, как агенты...

распространяются их токены и правила использования.

Система состоит из двух основных компонентов:

  • Магазин агентов (Agent Store)
  • ATM (менеджер токенов агентов)

Магазин агентов

Магазин агентов позиционируется как уровень распространения и повторного использования агентов общего назначения и отраслевой специфики.

Его основная ценность заключается в соединении разработчиков агентов с организациями, нуждающимися в развертываемых рабочих процессах, а также в предоставлении этим агентам доступа к более широкой токен-инфраструктуре.

В оригинальном отчете это сравнивается с рынком бытовой техники, подключенной к общей электросети. На момент составления данного документа публичная документация по стратегии ценообразования, стандартам модерации, форматам развертывания и коммерческим условиям магазина агентов была весьма ограничена.

ATM: Менеджер токенов агентов

ATM расшифровывается как Менеджер токенов агентов.

Qingcheng Technology представила его на Всемирной конференции по искусственному интеллекту 2026 года как инструмент локализованного управления токенами и их использования для многокомпонентных агентных систем.

Этот инструмент предоставляет следующие функции:

  • Единое управление учетными данными API
  • Отслеживание использования токенов
  • Учет распределения затрат
  • Контроль лимитов расходов
  • Переключение поставщиков и восстановление после сбоев
  • Изоляция ресурсов для нескольких агентов
  • Предупреждение о аномальном использовании
  • Локализованный/конфиденциальный мониторинг

В исходной литературе указано, что ATM может наблюдать за активностью агентов через такие механизмы, как хуки поведения, сканирование локальных файлов и шлюзы конфиденциальности.

На практике ATM напоминает "электрический счетчик" для рабочих нагрузок ИИ. Его цель — связать выставление счетов за токены с агентом, операцией, моделью и инструментом, которые породили это потребление.

Это тесно связано с концепцией управления затратами в облаке (FinOps) — дисциплиной измерения и контроля облачных расходов. В агентных системах задача становится более детальной, поскольку один бизнес-процесс может содержать многоуровневые вложенные вызовы моделей.

Эффективный учет затрат на агентов должен включать:

  1. Инициирующего пользователя или рабочий процесс
  2. Задействованных агентов и подагентов
  3. Выбранную модель
  4. Количество входных/выходных токенов
  5. Инструменты, вызванные в задаче
  6. Ценообразование поставщика
  7. Количество повторных попыток и неудачных вызовов
  8. Общую стоимость и время выполнения

Qingcheng Technology позиционирует ATM как управляющий слой FinOps, ориентированный на токены, для таких новых типов рабочих нагрузок.

Почему Qingcheng Technology подчеркивает нейтральность

В оригинальной статье указывается, что нейтральность является одним из ключевых преимуществ Qingcheng Technology.

Крупные облачные и аппаратные компании естественным образом склонны в первую очередь продвигать свои собственные платформы, партнеров или инвестиционные проекты. Поэтому организации, управляющие гибридными кластерами, предпочитают независимых поставщиков программного обеспечения, которые поддерживают несколько конкурирующих ускорителей и поставщиков услуг.

Qingcheng Technology утверждает, что ее платформа не привязана к одному поставщику чипов.

Эта концепция отражена в способности Chitu поддерживать разнообразные аппаратные среды и в модели многопоставщической маршрутизации AI Ping.

Нейтральность еще предстоит проверить на практике. Клиентам следует оценить следующие аспекты:

  • Поддерживаемые версии аппаратного и программного обеспечения
  • Правила маршрутизации
  • Коммерческие партнерства
  • Методологию тестирования
  • Политику хранения данных
  • Варианты выбора поставщиков
  • Механизмы аварийного переключения и отката

Технический фон компании составляет еще одно ее позиционное преимущество.

Компания Qingcheng Technology была основана в декабре 2023 года, и ее основная команда происходит из Института высокопроизводительных вычислений факультета компьютерных наук Университета Цинхуа.

Компания заявляет, что эта команда ранее проводила оценку производительности и оптимизацию для суперкомпьютерных центров и центров интеллектуальных вычислений.

Превращение отечественных вычислительных мощностей в экспортируемый токен-сервис

Qingcheng AI также рассматривает токен-сервис как возможный путь для доступа отечественных вычислительных мощностей к зарубежным пользователям.

Логика такова: разработчику не нужно знать, какой ускоритель сгенерировал ответ. Разработчик покупает API модели и получает токены.

Если отечественное оборудование сможет стабильно и эффективно поддерживать конкурентоспособные модели, то их результаты можно будет продавать через унифицированный API, и зарубежным клиентам не придется развертывать или знать о лежащей в основе аппаратной архитектуре.

Qingcheng AI рассматривает токен-сервис как способ распространения отечественных вычислительных мощностей по всему миру.

Оригинальный отчет показывает, что пиковый трафик зарубежных разработчиков обычно приходится на период с 22:00 до 8:00 по пекинскому времени.

Это создает потенциальную возможность для использования ресурсов. Вычислительные мощности, простаивающие в непиковые часы в Китае, могут быть задействованы для обслуживания пользователей в других часовых поясах.

Описанный в статье рабочий процесс выглядит следующим образом:

  1. Отечественные ускорители генерируют токены с помощью Chitu.
  2. AI Ping оценивает качество сервиса и распределяет запросы.
  3. Партнеры распространяют сервис среди зарубежных разработчиков.
  4. Пользователи используют модель через стандартный API.

Это не отменяет стандартных требований международной доставки сервисов. Поставщикам услуг по-прежнему необходимо решать вопросы задержки, соответствия нормативным требованиям, управления данными, лицензирования моделей, биллинга, технической поддержки и региональной доступности.

Прокладывая путь к экономике агентов

На выставке AI самыми заметными продуктами часто оказываются модели и приложения.

Инфраструктура получает меньше внимания, поскольку большая часть её работы происходит под пользовательским интерфейсом. Она определяет, сможет ли модель работать стабильно, сможет ли агент выполнить задачу и будет ли конечная стоимость понятной и прозрачной.

Концепция «передний магазин — задняя фабрика» от QingCheng AI связывает три вопроса:

  • Как эффективно производить токены?
  • Как надёжно маршрутизировать токены?
  • Как агенты потребляют и управляют токенами?

«Задняя фабрика» объединяет оборудование, Chitu и Bagualu. «Передний магазин» использует AI Ping для оценки и маршрутизации сервисов моделей. Уровень приложений использует Agent Store и ATM для распространения агентов и управления потреблением их токенов.

Аналогия с электросетью не является техническим стандартом, но она предлагает предприятиям практический взгляд на понимание полной архитектуры стека.

Эта архитектура рассматривает каждый модельный API, кластер ускорителей и агента не как изолированные продукты, а как взаимосвязанные компоненты в цепочке поставок токенов.

Часто задаваемые вопросы

Что такое архитектура «передний магазин — задняя фабрика» токенов от QingCheng AI?

Это трёхуровневая модель AI-инфраструктуры, охватывающая производство токенов, маршрутизацию API и приложения агентов. «Задняя фабрика» использует вычислительное оборудование, Chitu и Bagualu; средний уровень использует AI Ping; уровень приложений включает Agent Store и ATM.

Что такое движок вывода Chitu?

Chitu — это среда вывода для больших моделей с открытым исходным кодом, ориентированная на производственное использование. Она поддерживает множество отечественных и международных платформ ускорителей, различные масштабы развёртывания, низкоточный вывод и совместимый с OpenAI HTTP-интерфейс сервиса.

Снизил ли Chitu стоимость развёртывания всех DeepSeek на 75%?

Нет, универсального обещания снижения стоимости на 75% опубликовано не было. Эти данные относятся к конкретному сценарию развёртывания FP4 — в данной конфигурации количество серверов было сокращено с четырёх до одного, то есть количество машин уменьшилось на 75%.

Можно ли развернуть Chitu с помощью Docker?

Да. Официальный репозиторий Chitu уже предоставляет Dockerfile для адаптации к различным аппаратным средам, таким как Ascend, Hygon, MetaX и другим, а также включает общую документацию по установке и развёртыванию.

Для чего используется AI Ping?

AI Ping используется для мониторинга и сравнения API-сервисов моделей, а также для маршрутизации запросов на основе таких целей, как стоимость, скорость, надёжность или качество. Он предоставляет единый API поверх нескольких поставщиков услуг.

Что такое Agent Token Manager?

Agent Token Manager (сокращённо ATM) — это инструмент управления токенами от QingCheng AI, предназначенный для систем агентов. Он используется для отслеживания использования, распределения затрат, управления учётными данными, установки лимитов, изоляции рабочих нагрузок и оповещения команд об аномальном потреблении.

Является ли Bagualu движком вывода?

Bagualu — это более широкая программная платформа, а не только движок вывода. Она охватывает такие области, как обучение, развёртывание вывода, планирование, мониторинг, доставка приложений и эксплуатация кластеров, в то время как Chitu отвечает за базовый уровень вывода моделей.

Были ли результаты «снижения стоимости на 75%» независимо проверены?

Результаты были предоставлены QingCheng AI и оригинальным отчётом. Конкретные детали развёртывания, необходимые для независимого воспроизведения, ещё не были полностью опубликованы. Рекомендуется читателям самостоятельно тестировать на своих собственных моделях, оборудовании и рабочих нагрузках.

Связанные инструменты

  • Chitu: Производственная среда вывода с открытым исходным кодом для больших языковых моделей и гетерогенного оборудования.
  • AI Ping: Платформа оценки сервисов моделей и интеллектуальной маршрутизации API, управляемая QingCheng AI.
  • Bagualu: Программная платформа от QingCheng AI для обучения, вывода, развёртывания и эксплуатации кластеров моделей.
  • vLLM: Широко используемый открытый движок для обслуживания больших моделей с высокой пропускной способностью.
  • SGLang: Открытая платформа для обслуживания языковых и мультимодальных моделей.
  • DeepSeek: Официальная платформа серии моделей DeepSeek, обсуждаемых в примерах развёртывания.
  • OpenAI API Spec: Формат API, используемый большинством движков обслуживания моделей для совместимости приложений.

Связанные ссылки

Резюме

На Всемирной конференции по искусственному интеллекту 2026 года QingCheng AI представила трёхуровневую инфраструктуру токенов, предназначенную для соединения вывода моделей, маршрутизации API, распространения агентов и управления затратами.

Уровень «задней фабрики» использует Chitu и Bagualu, оптимизируя развёртывание моделей на гетерогенных вычислительных устройствах. Согласно отчёту компании, в конфигурации FP4 DeepSeek количество требуемых машин было сокращено с четырёх до одной, что позволило достичь снижения затрат на 75%.

AI Ping образует средний уровень маршрутизации, в то время как Agent Store и ATM покрывают распространение агентов и финансовые операции с токенами. Вместе продукты стремятся сделать поставку токенов более стабильной, измеримой и независимой от единственного поставщика оборудования или API.

Основная идея проста: AI-агентам нужны не только модели — им нужен инфраструктурный слой, который может генерировать, маршрутизировать, измерять и контролировать каждый потреблённый ими токен.