Qingcheng.ai 在 WAIC 2026 构建代币“超级网格”,声称 DeepSeek 部署成本降低 75%
在 2026 年世界人工智能大会上,模型公司用参数数量填满展厅,而基础设施提供商则展示越来越大的计算集群。然而,在 Qingcheng.ai 的展台,主要吸引力并非单个模型或服务器,而是一张完整图表,展示了代币如何在 AI Agent 全生命周期中被生产、路由、分发、计量和治理。Qingcheng.ai 将这一模型称为 **代币“前店后厂”**。该框架包含三层:1.

Qingcheng.ai 在 WAIC 2026 构建代币“超级网格”,声称 DeepSeek 部署成本降低 75%
引言
在 WAIC 2026 展会上,模型公司用参数数量填满展厅,基础设施提供商则展示日益庞大的计算集群。然而,青城智能展台的主角并非某个单一模型或服务器。
而是一张完整的示意图,展示了 Token 如何在 AI Agent 的完整生命周期内被生产、路由、分发、计量和治理。
青城智能将这一模型称为 Token“前店后厂”。该框架融合了三个层次:
- 后端的 Token 生产层
- 中间的路由与服务层
- Agent 应用与治理层
该公司将其架构描述为人工智能时代的电力系统。算力硬件与推理软件充当发电厂,AI Ping 扮演电网角色,而 Agent 工具则是消耗电力的设备。
青城智能展台展示了完整的 Token 生产、路由与治理工作流程。
根据原始报告,该系统旨在解决三个反复出现的问题:模型 API 不稳定、国产异构加速器利用率低下,以及大规模 Agent 部署中缺乏清晰的 Token 核算。
大规模 Agent 应用前的 Token 瓶颈
随着 AI Agent 从演示阶段步入生产环境,一个用户请求可能触发多次模型调用。
一个 Agent 可能需要检索文件、搜索数据库、调用工具、生成代码、评估结果、修订计划,再调用另一个 Agent。用户看到的响应只是最终步骤。在其背后,系统可能跨多个服务消耗大量 Token。
原始文章指出了三大基础设施问题,这些问题随着工作流扩展而愈发严重。
Token 供给不稳定
模型 API 容量在需求高峰期可能出现波动。
同一请求可能在某一时刻快速响应,而在另一时刻变得缓慢或不可用。在闲聊场景中,短暂的延迟或许可以接受,但在每一步后续操作都依赖前一步响应的多步骤 Agent 工作流中,这种延迟可能导致流程中断。
因此,企业系统需要的不仅仅是访问一个模型。它们需要可预测的延迟、吞吐量、可靠性和输出质量。
国产加速器难以高效利用
许多机构已采购了混合的国产 GPU、NPU 和智算服务器。硬件可能已就位,但要在其上高效部署大型模型仍然困难重重。
vLLM 等流行的推理框架最初针对 NVIDIA 和 CUDA 生态进行了优化。它们虽能支持越来越多的设备,但要将每一项功能和优化适配到不同的加速器架构,仍需大量工程工作。
青城智能认为,原生推理引擎和具备硬件感知能力的软件栈能够从这些集群中提取更多可用的 Token 输出。
Agent 支出难以追踪
当一家公司运营多个 Agent 时,月度模型账单并不总能显示是哪条工作流产生了成本。
单个 Agent 可能调用多个模型,使用
多个供应商、启动子代理并持续运行数小时。如果没有详细的追踪,组织可能难以回答一些基本问题:
- 哪个Agent消耗了Token?
- 它调用了哪个模型和供应商?
- 哪个工具或步骤造成了最大的成本?
- 某个工作流是否超出了预期预算?
- 该请求能否被路由到更便宜的服务?
清程极智将其三层体系定位为连接生产、分发、应用和计费的一体化基础设施架构。

展览蓝图描绘了从底层计算到Agent应用的工作流程。
三层“前店后厂”架构
该架构围绕一个简单的工业类比构建。
后厂负责将计算硬件转化为Token。商店聚合和路由Token服务。应用节点分发Agent并控制Token的消耗方式。
清程极智的架构连接了Token生产、服务路由和Agent治理。
这三个层级旨在协同工作,而非作为孤立产品存在。
后厂:Token生产层
后厂负责将物理计算资源转化为标准化的模型推理能力。
其主要组成部分包括:
- 硬件及计算合作伙伴
- 赤兔推理引擎
- 八卦炉智能软件栈
清程极智将此层比喻为发电厂。其目标是在降低部署复杂度的同时,从可用硬件中生成尽可能多、稳定且可用的Token。
赤兔:面向生产的推理引擎
赤兔是清程极智开源的高性能推理框架。
官方仓库将其描述为一个面向生产、注重效率、灵活性和可用性的引擎。它支持从CPU及单加速器到大规模集群的部署,并对多个国产硬件平台进行了优化支持。
该项目还支持DeepSeek、Qwen、GLM和Kimi等模型,以及标准的OpenAI兼容HTTP接口。

赤兔用于提升异构计算平台上的大模型推理能力。
清程极智认为,将一个围绕单一硬件生态系统设计的框架进行适配,可能类似于用错工具。该公司的类比是:一个为烤面包设计的烤箱,可以被改造……
蒸包,但专用蒸笼可能更有效地利用现有热量。
这种比较虽然简化了,但背后涉及的工程问题真实存在。加速器架构在内存、通信、算子、数值格式、编译和调度行为等方面存在差异。
Chitu 包含硬件特定的优化和低精度推理支持,包括 FP4 和 FP8 配置。
75% 的 DeepSeek 成本声明
原始报告指出,采用 FP4 部署的 DeepSeek 模型将所需硬件从四台机器减少到一台。
在这种特定配置下,机器数量从四台减少到一台意味着所需机器数量减少了 75%。该文章将这一减少换算为 75% 的成本节约。
报告将 DeepSeek 从四台机器减少到一台的部署归功于 FP4 优化。
这个结果不应被解读为每个 DeepSeek 部署都能普遍降低 75% 成本的保证。
实际节省取决于以下因素:
- 所选 DeepSeek 模型与量化方案
- 加速器类型和内存容量
- 服务器配置
- 上下文长度
- 批处理大小与并发量
- 延迟目标
- 精度要求
- 软件版本
- 电力与运营成本
开源的 Chitu 仓库也指出,性能结果可能因硬件、软件和测试负载而异。
八卦炉:隐藏基础设施复杂性
八卦炉是 Qingcheng.ai 用于模型训练、推理、部署、调度和运维的软件栈。
该公司将其作为将复杂的基础设施工作打包成更易于管理的企业级平台的方式。
八卦炉位于异构硬件之上,提供部署和运维工具。
八卦炉旨在减少以下方面所需的手动工作量:
- 集群资源管理
- 模型与应用部署
- 分布式训练
- 推理优化
- 性能评估
- 应用交付
- 监控与运维
Qingcheng.ai 还与浪潮信息合作,推出了联合优化的 元脑八卦炉一体机。在一项已公布的 Qwen3-32B 测试中,合作方报告称,经过 Chitu 优化后,总推理吞吐量提升了高达 14.45 倍,经过全栈调优后,端到端性能提升了约 10 倍。
这些数据来自合作公司自身的测试环境,与 WAIC 上描述的 DeepSeek FP4 案例并不等同。
异构集群优化
后端工厂层旨在管理多种类型的加速器。
原始报告中提到的一项策略是
是将 预填充 和 解码 工作负载进行分离。
在预填充阶段,系统会处理输入提示并构建模型的内部缓存。在解码阶段,系统则逐步生成输出令牌。这两个阶段在内存、带宽和计算特性上有所不同。
异构集群可以将每个阶段分配给最高效处理该阶段的硬件。这种做法有时被称为"预填充-解码分离"。
其目标并非让所有加速器表现一致,而是让不同硬件处理与其优势最匹配的工作负载部分。
商店:AI Ping 作为令牌路由枢纽
一旦令牌生成完毕,应用程序仍需要一种稳定的方式来获取它们。
中间层是 AI Ping,即清程智韵的模型服务评估与API路由平台。
AI Ping 持续监控模型服务,并在多家服务商之上提供统一接口。

AI Ping 评估模型API并在服务商之间路由请求。
原始报告指出,AI Ping 监控以下内容:
- 超过30家服务商
- 超过600个模型服务接口
- 延迟
- 吞吐量
- 可靠性
- 缓存命中率
- 令牌质量
- 定价与服务可用性
该平台旨在降低开发者创建账户、管理不同API格式以及手动对比各服务商的需求。
用户可优先设定目标,例如:
- 降低成本
- 加快响应速度
- 提高可靠性
- 改善输出质量
若未指定偏好,AI Ping 可利用其路由逻辑选择一个可用服务。
服务拥堵时的动态路由
静态集成会将每个请求发送到同一服务商,直到开发者更改配置。
动态路由则不同。如果某家服务商变慢或不可用,路由层可将后续请求定向到当前表现更优的其他服务。
这对智能体工作负载很有帮助,因为一次中断可能导致较长任务的失败。
该平台预期的反馈循环如下:
- AI Ping 持续测量服务质量。
- 路由决策使用最新测量数据。
- 真实用户流量提供额外性能数据。
- 新数据改进未来的评估与路由。
清程智韵表示,统一API使较小的团队也能访问通常需要内部平台团队才能实现的路由与监控能力。
该公司单独报告了通过AI Ping在成本、吞吐量和延迟方面的平均改进。这些百分比为平台公布的结果,根据所选模型、服务商、流量模式及路由策略的不同,实际效果会有所变化。
应用节点:智能体商店与ATM
最终层关注智能体如何...
其Token的分发方式及使用治理规则。
该系统由两大组件构成:
- Agent商店
- ATM(Agent Token管理器)
Agent商店
Agent商店被定位为通用型与行业专用型Agent的分发复用层。
其核心价值在于连接Agent开发者与需要可部署工作流的组织机构,同时使这些Agent能够接入更广泛的Token基础设施。
原始报告将其比作连接共享电网的电器市场。在本文档编制时,关于Agent商店定价策略、审核标准、部署格式及商业条款的公开文档仍十分有限。
ATM:Agent Token管理器
ATM全称为Agent Token管理器。
清程科技在2026世界人工智能大会上将其作为面向多Agent系统的本地化Token管理与治理工具推出。
该工具提供以下功能:
- API凭据统一管理
- Token用量追踪
- 成本分摊核算
- 消费额度控制
- 供应商切换与故障恢复
- 多Agent资源隔离
- 异常用量预警
- 本地化/隐私敏感型监控
原始文献指出,ATM可通过行为钩子、本地文件扫描及隐私网关等机制观察Agent活动。
在实际应用中,ATM类似于AI工作负载的"电表"。其目标是将Token计费与产生该消费的Agent、操作、模型及工具进行关联。
这与云成本管理(FinOps)理念高度相关——即云支出的度量与控制学科。在Agent系统中,挑战更为精细,因为单个业务流程可能包含多层嵌套的模型调用。
有效的Agent成本记录需包含:
- 发起用户或工作流
- 涉及的Agent与子Agent
- 所选模型
- 输入/输出Token数量
- 任务中调用的工具
- 供应商定价
- 重试与失败调用次数
- 总成本与耗时
清程科技将ATM定位为针对此类新型工作负载的Token导向型FinOps层。
清程科技为何强调中立性
原始文章指出,中立性是清程科技的核心优势之一。
大型云计算与硬件企业天然倾向于优先推广自有平台、合作伙伴或投资项目。因此,运营混合集群的组织更倾向于选择支持多种竞品加速器与服务供应商的独立软件提供商。
清程科技声称其平台不绑定单一芯片供应商。
这一理念体现在赤兔对多种硬件环境的支持能力,以及AI品多供应商路由模型上。
中立性仍需在实践中验证。客户应审视以下要素:
- 支持的硬件与软件版本
- 路由规则
- 商业合作伙伴关系
- 基准测试方法论
- 数据保留策略
- 供应商选择选项
- 故障切换与回退机制
该公司的技术背景构成其另一项定位优势。
清程科技成立于2023年12月,核心团队源自清华大学计算机系高性能计算研究所。
公司表示,该团队曾为超算中心和智算中心开展性能评估与优化工作。
将国产算力转化为可出口的Token服务
清程AI也将Token服务视为国内算力触达海外用户的一条可行路径。
其逻辑在于:开发者无需知道是哪个加速器生成了响应。开发者购买模型API,就能获得Token。
如果国产硬件能够稳定高效地支撑起具有竞争力的模型,那么其输出便可以通过统一的API进行销售,境外客户无需部署或了解底层的硬件架构。
清程AI将Token服务视为一种在全球范围内分销国内算力的方式。
原始报告指出,海外开发流量高峰期通常位于北京时间晚上10点至次日上午8点。
这就创造了一个潜在的利用率机会。那些在国内非高峰时段闲置的算力,可以用来服务其他时区的用户。
文章中描述的工作流程是:
- 国产加速器通过Chitu生成Token。
- 智评(AI Ping)衡量服务质量并调度请求。
- 合作伙伴将服务分发给海外开发者。
- 用户通过标准API使用模型。
这并未消除国际服务交付的常规要求。服务提供商仍需处理延迟、合规性、数据治理、模型许可、计费、技术支持以及区域可用性等问题。
为Agent经济铺平道路
在AI展览上,最显眼的产品往往是模型和应用。
基础设施得到的关注较少,因为其大部分工作发生在用户界面之下。它决定了模型能否稳定运行,Agent能否完成任务,以及最终成本是否清晰可理解。
清程AI的“前店后厂”概念串联起三个问题:
- Token如何高效生产?
- Token如何可靠路由?
- Token如何被Agent消费和管理?
“后厂”结合了硬件、Chitu和八卦炉。“前店”使用智评来评估和路由模型服务。应用节点则使用Agent Store和ATM来分发Agent并管理其Token用量。
电网的类比并非技术标准,但它为企业提供了一种理解全栈架构的实用视角。
该架构不将每个模型API、加速器集群和Agent视为孤立的产品,而是将其视为Token供应链中相互连接的组成部分。
常见问题
什么是清程AI的Token“前店后厂”架构?
这是一个覆盖Token生产、API路由和Agent应用的三层AI基础设施模型。“后厂”使用算力硬件、Chitu和八卦炉;中间层使用智评;应用层则包括Agent Store和ATM。
什么是Chitu推理引擎?
Chitu是一个开源的、面向生产环境的大模型推理框架。它支持多种国产及国际加速器平台、多种部署规模、低精度推理以及兼容OpenAI的HTTP服务接口。
接口。
赤兔是否将所有 DeepSeek 部署成本降低了 75%?
并未发布通用的 75% 降本承诺。该数据源于某个特定 FP4 部署场景——该配置下服务器需求从四台降至一台,即机器数量减少 75%。
赤兔能否通过 Docker 部署?
可以。赤兔官方仓库已提供适配昇腾、海光、MetaX 等多种硬件环境的 Dockerfile,并附有通用安装与部署文档。
AI Ping 有什么用途?
AI Ping 用于监控和对比模型 API 服务,并根据成本、速度、可靠性或质量等目标进行请求路由。它在多家服务商之上提供统一 API。
什么是 Agent Token Manager?
Agent Token Manager(简称 ATM)是清程 AI 为 Agent 系统设计的令牌治理工具,用于追踪使用量、分摊成本、管理凭证、设置限额、隔离工作负载,并在异常消耗时向团队发出告警。
八挂炉是推理引擎吗?
八挂炉是更广义的软件栈,而非仅限推理引擎。它涵盖训练、推理部署、调度、监控、应用交付及集群运维等领域,而赤兔负责核心模型推理层。
“成本降低 75%” 的结果是否经过独立验证?
该结果由清程 AI 及原始报告提供。独立复现所需的具体部署细节尚未完整公开,建议读者自行在自有模型、硬件及工作负载上测试。
相关工具
- 赤兔:面向大语言模型与异构硬件的开源生产级推理框架。
- AI Ping:清程 AI 运营的模型服务评估与智能 API 路由平台。
- 八挂炉:清程 AI 推出的模型训练、推理、部署及集群运维软件栈。
- vLLM:广泛使用的高吞吐大模型服务开源引擎。
- SGLang:面向语言模型与多模态模型的开源服务框架。
- DeepSeek:部署案例中讨论的 DeepSeek 模型系列官方平台。
- OpenAI API 规范:多数模型服务引擎用于应用兼容的 API 格式。
相关链接
- 清程 AI 官网:赤兔、八挂炉及 AI Ping 的官方产品与公司信息。
- 赤兔 GitHub 仓库:包含源代码、Dockerfile、支持的模型、版本发布、基准测试及部署文档。
- 赤兔产品页面:清程 AI 关于支持的硬件、模型、接口及性能声明的概述。
- 八挂炉产品页面:训练与基础设施相关官方信息。
软件栈。
- AI Ping:官方模型评估与统一API路由平台。
- 《科技日报》报道:独立报道,涵盖清程AI全链路Token解决方案及AI Ping指标。
- 浪潮元脑八股炉装置:发布联合优化的赤兔与八股炉企业级装置测试详情。
总结
在2026年世界人工智能大会上,清程AI展示了三层Token基础设施,旨在连接模型推理、API路由、智能体分发及成本治理。
后端工厂层采用赤兔与八股炉,优化异构计算硬件上的模型部署。据公司报告,在FP4 DeepSeek配置下,所需机器数量从四台降至一台,实现75%的成本缩减。
AI Ping构成中间路由层,而智能体商店与ATM覆盖智能体分发及Token财务运营。各产品共同致力于使Token供应更稳定、可量化,且不依赖单一硬件或API提供商。
核心理念简洁明了:AI智能体需要的不仅是模型——它们需要一个能够生成、路由、计量并控制所消耗每个Token的基础设施层。