Qingcheng.ai、WAIC 2026でトークンの「スーパーグリッド」を構築、DeepSeek展開コストを75%削減と発表
2026年の世界人工知能会議では、モデル企業がパラメータ数で展示ホールを埋め尽くし、インフラプロバイダーはますます大規模な計算クラスターを披露している。しかし、Qingcheng.aiのブースでは、注目を集めたのは単一のモデルやサーバーではなく、AIエージェントの全ライフサイクルにおいてトークンがどのように生産、ルーティング、配布、計量、管理されるかを示す完全な図表だった。Qingcheng.aiはこのモデルを**トークンの「フロントショップ・バックファクトリー」**と呼んでいる。このフレームワークは3層で構成される:1.

Qingcheng.ai、WAIC 2026でトークンの「スーパーグリッド」を構築、DeepSeek展開コストを75%削減と発表
はじめに
WAIC 2026の展示会場では、モデル企業がパラメータ数で会場を埋め尽くし、インフラプロバイダーはますます大規模化する計算クラスターを披露していた。しかし、青城智能のブースの主役は、特定のモデルやサーバーではなかった。
そこにあったのは、AI Agentの全ライフサイクルにおいて、Tokenがどのように生産・ルーティング・配分・計量・管理されるかを示す、一枚の完全な概略図である。
青城智能はこのモデルを Token「前店後工場」 と呼んでいる。このフレームワークは三つの層で構成される:
- バックエンドのToken生産層
- 中間のルーティング・サービス層
- Agentアプリケーション・管理層
同社はこのアーキテクチャを、人工知能時代の電力システムに例えている。計算ハードウェアと推論ソフトウェアは発電所、AI Pingは電力網、そしてAgentツールは電力を消費する機器の役割を果たす。
青城智能のブースでは、Tokenの生産、ルーティング、管理に関する完全なワークフローが展示されていた。
元のレポートによれば、このシステムは三つの繰り返し発生する問題、すなわちモデルAPIの不安定性、国産ヘテロジニアスアクセラレータの低利用率、および大規模Agent展開におけるToken計算の不透明さを解決することを目的としている。
大規模Agentアプリケーション前のTokenボトルネック
AI Agentがデモ段階から本番環境へと移行するにつれ、一人のユーザーリクエストが複数回のモデル呼び出しを引き起こす可能性がある。
Agentは、ファイルの検索、データベースの検索、ツールの呼び出し、コードの生成、結果の評価、計画の修正、そして別のAgentの呼び出しを行う必要があるかもしれない。ユーザーが見る応答は最終ステップに過ぎない。その背後では、システムが複数のサービスにまたがって大量のTokenを消費している可能性がある。
元の記事は、ワークフローが拡大するにつれて深刻化する三つの主要なインフラ問題を指摘している。
Token供給の不安定さ
モデルAPIの容量は、需要のピーク時に変動する可能性がある。
同じリクエストでも、ある時は素早く応答し、別の時には遅くなったり利用できなくなったりする。雑談のようなシナリオでは、短い遅延は許容されるかもしれないが、前のステップの応答にその後のすべての動作が依存する多段階Agentワークフローでは、この遅延がプロセスの中断を引き起こす可能性がある。
したがって、エンタープライズシステムが必要とするのは、単にモデルにアクセスすることだけではない。予測可能なレイテンシ、スループット、信頼性、出力品質が必要なのである。
国産アクセラレータの効率的活用の難しさ
多くの組織は、すでに混在する国産GPU、NPU、知能計算サーバーを調達している。ハードウェアは既に揃っているかもしれないが、その上に大規模モデルを効率的に展開することは依然として難しい。
vLLMなどの人気のある推論フレームワークは、もともとNVIDIAおよびCUDAエコシステム向けに最適化されていた。これらはますます多くのデバイスをサポートできるようになっているが、すべての機能と最適化を異なるアクセラレータアーキテクチャに適合させるには、依然として多大なエンジニアリング作業が必要である。
青城智能は、ネイティブな推論エンジンとハードウェア認識型のソフトウェアスタックが、これらのクラスターからより多くの利用可能なToken出力を引き出せると考えている。
Agent支出の追跡困難
企業が複数のAgentを運用する場合、月次のモデル請求書では、どのワークフローがコストを発生させたのかが必ずしも明らかにならない。
単一のAgentが複数のモデルを呼び出し、複数のベンダーを利用し、サブAgentを起動し、数時間にわたって稼働し続ける可能性がある。詳細な追跡がなければ、組織は基本的な質問に答えることが難しくなる可能性がある:
- どのAgentがTokenを消費したか?
- どのモデルとベンダーを呼び出したか?
- どのツールまたはステップが最大のコストを発生させたか?
- 特定のワークフローが想定予算を超えていないか?
- そのリクエストをより安価なサービスにルーティングできたか?
清程極智は、その三層構造を、生産、配信、アプリケーション、課金を接続する統合インフラアーキテクチャと位置づけている。

展示の青写真は、基盤計算からAgentアプリケーションに至るワークフローを描いている。
三層「前店後工場」アーキテクチャ
このアーキテクチャは、単純な産業アナロジーに基づいて構築されている。
後工場は、計算ハードウェアをTokenに変換する役割を担う。店舗はTokenサービスを集約しルーティングする。アプリケーションノードはAgentを配布し、Tokenの消費方法を制御する。
清程極智のアーキテクチャは、Tokenの生産、サービスルーティング、Agent管理を接続する。
これら三つの層は、孤立した製品としてではなく、連携して動作するように設計されている。
後工場:Token生産層
後工場は、物理的な計算リソースを標準化されたモデル推論能力に変換する役割を担う。
その主要な構成要素は以下の通りである:
- ハードウェアおよび計算パートナー
- 赤兎推論エンジン
- 八卦炉インテリジェントソフトウェアスタック
清程極智はこの層を発電所に例えている。その目標は、展開の複雑さを低減しつつ、利用可能なハードウェアから可能な限り多くの、安定した利用可能なTokenを生成することである。
赤兎:生産向け推論エンジン
赤兎は、清程極智がオープンソース化した高性能推論フレームワークである。
公式リポジトリは、これを生産向けで、効率性、柔軟性、可用性に重点を置いたエンジンと説明している。CPUおよび単一アクセラレータから大規模クラスターまでの展開をサポートし、複数の国産ハードウェアプラットフォーム向けに最適化されている。
このプロジェクトは、DeepSeek、Qwen、GLM、Kimiなどのモデル、および標準的なOpenAI互換HTTPインターフェースもサポートしている。

赤兎は、ヘテロジニアス計算プラットフォーム上での大規模モデル推論能力を向上させるために用いられる。
清程極智は、単一のハードウェアエコシステム向けに設計されたフレームワークを適合させることは、間違ったツールを使うことに似ている可能性があると考えている。同社の例えは、パンを焼くために設計されたオーブンを改造して…蒸しパンを蒸すことはできるが、専用の蒸し器の方が既存の熱をより効率的に利用できるかもしれない、というものである。
この比較は単純化されているが、その背後にあるエンジニアリング上の問題は現実のものである。アクセラレータアーキテクチャは、メモリ、通信、演算子、数値形式、コンパイル、スケジューリング動作などにおいて差異がある。
Chituは、ハードウェア固有の最適化と、FP4やFP8構成を含む低精度推論サポートを備えている。
DeepSeekコスト75%削減の主張
元のレポートによれば、FP4で展開されたDeepSeekモデルは、必要ハードウェアを4台から1台に削減した。
この特定の構成では、マシン台数が4台から1台に削減されたことは、必要なマシン台数が 75% 削減されたことを意味する。同記事はこの削減を75%のコスト削減と換算している。
レポートは、FP4最適化によりDeepSeekの展開に必要なマシン台数が4台から1台に削減されたとしている。
この結果は、すべてのDeepSeek展開において普遍的に75%のコスト削減が達成されることを保証するものと解釈されるべきではない。
実際の削減額は、以下の要因に依存する:
- 選択されたDeepSeekモデルと量子化方式
- アクセラレータの種類とメモリ容量
- サーバー構成
- コンテキスト長
- バッチサイズと同時実行数
- レイテンシ目標
- 精度要件
- ソフトウェアバージョン
- 電力および運用コスト
オープンソースのChituは
リポジトリも指摘しているように、パフォーマンスの結果はハードウェア、ソフトウェア、テスト負荷によって異なる可能性があります。
八卦炉:インフラストラクチャの複雑性を隠蔽
八卦炉は、Qingcheng.aiがモデルのトレーニング、推論、デプロイ、スケジューリング、運用保守に使用するソフトウェアスタックです。
同社はこれを、複雑なインフラストラクチャ作業をより管理しやすいエンタープライズグレードのプラットフォームにパッケージ化する方法として位置づけています。
八卦炉は異種ハードウェア上に位置し、デプロイおよび運用保守ツールを提供します。
八卦炉は、以下に必要な手作業を削減することを目的としています:
- クラスターリソース管理
- モデルとアプリケーションのデプロイ
- 分散トレーニング
- 推論最適化
- パフォーマンス評価
- アプリケーションデリバリー
- 監視と運用保守
Qingcheng.aiはまた、浪潮信息と協力し、共同最適化された メンブレインバ卦炉オールインワン を発表しました。公表された Qwen3-32B テストでは、協力パートナーは、Chituの最適化により総推論スループットが最大14.45倍向上し、フルスタックチューニングによりエンドツーエンドのパフォーマンスが約10倍向上したと報告しています。
これらのデータは協力企業自身のテスト環境からのものであり、WAICで説明されたDeepSeek FP4の事例とは同等ではありません。
異種クラスターの最適化
バックエンドファクトリー層は、複数のタイプのアクセラレーターを管理するように設計されています。
元のレポートで言及された戦略の一つは、
プリフィル と デコード のワークロードを分離することです。
プリフィル段階では、システムは入力プロンプトを処理し、モデルの内部キャッシュを構築します。デコード段階では、システムは出力トークンを徐々に生成します。これら二つの段階は、メモリ、帯域幅、計算特性において異なります。
異種クラスターは、各段階を最適に処理できるハードウェアに割り当てることができます。この手法は「プリフィル・デコード分離」と呼ばれることもあります。
その目標は、すべてのアクセラレーターを同じように動作させることではなく、それぞれのハードウェアに最適なワークロード部分を処理させることです。
ストア:トークンルーティングハブとしてのAI Ping
トークンが生成されると、アプリケーションはそれらを安定して取得する方法が必要になります。
中間層は AI Ping、すなわち清程智韵のモデルサービス評価とAPIルーティングプラットフォームです。
AI Pingはモデルサービスを継続的に監視し、複数のサービスプロバイダー上に統一インターフェースを提供します。

AI PingはモデルAPIを評価し、サービスプロバイダー間でリクエストをルーティングします。
元のレポートは、AI Pingが以下を監視すると述べています:
- 30以上のサービスプロバイダー
- 600以上のモデルサービスインターフェース
- レイテンシ
- スループット
- 信頼性
- キャッシュヒット率
- トークンの品質
- 価格設定とサービスの可用性
このプラットフォームは、開発者がアカウントを作成し、異なるAPI形式を管理し、各サービスプロバイダーを手動で比較する必要性を減らすことを目的としています。
ユーザーは以下のような目標を優先的に設定できます:
- コスト削減
- 応答速度の向上
- 信頼性の向上
- 出力品質の改善
好みが指定されていない場合、AI Pingはそのルーティングロジックを利用して利用可能なサービスを選択できます。
サービス混雑時の動的ルーティング
静的統合は、開発者が設定を変更するまで、すべてのリクエストを同じサービスプロバイダーに送信します。
動的ルーティングは異なります。特定のサービスプロバイダーが遅くなったり利用できなくなったりした場合、ルーティング層は後続のリクエストを現在より良いパフォーマンスを示している他のサービスプロバイダーに振り向けることができます。
これはエージェントワークロードに役立ちます。なぜなら、一度の中断が長いタスクの失敗につながる可能性があるからです。
このプラットフォームが想定するフィードバックループは次のとおりです:
- AI Pingがサービス品質を継続的に測定します。
- ルーティングの決定には最新の測定データが使用されます。
- 実際のユーザートラフィックが追加のパフォーマンスデータを提供します。
- 新しいデータが将来の評価とルーティングを改善します。
清程智韵は、統一APIにより、小規模なチームでも通常は内部プラットフォームチームが必要なルーティングと監視機能にアクセスできるようになると述べています。
同社は、AI Pingによるコスト、スループット、レイテンシの平均改善値を個別に報告しています。これらのパーセンテージはプラットフォームが公表した結果であり、選択されたモデル、サービスプロバイダー、トラフィックパターン、ルーティング戦略によって実際の効果は異なります。
アプリケーションノード:エージェントストアとATM
最終層は、エージェントがどのように...
そのトークンがどのように配布され、どのような使用ガバナンスルールが適用されるかに焦点を当てています。
このシステムは、2つの主要なコンポーネントで構成されています:
- Agentストア
- ATM(Agent Token Manager)
Agentストア
Agentストアは、汎用型および業界特化型エージェントの配布と再利用の層として位置づけられています。
その中核的価値は、エージェント開発者と、デプロイ可能なワークフローを必要とする組織を結びつけ、同時にこれらのエージェントがより広範なトークンインフラストラクチャにアクセスできるようにすることにあります。
元のレポートはこれを、共有電力網に接続する家電市場に例えています。本ドキュメント作成時点では、Agentストアの価格設定戦略、審査基準、デプロイ形式、ビジネス条件に関する公開情報は非常に限られています。
ATM:Agent Token Manager
ATM は Agent Token Manager の略です。
清程科技は2026年世界人工知能会議において、これをマルチエージェントシステム向けのローカライズされたトークン管理とガバナンスツールとして発表しました。
このツールは以下の機能を提供します:
- API認証情報の一元管理
- トークン使用量の追跡
- コスト配分計算
- 消費クォータ制御
- プロバイダー切り替えと障害復旧
- マルチエージェントリソースの分離
- 異常使用量の警告
- ローカライズ/プライバシー重視の監視
元の文献は、ATMが行動フック、ローカルファイルスキャン、プライバシーゲートウェイなどのメカニズムを通じてエージェントアクティビティを観察できると述べています。
実際の運用では、ATMはAIワークロードの「電力メーター」のようなものです。その目標は、トークンの課金を、その消費を発生させたエージェント、操作、モデル、ツールに関連付けることです。
これはクラウドコスト管理(FinOps)の概念と深く関連しています。すなわち、クラウド支出の測定と管理という分野です。エージェントシステムでは、単一のビジネスプロセスに複数層のネストされたモデル呼び出しが含まれる可能性があるため、課題はより細かくなります。
効果的なエージェントコスト記録には以下を含める必要があります:
- 開始したユーザーまたはワークフロー
- 関与したエージェントとサブエージェント
- 選択されたモデル
- 入力/出力トークン数
- タスク中に呼び出されたツール
- プロバイダー価格
- リトライと失敗した呼び出しの回数
- 総コストと所要時間
清程科技は、ATMをこのような新しいタイプのワークロード向けのトークン指向のFinOps層として位置づけています。
清程科技が中立性を強調する理由
元の記事は、中立性が清程科技の主要な強みの一つであると述べています。
大規模なクラウドコンピューティングおよびハードウェア企業は、当然ながら自社のプラットフォーム、パートナー、または投資プロジェクトを優先的に推進する傾向があります。したがって、ハイブリッドクラスターを運用する組織は、複数の競合するアクセラレーターやサービスプロバイダーをサポートする独立系ソフトウェアベンダーを好む傾向があります。
清程科技は、自社のプラットフォームが単一のチップベンダーに依存しないと主張しています。
この理念は、赤兔の多様なハードウェア環境へのサポート能力、およびAI Pingのマルチベンダールーティングモデルに表れています。
中立性は実際に検証される必要があります。顧客は以下の要素を精査すべきです:
- サポートされるハードウェアとソフトウェアのバージョン
- ルーティングルール
- ビジネスパートナーシップ
- ベンチマーク手法
- データ保持ポリシー
- プロバイダー選択オプション
- フェイルオーバーとフォールバックメカニズム
同社の技術的背景も、もう一つのポジショニング上の強みとなっています。
清程科技は2023年12月に設立され、中核チームは清華大学コンピュータ科学技術学部高性能計算研究所に由来しています。
同社は、このチームが以前にスーパーコンピューティングセンターとインテリジェントコンピューティングセンター向けにパフォーマンス評価と最適化作業を行ってきたと述べています。
国産計算力を輸出可能なトークンサービスへ転換
清程AIはまた、トークンサービスを国産計算力が海外ユーザーにリーチするための実行可能な経路の一つとみなしています。
その論理は次のとおりです:開発者はどのアクセラレーターが応答を生成したかを知る必要はありません。開発者はモデルAPIを購入し、トークンを取得します。
国産ハードウェアが競争力のあるモデルを安定かつ効率的に支えることができれば、その出力は統一されたAPIを通じて販売でき、海外の顧客は基盤となるハードウェアアーキテクチャをデプロイしたり理解したりする必要がなくなります。
清程AIは、トークンサービスを国内計算力をグローバルに流通させる方法の一つと見なしています。
元の報告書によると、海外の開発トラフィックのピーク時間帯は、通常、北京時間の午後10時から翌朝8時までである。
これは、利用機会の潜在的可能性を生み出している。国内の非ピーク時にアイドル状態にある計算能力を、他のタイムゾーンのユーザーにサービスを提供するために活用できる。
本記事で説明されているワークフローは以下の通りである。
- 国産アクセラレーターがChituを介してTokenを生成する。
- 智評(AI Ping)がサービス品質を測定し、リクエストをスケジューリングする。
- パートナーがサービスを海外の開発者に配布する。
- ユーザーは標準APIを介してモデルを使用する。
これにより、国際的なサービス提供に関する通常の要件がなくなるわけではない。サービスプロバイダーは、レイテンシ、コンプライアンス、データガバナンス、モデルライセンス、課金、テクニカルサポート、および地域ごとの可用性などに対処する必要がある。
Agent経済への道を切り開く
AI展示会では、最も目立つ製品は、しばしばモデルとアプリケーションである。
インフラストラクチャは、その作業の大部分がユーザーインターフェースの裏側で行われるため、注目されることは少ない。しかし、それはモデルが安定して動作するかどうか、Agentがタスクを完了できるかどうか、そして最終的なコストが明確で理解可能であるかどうかを決定づける。
清程AIの「前店後廠(フロントショップ・バックファクトリー)」コンセプトは、3つの問題を結びつける。
- Tokenをどのように効率的に生産するか?
- Tokenをどのように確実にルーティングするか?
- TokenをAgentがどのように消費し、管理するか?
「後廠(バックファクトリー)」は、ハードウェア、Chitu、八卦炉を統合する。「前店(フロントショップ)」は、智評(AI Ping)を使用してモデルサービスを評価しルーティングする。アプリケーションノードは、Agent StoreとATMを使用してAgentを配布し、そのToken使用量を管理する。
電力網のアナロジーは技術標準ではないが、企業がフルスタックアーキテクチャを理解するための実用的な視点を提供する。
このアーキテクチャは、各モデルAPI、アクセラレータークラスター、Agentを孤立した製品として捉えるのではなく、Tokenサプライチェーンにおける相互接続された構成要素として見なす。
よくある質問
清程AIのToken「前店後廠」アーキテクチャとは何ですか?
これは、Token生産、APIルーティング、およびAgentアプリケーションを網羅する3層のAIインフラストラクチャモデルです。「後廠」はコンピューティングハードウェア、Chitu、八卦炉を使用します。中間層は智評(AI Ping)を使用します。アプリケーション層はAgent StoreとATMを含みます。
Chitu推論エンジンとは何ですか?
Chituは、オープンソースの本番環境向け大規模モデル推論フレームワークです。複数の国産および国際的なアクセラレータープラットフォーム、様々なデプロイ規模、低精度推論、およびOpenAI互換のHTTPサービスインターフェースをサポートしています。
赤兔(Chitu)はすべてのDeepSeekデプロイコストを75%削減しますか?
75%のコスト削減を汎用的に約束するものではありません。この数字は、特定のFP4デプロイシナリオに基づいています。この構成では、必要なサーバー台数が4台から1台に削減され、マシン台数が75%減少します。
赤兔(Chitu)はDockerでデプロイできますか?
はい。赤兔の公式リポジトリには、昇騰、海光、MetaXなど、様々なハードウェア環境に対応したDockerfileが提供されており、一般的なインストールとデプロイのドキュメントも含まれています。
AI Pingの用途は何ですか?
AI Pingは、モデルAPIサービスを監視および比較し、コスト、速度、信頼性、品質などの目標に基づいてリクエストをルーティングするために使用されます。複数のサービスプロバイダー上で統一されたAPIを提供します。
Agent Token Managerとは何ですか?
Agent Token Manager(ATM)は、清程AIがAgentシステム向けに開発したトークンガバナンスツールです。使用量の追跡、コストの配分、認証情報の管理、制限の設定、ワークロードの分離、および異常な消費が発生した場合にチームへ警告を発するために使用されます。
八卦炉(Bagualu)は推論エンジンですか?
八卦炉は、推論エンジンのみを指すのではなく、より広範なソフトウェアスタックです。トレーニング、推論デプロイ、スケジューリング、モニタリング、アプリケーションデリバリー、クラスター運用保守などの分野をカバーしており、赤兔(Chitu)がコアモデル推論層を担当します。
「コスト75%削減」という結果は独立して検証されましたか?
この結果は、清程AIおよび元の報告書によって提供されました。独立した再現に必要な具体的なデプロイ詳細は、まだ完全には公開されていません。読者はご自身のモデル、ハードウェア、ワークロードでテストすることをお勧めします。
関連ツール
- 赤兔(Chitu):大規模言語モデルと異種ハードウェア向けのオープンソース本番環境推論フレームワーク。
- AI Ping:清程AIが運営するモデルサービス評価・スマートAPIルーティングプラットフォーム。
- 八卦炉(Bagualu):清程AIが提供するモデルトレーニング、推論、デプロイ、クラスター運用保守のためのソフトウェアスタック。
- vLLM:広く使用されている高スループット大規模モデルサービスのオープンソースエンジン。
- SGLang:言語モデルとマルチモーダルモデル向けのオープンソースサービングフレームワーク。
- DeepSeek:デプロイ事例で議論されているDeepSeekモデルシリーズの公式プラットフォーム。
- OpenAI API仕様:ほとんどのモデルサービングエンジンがアプリケーション互換性のために使用するAPI形式。
関連リンク
- 清程AI公式サイト:赤兔、八卦炉、AI Pingの公式製品および会社情報。
- 赤兔 GitHubリポジトリ:ソースコード、Dockerfile、サポートモデル、バージョンリリース、ベンチマーク、デプロイドキュメントを含む。
- 赤兔製品ページ:清程AIによるサポートハードウェア、モデル、インターフェース、パフォーマンス声明の概要。
- 八卦炉製品ページ:トレーニングとインフラ関連の公式情報。
- AI Ping:公式モデル評価と統一APIルーティングプラットフォーム。
- 科技日報の報道:清程AIのエンドツーエンドTokenソリューションとAI Ping指標をカバーする独立した報道。
- 浪潮元脳・八股炉装置:共同最適化された赤兔と八股炉(八卦炉)のエンタープライズ装置テスト詳細の発表。
まとめ
2026年世界人工知能大会において、清程AIは、モデル推論、APIルーティング、エージェント配布、およびコストガバナンスを接続することを目的とした3層のTokenインフラストラクチャを展示した。
後端工場層は、赤兔と八卦炉を採用し、異種コンピューティングハードウェア上でのモデルデプロイを最適化する。同社の報告によると、FP4のDeepSeek構成では、必要なマシン台数が4台から1台に削減され、75%のコスト削減を達成した。
AI Pingは中間ルーティング層を構成し、Agent StoreとATMはAgentの配布とTokenの財務運営をカバーする。各製品は連携して、Token供給をより安定させ、定量化可能にし、特定のハードウェアやAPIプロバイダーに依存しないようにすることを目指している。
核となる考え方は簡潔明瞭である:AIエージェントに必要なのはモデルだけではない。それらは、消費するすべてのTokenを生成、ルーティング、測定、制御できるインフラストラクチャ層を必要とするのである。