百度文心助手、PinchBench v2で首位に立った後、SuperCLUE XClawでもトップに
百度文心助手が、もう一つのエージェント型ベンチマークで首位を獲得しました。SuperCLUEの2026年8月のXClaw製品評価において、文心助手は総合スコア97を獲得しました。

Baidu Wenxin Assistant、SuperCLUE XClawで首位を獲得、PinchBench v2に続き
はじめに
百度文心助手が、もう一つのエージェント型ベンチマークで首位を獲得しました。
SuperCLUEの2026年8月XClaw製品評価において、文心助手は総合スコア97.62を記録し、公開されたスナップショットの中で最高得点となりました。
カテゴリー別のスコアは以下の通りです:
| 能力 | スコア |
|---|---|
| コーディング | 90.28 |
| コンテンツ作成 | 99.44 |
| データ処理 | 98.86 |
| リサーチ分析 | 96.44 |
| メモリー | 100.00 |
この結果は、前回の好成績から3週間も経たないうちに発表されました。
7月のPinchBench v2スナップショットでは、百度のタスクエージェント(Orion Mission Modeとして提出)が最高スコア94.6%、**平均スコア94.4%**を記録し、そのリーダーボードスナップショットのトップに立ちました。
この2つのベンチマークは性質が異なります。SuperCLUE XClawは中国語エージェント製品と5つの能力次元にわたる実用的な成果物に焦点を当てています。Kiloが開発したPinchBench v2は、実世界のコンピューターおよび自動化タスクを中心に構築されています。
この2つは、同じ変化を指し示しています:
エージェント評価は「モデルが正しく回答できるか」から「システムがタスクを完了し、使用可能な成果物を提供できるか」へと移行しています。
言語モデルは答えを知っていても、要件を忘れたり、誤ったツールを選択したり、ファイルを誤って処理したり、ワークフローを途中で停止したり、誤った成果物を返したりするため、エージェントとしては失敗することがあります。
そのため、今回の文心助手の結果は、生の言語モデル知能というよりも、タスク実行に関するものと言えます。

文心助手がSuperCLUE XClawで首位に
SuperCLUEはXClawを、「Claw」型AIアシスタントのための製品指向型評価と説明しています。
主に択一問題に依存するのではなく、このベンチマークは完了した成果物を重視します。
2026年8月のスナップショットでは、主要製品のランキングは以下の通りです:
| 順位 | 製品 | スコア |
|---|---|---|
| 1 | 百度文心助手 | 97.62 |
| 2 | MiMoClaw | 96.74 |
| 3 | WorkBuddy | 96.61 |
| 4 | KimiClaw | 96.01 |
| 5 | MaxClaw | 94.79 |
このベンチマークは5つの次元を評価します:
- データ処理。
- コンテンツ作成。
- メモリー。
- コーディング。
- リサーチ分析。
基本ロジックはシンプルです:エージェントはタスクを受け取り、実際に評価可能な最終成果物または結果を生成しなければなりません。
そのため、指示追従、ファイル処理、ツール使用、長期的実行がスコアの一部となります。

これはチャットとエージェントワークの違いを示しています。
チャットモデルは会話内でプランを書くかもしれません。
エージェントワークフローはこれを行うことができます:
ソースファイルを読み込む
→ 構造化情報を抽出
→ コンテンツを起草
→ Word文書をフォーマット
→ 出力を検証
→ ファイルを返す
散文的な応答ではなく、成果物自体が最終製品となります。
コンテンツ作成で99.44点
文心はコンテンツ作成で99.44点を獲得しました。
エージェントベンチマークにおいて、コンテンツ作成は単なる創造的な文章作成ではありません。
システムは複数の制約を同時に満たす必要がある場合があります:
- 必要な形式
- トーン
- 長さ
- セクション構成
- 対象読者
- ファイルタイプ
- 事実に基づく裏付け
- 視覚的表現
草稿は文法的に正しくても、以下の理由で不合格になることがあります:
要求された形式を無視している。
だからこそ、製品ベンチマークは言語品質だけではなく、完了度をますます重視するようになっている。
コーディングスコア 90.28
文心のXClawカテゴリで最も低かったのはコーディングで、90.28だった。
それでも高いスコアだが、コンテンツ作成やデータ処理との差は示唆に富む。
コーディングエージェントは、より広い運用ループを管理する必要がある:
要件を理解する
→ スタックを選定する
→ ファイルを書く
→ 実行またはプレビューする
→ エラーを確認する
→ 修正する
→ インタラクションを検証する
→ 結果をパッケージ化する
ソース出版社は、3D太陽系シミュレーターを一文のリクエストで製品をテストした。
報告されたワークフローはThree.jsを使用し、31KBの単一ファイルHTMLアプリケーションを返した。
記事はまた、同様のインタラクティブWebワークフローを通じて生成された天気シミュレーションの教育ページも示している。
これらは、公式のXClawベンチマーク項目ではなく、実例としてのデモである。

リサーチ分析スコア 96.44
文心はリサーチ分析で96.44を獲得した。
本格的なリサーチタスクには以下のものが含まれる場合がある:
- 質問を理解する。
- それをサブクエスチョンに分解する。
- 複数のソースを検索する。
- ソースの質を評価する。
- 矛盾する主張を比較する。
- 日付を確認する。
- 数値を抽出する。
- 構造化された議論を構築する。
- 引用を追加する。
- レポートを作成する。
ソース記事では、2つのテストケースが説明されている。
三次元掛谷問題のリサーチ
出版社は文心に、フィールズ賞受賞者であるホン・ワンの文脈で三次元掛谷予想をリサーチするよう依頼した。
報告されたエージェントの動作は以下の通り:
- 6ステップのリサーチプロセスを計画する。
- 複数のサブエージェントを並行して起動する。
- 16の学術ソースを検索する。
- Markdownドキュメントを生成する。
- 62KBのインタラクティブHTML結果を生成する。

ソースの数自体は品質指標ではない。
重要なのは、最終的なエージェントが権威あるソースを使用し、主張を正確に帰属させ、矛盾を解決し、時代遅れのデータを避け、事実と解釈を分離するかどうかである。
最近のAIモデルと価格の比較
出版社はまた、前月の主要な国内外モデルの能力と価格を分析するよう文心に依頼した。
記事によると、エージェントは以下のことを行った:
- 業界調査スキルを読み込んだ。
- 2ラウンドにわたって45のソースを検索した。
- いくつかの主要な数値の不確実性を検出した。
- 29のソースにわたって別のターゲット検索を実行した。
- 価格を相互検証した。
- チャート付きで約7,000字の中国語レポートを生成した。

有用なリサーチループは以下の通りです:
検索
→ 不確実性を特定
→ 再度検索
→ 情報源を比較
→ 相違を解決または明示
→ 執筆
この追加の検証工程こそが、リサーチの質を高めることが多いのです。
2度目の首位獲得:PinchBench v2
SuperCLUEの結果に先立ち、7月にはPinchBench v2でも首位を獲得しました。
PinchBenchはKilo社が、従来の質疑応答型ベンチマークではなく、実世界のワークフローにおけるエージェントを評価するために開発したものです。
Kilo社のPinchBench 2.0リリースでは、ベンチマークが148タスクに拡張され、より厳格な採点基準とリーダーボードルールが追加されました。
ソース記事が掲載する7月のリーダーボードのスナップショットでは、百度のシステムは以下のように表示されています:
Orion-Mission-Mode
そのスコアは:
ベストスコア: 94.6%
平均スコア: 94.4%

このスクリーンショットでは、その特定のスナップショットにおいて、Orion Mission Modeが、Anthropic、Alibaba、NVIDIA、Xiaomi、xAI、OpenAIなどのモデルを基盤とするシステムを上回っていることが示されています。
重要なキーワードはスナップショットです。
エージェントのリーダーボードは急速に変化します。
モデル、ハーネス、プロンプト、ツールポリシー、ベンチマーク提出内容はすべて更新され得ます。
したがって、7月の首位獲得結果は、恒久的な世界的ランキングとしてではなく、日付を添えて引用されるべきものです。
PinchBench v2が実際にテストするもの
Kilo社はPinchBench 2.0を、実世界のエージェントワークフローのベンチマークと説明しています。
これには、システムが単に回答を選択するのではなく、ツールを使用して操作を完了することが求められるタスクが含まれています。
ベンチマークは以下のカテゴリをカバーしています:
- ライティング
- クリエイティブ業務
- データ分析
- リサーチおよび知識業務
- コードおよび運用
- その他のコンピュータベースのワークフロー
ソース記事によると、リーダーボードのスナップショットには59のモデルまたはエージェントのエントリが登録されていました。
この数は、提出物が追加または更新されるにつれて変化する可能性があります。
ベンチマーク自体は、リーダーボードの参加者よりも安定しています。
PinchBench 2.0の公式リリースでは、以下のように説明されています:
148タスク
ソースおよびいくつかの7月のレポートでは、文心の評価が147の完了タスクにわたって実施されたと説明する一方、PinchBenchを148タスクのベンチマークと説明しています。
最も安全な解釈は以下の通りです:
PinchBench v2には148のタスクが含まれています。報告されたOrion Mission Modeの評価では、そのスナップショットにおいて147のタスクでスコア結果が得られた可能性があります。
この区別が重要なのは、ベンチマークの報告では、ベンチマークの規模と成功した評価数が混同されることが多いためです。
完了した実行。
ベストスコア vs. 平均スコア
このソースは、Orion Mission Modeが以下を記録したことを強調しています:
ベストスコア 94.6%
平均スコア 94.4%
その0.2ポイントの差は小さいものです。
これは、報告された実行間のばらつきが小さいことを示唆しています。
しかし、これは普遍的な安定性の保証として解釈されるべきではありません。
ベンチマークのばらつきは、以下の要因に依存する可能性があります:
- 繰り返しの回数。
- サンプリング温度。
- ツールの利用可能性。
- 外部ウェブサイト。
- ネットワーク状況。
- グレーダーの挙動。
- エージェントのタイムアウト。
- モデルの更新。
実践的な教訓は単純で、報告されたPinchBenchの実行は、単発の幸運な結果に基づいて構築されたものではないということです。
その平均はベストスコアに近い値を維持していました。
エージェントは基盤モデル以上のものである
ソース記事で最も重要な点の一つは、ベンチマークが裸の言語モデルではなく、製品またはエージェントシステムを評価しているということです。
タスクエージェントは以下を組み合わせることができます:
- 基盤モデル。
- 検索。
- メモリ。
- ファイル処理。
- ツール選択。
- プランニング。
- サブエージェント。
- 文書生成スキル。
- ブラウザまたはウェブアクセス。
- コード実行。
- 検証。
これは次のように表現できます:
エージェントの結果
=
モデルの能力
+
ツール
+
メモリ
+
プランニング
+
検索
+
実行環境
+
検証
このため、「モデルXがモデルYに勝った」と言うときには注意が必要です。
リーダーボードは実際には、異なるツールとオーケストレーションを使用した2つの異なるエージェントスタックを比較している可能性があります。
より正確な表現は次のとおりです:
「エージェントシステムXは、このベンチマーク構成においてエージェントシステムYよりも高いスコアを獲得しました。」
この言い回しは、AI製品が複雑なソフトウェアシステムへと進化するにつれて、ますます重要になっています。
質問に答えることから仕事を完了することへ
ソース記事は、有用なAI製品の基準が変わる年として2026年を位置づけています。
従来のインタラクションは次のようなものでした:
ユーザーが質問する
→ モデルが答える
→ ユーザーが作業を行う
新しいエージェントパターンは次のようなものです:
ユーザーが目標を与える
→ エージェントが計画する
→ エージェントが文脈を収集する
→ エージェントがツールを呼び出す
→ エージェントがファイルを作成する
→ エージェントが結果を確認する
→ エージェントが成果物を納品する
これにより、ユーザーが気づく点が変わります。
モデルは非常に博識であっても、以下のことができないと苛立たしいものになります:
- 以前の要件を覚えていること。
- ファイルを開くこと。
- スプレッドシートを整形すること。
- 要求された文書を作成すること。
- すべての手順を完了すること。
- 自身のミスを修正すること。
新しい成功条件は、次のようなものに近くなります:
タスクは実際に完了したか?
というよりも:
回答は印象的だったか?
文心のタスクエントリポイント
BAAIの記事では、文心インターフェース内に直接「タスク」オプションが表示されています。

百度の公式文心ウェブサイトでは、この製品を以下のためのマルチモーダルAIアシスタントとして説明しています:
- 信頼できる作成。
- ディープ検索。
- インテリジェントなツール使用。
- 文書作業。
- ライティング。
- 画像。
端末間での利用。
百度アプリではまた、文心一言(Wenxin Assistant)を、深層リサーチ、検索、文章作成、画像生成、動画生成、対話支援のための統合AI機能としてリストアップしています。
これは、タスク指向型AIが、もはや開発者限定の実験ではなく、百度の主流の消費者向けインターフェースに進出したことを裏付けています。
文心一言は本当に無料かつ無制限なのか?
元の記事では、一つの商業的ポイントが繰り返し強調されています:
文心一言は無料であり、ペイウォールはない。
百度の公式文心一言ページは現在、無料アクセスまたは無料体験を提供しています。
これは簡単に確認できます。
より強い主張、つまりすべてのタスクエージェント機能に対して恒久的に無制限という点は、安定した公式ポリシーページから確認するのは困難です。
AI製品には以下のようなものが導入される可能性があります:
- 日次クォータ。
- 同時実行制限。
- 機能固有の制限。
- 一時的なプロモーション。
- アカウントの階層。
- 地域による制限。
- 将来の価格変更。
公開用には、より安全な表現は次のとおりです:
文心一言は現在、個人ユーザー向けに無料アクセスオプションを提供しており、元の記事で示されたタスク体験は有料サブスクリプションを必要としませんでした。
百度がそれを保証する特定のポリシーを公開しない限り、「永久に無制限」という表現に基づいて長期的なコスト比較を構築しないでください。
検索体験がエージェントに役立つ理由
元の記事の最後のセクションでは、百度の検索履歴がエージェント設計において構造的優位性を与えると論じています。
実際に類似点があります。
検索エンジンは次のようなものを処理します:
ユーザークエリ
→ 意図理解
→ クエリ分解
→ 検索
→ ランキング
→ 結果の統合
→ 応答
エージェントは以下のものを処理します:
ユーザーの目標
→ 意図理解
→ タスク分解
→ ツール選択
→ 実行
→ 結果の統合
→ 提供
2つのパイプラインは同一ではありません。
エージェントははるかに大きなアクション空間を持ち、より高い実行リスクを伴います。
しかし、いくつかの技術的能力は自然に移行します:
- 意図理解。
- クエリ書き換え。
- 検索。
- ソースのランキング。
- セッションコンテキスト。
- 鮮度の管理。
- 重複排除。
- 証拠の統合。
これは特にリサーチエージェントに関連します。
強力な検索インフラをすでに持つシステムは、その上に、より深いワークフローを構築できます。
検索クエリ理解とエージェントのタスク理解
従来の検索リクエストを考えてみましょう:
北京から上海への最も安い航空券を見つける。
検索システムは以下を推測する必要があるかもしれません:
- 出発地。
- 目的地。
- 旅行日。
- 価格の好み。
- 利用可能な航空券の在庫。
- 並べ替え順。
エージェントが次のように求められた場合:
北京―上海間の最も安い航空券を見つけて旅程を準備する。
追加で必要になるかもしれません:
- ツール選択。
- 複数回の検索。
- 比較。
- 制約チェック。
- ファイル生成。
- 場合によってはカレンダーや予約のステップ。
問題の前半は検索に似ています。
後半はアクションのオーケストレーションです。
検索体験は有用なコンポーネントを提供しますが、エージェントの品質は依然として実行レイヤーに依存します。
メモリと検索セッションは関連しているが、同じではない
元の記事はまた、文心一言のメモリスコアを、検索セッション理解における百度の経験と結び付けています。
そこには
いくつかの概念的な重複がある。
両システムは、以前のやり取りからのどの情報が引き続き関連するかを推論する必要がある。
検索セッションには、次のものが含まれる場合がある:
クエリ1:電気自動車
クエリ2:航続距離600km以上
クエリ3:25万元以下
システムは、3番目のクエリが依然として電気自動車に関するものであることを理解する必要がある。
エージェントメモリシステムは、より困難な仕事を抱えている。
以下のことを記憶する必要があるかもしれない:
- ユーザーの好み。
- タスクの制約。
- ファイルから得られた事実。
- 意思決定。
- ツールの出力。
- 一時的な状態。
- 長期的な好み。
検索セッションの専門知識は有用であるが、持続的なエージェントメモリには、追加の保存、検索、プライバシー、および関連性のメカニズムが必要である。
リサーチ分析こそ、Baiduの検索スタックが最も直接的に適用できる分野である
XClawの5つのカテゴリのうち、リサーチ分析は、Baiduの検索バックグラウンドが直接的に移転できる最も明確な分野である。
リサーチエージェントには、以下が必要である:
- 検索カバレッジ。
- 最新情報。
- クエリ拡張。
- ランキング。
- 引用処理。
- ソース比較。
- エンティティ理解。
- 多言語検索。
Baiduの公式Qianfan AI Assistantドキュメントも、Baidu検索、Baidu百科、画像検索、会話管理、メモリ管理、およびドキュメント機能を統合したエンタープライズエージェントソリューションを説明している。
これは、消費者向け文心製品が正確に同じ実装を使用していることを証明するものではない。
しかし、Baiduが検索、メモリ、ツール、およびマルチモーダル検索を中心とした共通のエージェントスタックを、製品ポートフォリオ全体にわたって構築していることを示している。
2つのベンチマーク勝利が証明しないこと
高いベンチマークスコアは有用な証拠である。
しかし、それらは評価全体ではない。
恒久的なグローバルリーダーシップを証明しない
リーダーボードは変化する。
新しいモデルや新しいエージェントの提出が、現在のリーダーを追い越す可能性がある。
すべてのタスクが97%を獲得することを証明しない
XClawは選択されたタスクとカテゴリを集約している。
ユーザーの実際のワークフローは大きく異なる可能性がある。
基盤モデルを切り離して評価しない
スコアは、完全なアシスタントまたはエージェントスタックに属する。
すべての安全問題を測定しない
タスクを効率的に完了できるエージェントでも、異なる環境では安全でないツール呼び出しを行ったり、機密情報を漏洩したりする可能性がある。
事実の正確性を保証しない
リサーチエージェントは、信頼性の低いソースを引用したり、変化するデータを誤って解釈したりする可能性がある。
無制限の無料利用を証明しない
製品の価格設定とクォータは商業ポリシーであり、ベンチマークの特性ではない。
文心アシスタントを自分で評価する方法
有用な個人テストは、実際の仕事に似ているべきである。
雑学クイズだけを尋ねてはいけない。
エージェントに完全なタスクを与えること。
テスト1:メモリ
長い会話の開始時に5つの制約を提供する。
いくつかの無関係なやり取りの後、最終成果物を要求し、5つすべてが保持されているか確認する。
テスト2:データ処理
以下をアップロードする:
- スプレッドシート。
- PDF。
- 短いテキストファイル。
エージェントにそれらを1つのレポートに統合するよう依頼する。
すべての数値を独立して検証する。
テスト3:リサーチ
変化する情報を含むトピックを選択する。
以下を要求する:
- 一次ソース。
- 公開日。
- 競合ソースの比較。
- 直接リンク。
- 不確実な主張のリスト。
テスト4:ドキュメント
作成
Word、PowerPoint、スプレッドシート、またはHTMLアーティファクトを依頼してください。
判定基準:
- 構造。
- 書式設定。
- 完全性。
- ダウンロード可能性。
- ファイルが実際に開けるかどうか。
テスト5: コーディング
小さなインタラクティブアプリケーションを依頼してください。
確認項目:
- 実行できるか。
- 要求された機能がすべて存在するか。
- エラーが修正されているか。
- 要求された場合、最終ファイルが自己完結型であるか。
テスト6: 長期間実行
複数のツールを必要とするタスクを与えてください。
システムが次のことを行うかを確認してください:
- 計画を立てる。
- 合理的なツールを選択する。
- 失敗から回復する。
- 作業の重複を避ける。
- 最終結果を検証する。
エージェント製品を比較するより良い方法
文心を他のエージェントと比較する際は、「ベンチマークスコア」よりも広い表を使用してください。
| 側面 | 測定内容 |
|---|---|
| タスク成功率 | 要求された作業が完了したか。 |
| 記憶力 | 以前の制約が保持されていたか。 |
| 正確性 | 数値と主張が正しいか。 |
| リサーチ品質 | 情報源が権威的かつ最新か。 |
| ツール信頼性 | ツール呼び出しが一貫して成功するか。 |
| アーティファクト品質 | ファイルが手動修正なしで使用可能か。 |
| 回復力 | エージェントが失敗したステップを修正できるか。 |
| レイテンシー | 完全なタスクにどれだけの時間がかかるか。 |
| コスト | 受理された結果1件のコストはいくらか。 |
| プライバシー | アップロードされたファイルと記憶はどのように扱われるか。 |
| 可用性 | 主要機能が無料か、割り当て制限付きか、有料か。 |
これにより、単一のリーダーボード順位よりも現実的な全体像が得られます。
より大きな変化:「成果を出せるか?」
元記事の最も強い論点は百度よりも広いものです。
エージェント競争はAI品質の定義を変えつつあります。
第一世代のチャットボットでは、ユーザーは回答品質に焦点を当てていました。
現在のタスクエージェントでは、重要な問いは次のようになっています:
- 文脈を保持できるか。
- 正しい情報を見つけられるか。
- ツールを操作できるか。
- ファイルを作成できるか。
- 複数ステップのワークフローを完了できるか。
- 自身の結果を検証できるか。
- 繰り返しの作業を任せられるか。
だからこそ、XClawやPinchBenchなどのベンチマークが注目を集めています。
これらは評価を本番作業に近づけます。
ベンチマークとエンタープライズ展開の間にはまだ長い距離があります。
しかし、方向性は有用です:
知識ベンチマーク
→ 推論ベンチマーク
→ ツール使用ベンチマーク
→ エンドツーエンドタスクベンチマーク
→ 実際の本番成果
最終ステップこそが結局最も重要です。
よくある質問
百度文心一言アシスタントはSuperCLUE XClawで何点を獲得しましたか?
2026年8月のSuperCLUE XClawスナップショットでは、文心一言アシスタントの総合スコアは97.62で、表示された製品の中で1位でした。カテゴリ別スコアは、コーディング90.28、コンテンツ作成99.44、データ処理98.86、リサーチ分析96.44、記憶100でした。
記憶スコア100とはどういう意味ですか?
そのXClaw評価に含まれる記憶タスクで文心が満点を獲得したことを意味します。実際のあらゆる会話で文脈を決して忘れないという意味ではありません。
PinchBench v2とは何ですか?
PinchBench v2はKiloが作成したエージェントベンチマークで、実世界のコンピューターおよびワークフロータスクでシステムを評価します。バージョン2.0には148のタスクが含まれており、測定することを目的としています。
単純な質問応答ではなく、エンドツーエンドでの実行が重視されています。
文心のPinchBench v2スコアは?
2026年7月のリーダーボードスナップショットでは、百度のタスクエージェントは Orion Mission Mode として表示され、最高スコア94.6%、平均スコア94.4%を記録しました。リーダーボードは時間とともに変動するため、結果を引用する際にはスナップショットの日付を含める必要があります。
文心一言アシスタントは完全に無料ですか?
百度公式の文心ページでは現在、無料アクセスまたは無料体験オプションが提供されており、元の記事では、実演されたタスク機能は有料サブスクリプションなしで利用可能だったと記載されています。すべての機能の永久的な無制限利用に関する安定した公式保証は確認されなかったため、現在のクォータは製品内で直接確認する必要があります。
文心一言アシスタントはWord文書やWebページを生成できますか?
元の記事では、文心がフォーマット済みのWordビジネスプランやインタラクティブなHTMLページを生成したテストセッションが示されています。これらの例は製品のタスクワークフローを示すものですが、すべてのプロンプトや環境で同じ結果が得られることを保証するものではありません。
百度の検索技術がAIエージェントに役立つ可能性があるのはなぜですか?
検索とエージェントは、意図理解、クエリ分解、検索、ランキング、ソース集約、セッションコンテキストなどの機能を共有しています。エージェントはさらに、ツール呼び出し、ファイル作成、メモリ、プランニング、アクションなど、より広範な実行レイヤーを追加します。
XClawとPinchBenchはモデルベンチマークですか?
厳密な意味ではそうではありません。これらは、モデルとツール、メモリ、検索、プロンプト、オーケストレーション、実行環境を組み合わせた製品またはエージェントシステムを評価します。したがって、それらのスコアは完全なエージェント構成に帰属させるべきです。
関連ツール
- Baidu Wenxin: 検索、作成、ドキュメント、タスク指向の作業のための百度公式マルチモーダルAIアシスタント。
- SuperCLUE XClaw: 元の記事で引用されている製品指向の中国語エージェントベンチマーク。
- PinchBench: コーディングおよびコンピューター使用エージェントワークフロー向けのKiloの実世界ベンチマーク。
- Pandoc: 元のテストワークフローでドキュメントコンテンツの抽出・変換に使用されたドキュメント変換ツール。
- Three.js: 元の記事で生成された太陽系の例で使用されたJavaScript 3Dグラフィックスライブラリ。
- Baidu Qianfan: モデル、エージェント、データ、AIアプリケーション開発のための百度エンタープライズプラットフォーム。
- Baidu AgentBuilder: カスタム文心ベースのエージェントを構築・公開するための百度プラットフォーム。
関連リンク
- Baidu Wenxin公式サイト: Webおよびダウンロード可能なクライアントにおける文心一言アシスタントの現在の公式製品エントリーポイント。
- Baidu Wenxinデスクトップアシスタント: ドキュメント分析、検索、作成、エクスポート、無料体験を紹介する公式デスクトップページ。
- [SuperCLUE XClaw 2026年8月
Evaluation](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): 元記事が参照しているベンチマークページ。
- Kilo: PinchBench 2.0 Is Here: PinchBench v2の148タスク、スコアリング変更、並行審査、リーダーボード設計に関する公式解説。
- Baidu Qianfan AI Assistant Documentation: 百度の検索連携型エンタープライズAIアシスタント、メモリ、会話、ファイルサービスについて記述した公式ドキュメント。
- Baidu App Official Download Page: 百度アプリの公式紹介ページで、統合された文心アシスタントとディープリサーチ機能を説明。
- Baidu Wenxin AgentBuilder Documentation: 百度の文心エコシステム上でエージェントを構築するための公式ドキュメント。
まとめ
百度文心アシスタントは、SuperCLUEの2026年8月XClawスナップショットで97.62点を獲得し1位となった。メモリは満点の100点、データ処理、コンテンツ作成、リサーチ分析はすべて96点以上を記録した。
この結果は、7月のPinchBench v2リーダーボードスナップショットで、百度のオリオンミッションモードが**最高スコア94.6%、平均スコア94.4%**を記録したことに続くものだ。両ベンチマークは異なるタスクを使用しているが、いずれも単純な質問応答ではなく、実際のタスク完了を重視している。
最も重要な教訓は、あるアシスタントがエージェント競争で恒久的に「勝利」したということではない。エージェントのランキングは急速に変動し、評価対象のシステムにはモデル、ツール、検索、メモリ、プロンプト、オーケストレーションが含まれている。
2つの結果が示しているのは、AI評価がより実用的な基準へと移行していることだ。つまり、モデルが賢く聞こえるかどうかではなく、エージェントが作業を完了し、利用可能な結果を返せるかどうかである。