百度文心助手、PinchBench v2で首位に立った後、SuperCLUE XClawでもトップに

百度文心助手が、もう一つのエージェント型ベンチマークで首位を獲得しました。SuperCLUEの2026年8月のXClaw製品評価において、文心助手は総合スコア97を獲得しました。

发布于 2026年8月7日generalGEO 评分: 010 次阅读
百度文心助手、PinchBench v2で首位に立った後、SuperCLUE XClawでもトップに

Baidu Wenxin Assistant、SuperCLUE XClawで首位を獲得、PinchBench v2に続き

はじめに

百度文心助手が、もう一つのエージェント型ベンチマークで首位を獲得しました。

SuperCLUEの2026年8月XClaw製品評価において、文心助手は総合スコア97.62を記録し、公開されたスナップショットの中で最高得点となりました。

カテゴリー別のスコアは以下の通りです:

能力 スコア
コーディング 90.28
コンテンツ作成 99.44
データ処理 98.86
リサーチ分析 96.44
メモリー 100.00

この結果は、前回の好成績から3週間も経たないうちに発表されました。

7月のPinchBench v2スナップショットでは、百度のタスクエージェント(Orion Mission Modeとして提出)が最高スコア94.6%、**平均スコア94.4%**を記録し、そのリーダーボードスナップショットのトップに立ちました。

この2つのベンチマークは性質が異なります。SuperCLUE XClawは中国語エージェント製品と5つの能力次元にわたる実用的な成果物に焦点を当てています。Kiloが開発したPinchBench v2は、実世界のコンピューターおよび自動化タスクを中心に構築されています。

この2つは、同じ変化を指し示しています:

エージェント評価は「モデルが正しく回答できるか」から「システムがタスクを完了し、使用可能な成果物を提供できるか」へと移行しています。

言語モデルは答えを知っていても、要件を忘れたり、誤ったツールを選択したり、ファイルを誤って処理したり、ワークフローを途中で停止したり、誤った成果物を返したりするため、エージェントとしては失敗することがあります。

そのため、今回の文心助手の結果は、生の言語モデル知能というよりも、タスク実行に関するものと言えます。

この画像は、SuperCLUE-XClaw製品評価の2026年8月平均スコアランキングを示しており、評価に参加した各社製品の順位と対応するスコアを明確に表示しています。百度文心助手が97.62点で第1位、小米MiMoClawが96.74点で第2位、腾讯workbuddyと月之暗面kimiclawがそれぞれ96.61点と96.01点で第2位、稀宇科技maxclawが94.79点で第3位となっています。ページにはランキングの集計基準やデータバッチなどの情報が記載されており、各製品の中国語スマート製品評価における能力を直感的に示し、文書内で言及されている文心助手がSuperCLUE XClaw評価で最高スコアを獲得した内容と対応しています。

文心助手がSuperCLUE XClawで首位に

SuperCLUEはXClawを、「Claw」型AIアシスタントのための製品指向型評価と説明しています。

主に択一問題に依存するのではなく、このベンチマークは完了した成果物を重視します。

2026年8月のスナップショットでは、主要製品のランキングは以下の通りです:

順位 製品 スコア
1 百度文心助手 97.62
2 MiMoClaw 96.74
3 WorkBuddy 96.61
4 KimiClaw 96.01
5 MaxClaw 94.79

このベンチマークは5つの次元を評価します:

  1. データ処理。
  2. コンテンツ作成。
  3. メモリー。
  4. コーディング。
  5. リサーチ分析。

基本ロジックはシンプルです:エージェントはタスクを受け取り、実際に評価可能な最終成果物または結果を生成しなければなりません。

そのため、指示追従、ファイル処理、ツール使用、長期的実行がスコアの一部となります。

![画像は、Baidu Wenxin AssistantのSuperCLUE XClaw能力次元(平均スコア)における順位を示しています。コード開発、コンテンツ作成、データ処理、リサーチ分析、メモリー能力の5つの次元で、それぞれ90.28、99.44、98.86、96.44、100.00のスコアを獲得しています。この画像は、前述のSuperCLUE XClawが「Claw」型AIアシスタントの製品指向型評価であることと呼応し、Baidu Wenxin Assistantの当該評価体系における成績を直感的に示し、SuperCLUE XClawでの第1位獲得のデータ的裏付けとなっています。](https://we0-cms.oss-cn-beijing.aliyuncs.

メモリが100を達成

最も目を引くカテゴリースコアは、メモリ100.00点です。

メモリが重要なのは、実際の作業が単一の独立したプロンプトに収まることはほとんどないからです。

ユーザーは会話の早い段階で制約条件を提示し、エージェントがかなり後になってからそれを尊重することを期待する場合があります。

例えば:

ターン1:
2026年Q2のデータのみを使用してください。

ターン3:
レポートは10ページ以内に収めてください。

ターン6:
スプレッドシートと同じ製品セグメンテーションを使用してください。

ターン10:
最終的なWord文書を生成してください。

最初の指示を忘れてしまうエージェントは、見た目は洗練されていても使用できない成果物を生成する可能性があります。

したがって、メモリは以下に影響します:

  • 要件の保持
  • マルチステップ計画
  • 一貫性
  • やり直し作業
  • ユーザーの信頼
  • 長時間実行タスクの完了

あるベンチマークでのカテゴリー満点は、製品が任意の実世界セッションで情報を決して忘れないことを意味するものではありません。それは、文心が今回のXClaw評価に含まれるメモリタスクで非常に優れたパフォーマンスを発揮したことを示しています。

データ処理で98.86点

文心助手はデータ処理で98.86点を獲得しました。

ソースでは、このカテゴリーはシステムがフィールドを解釈し、情報を統合し、数値の精度を維持し、構造化された出力を生成できるかどうかをテストするものと説明されています。

これらは見かけ以上に難しいタスクです。

一般的なチャットモデルはスプレッドシートをうまく要約できても、以下のような点で微妙なエラーを1つ犯す可能性があります:

  • 日付フィルター
  • 小計
  • クロスシート参照
  • 単位換算
  • 小数値
  • カテゴリーマッピング

ビジネス用途では、1つの誤った数字がドキュメント全体を無効にする可能性があります。

ソース発行者は文心を企業情報ファイルでテストし、2026年Q2の事業計画書をWord文書として生成するよう依頼しました。

テスト記録によると、エージェントは以下のことを行いました:

  1. Pandocを使用してアップロードされたファイルを抽出
  2. ソース情報を構造化
  3. Word処理機能をロード
  4. フォーマット済みドキュメントを生成
  5. 6,000文字以上、148段落を含むドキュメントを返却

この画像は、百度文心助手がエージェントとしてビジネスプラン生成タスクを完了したテスト成果を示しています。画像上部には、ユーザーがエージェントにAIスマートハードウェアスタートアップ企業「智芯未来」向けの2026年Q2ビジネスプランを作成し、指定された章構成を満たすWord文書を生成するよう指示を出している様子が表示されています。画像下部にはタスク実行結果が表示されており、約6,000文字・148段落のWord文書が正常に生成され、文字数要件を満たし検証を通過したこと、さらにダウンロードオプションが提供されていることが示されており、文心助手のデータ処理および構造化コンテンツ生成能力を視覚的に示しています。

これはチャットとエージェントワークの違いを示しています。

チャットモデルは会話内でプランを書くかもしれません。

エージェントワークフローはこれを行うことができます:

ソースファイルを読み込む
→ 構造化情報を抽出
→ コンテンツを起草
→ Word文書をフォーマット
→ 出力を検証
→ ファイルを返す

散文的な応答ではなく、成果物自体が最終製品となります。

コンテンツ作成で99.44点

文心はコンテンツ作成で99.44点を獲得しました。

エージェントベンチマークにおいて、コンテンツ作成は単なる創造的な文章作成ではありません。

システムは複数の制約を同時に満たす必要がある場合があります:

  • 必要な形式
  • トーン
  • 長さ
  • セクション構成
  • 対象読者
  • ファイルタイプ
  • 事実に基づく裏付け
  • 視覚的表現

草稿は文法的に正しくても、以下の理由で不合格になることがあります:

要求された形式を無視している。

だからこそ、製品ベンチマークは言語品質だけではなく、完了度をますます重視するようになっている。

コーディングスコア 90.28

文心のXClawカテゴリで最も低かったのはコーディングで、90.28だった。

それでも高いスコアだが、コンテンツ作成やデータ処理との差は示唆に富む。

コーディングエージェントは、より広い運用ループを管理する必要がある:

要件を理解する
→ スタックを選定する
→ ファイルを書く
→ 実行またはプレビューする
→ エラーを確認する
→ 修正する
→ インタラクションを検証する
→ 結果をパッケージ化する

ソース出版社は、3D太陽系シミュレーターを一文のリクエストで製品をテストした。

報告されたワークフローはThree.jsを使用し、31KBの単一ファイルHTMLアプリケーションを返した。

記事はまた、同様のインタラクティブWebワークフローを通じて生成された天気シミュレーションの教育ページも示している。

これらは、公式のXClawベンチマーク項目ではなく、実例としてのデモである。

画像は2026年Q2四半期事業計画書の表紙で、背景は水色、上部に「智芯未来 - 2026年Q2事業計画書」の文字がある。タイトルは「2026年Q2四半期事業計画書」、サブタイトルは「AIスマートハードウェアに注力:「中国製造」から「中国智造」へ」。下部には会社名「智芯未来科技有限公司」が表示され、機密文書であり、内部および意向投資家のみ参照用であることが明記され、日付は2026年6月。この表紙は文書冒頭に位置し、その後のAIスマートハードウェア事業計画の内容へとつながる。

リサーチ分析スコア 96.44

文心はリサーチ分析で96.44を獲得した。

本格的なリサーチタスクには以下のものが含まれる場合がある:

  1. 質問を理解する。
  2. それをサブクエスチョンに分解する。
  3. 複数のソースを検索する。
  4. ソースの質を評価する。
  5. 矛盾する主張を比較する。
  6. 日付を確認する。
  7. 数値を抽出する。
  8. 構造化された議論を構築する。
  9. 引用を追加する。
  10. レポートを作成する。

ソース記事では、2つのテストケースが説明されている。

三次元掛谷問題のリサーチ

出版社は文心に、フィールズ賞受賞者であるホン・ワンの文脈で三次元掛谷予想をリサーチするよう依頼した。

報告されたエージェントの動作は以下の通り:

  1. 6ステップのリサーチプロセスを計画する。
  2. 複数のサブエージェントを並行して起動する。
  3. 16の学術ソースを検索する。
  4. Markdownドキュメントを生成する。
  5. 62KBのインタラクティブHTML結果を生成する。

この画像は、文心アシスタントが完了した最新のフィールズ賞三次元掛谷予想に関する研究成果を示している。この研究は事前に計画された6つのステップに従って進められ、同予想の中核的定義、過去の研究の流れ、革新的な突破口を整理し、関連分野の交差ロジックを分解し、16の権威ある学術ソースを収録して研究を完了し、最終的に63.746KBのMarkdownドキュメントと62.83KBのインタラクティブ可視化HTML結果レポートを生成した。全体的な成果は、文書内で言及されている三次元掛谷問題の研究事例に直接対応している。

ソースの数自体は品質指標ではない。

重要なのは、最終的なエージェントが権威あるソースを使用し、主張を正確に帰属させ、矛盾を解決し、時代遅れのデータを避け、事実と解釈を分離するかどうかである。

最近のAIモデルと価格の比較

出版社はまた、前月の主要な国内外モデルの能力と価格を分析するよう文心に依頼した。

記事によると、エージェントは以下のことを行った:

  • 業界調査スキルを読み込んだ。
  • 2ラウンドにわたって45のソースを検索した。
  • いくつかの主要な数値の不確実性を検出した。
  • 29のソースにわたって別のターゲット検索を実行した。
  • 価格を相互検証した。
  • チャート付きで約7,000字の中国語レポートを生成した。

こちらは2026年7月の国内外主要大規模モデル能力分析・価格分析レポートの表紙画像です。表紙上部には日付「2026年7月」が表示され、中央の大きなタイトルは「国内外主要大規模モデル能力分析・価格分析レポート」、下部には小さな文字で「——Artificial Analysis、LMSYS Arenaおよび各社公開データに基づく総合的分析——」と記載されています。レポートは論文重複チェック済みの印が付いており、ページ表示は第1/76頁、文字数は6900字です。この画像は文書内の「国内外主要大規模モデルの能力と価格を分析する」内容に関連する、本レポートの表紙図です。

有用なリサーチループは以下の通りです:

検索
→ 不確実性を特定
→ 再度検索
→ 情報源を比較
→ 相違を解決または明示
→ 執筆

この追加の検証工程こそが、リサーチの質を高めることが多いのです。

2度目の首位獲得:PinchBench v2

SuperCLUEの結果に先立ち、7月にはPinchBench v2でも首位を獲得しました。

PinchBenchはKilo社が、従来の質疑応答型ベンチマークではなく、実世界のワークフローにおけるエージェントを評価するために開発したものです。

Kilo社のPinchBench 2.0リリースでは、ベンチマークが148タスクに拡張され、より厳格な採点基準とリーダーボードルールが追加されました。

ソース記事が掲載する7月のリーダーボードのスナップショットでは、百度のシステムは以下のように表示されています:

Orion-Mission-Mode

そのスコアは:

ベストスコア:   94.6%
平均スコア: 94.4%

この画像はPinchBench v2の関連システムのスコアランキングのスクリーンショットで、各AIシステムの主要指標とスコアを示しています。画面内のオレンジ色の棒は「Average Score」を表しており、最上位のOrion-Mission-Modeは平均スコア94.6%で、94.4%のスコアで第1位となり、anthropic/claude-opus-4.1、qwen1.5/3.7-maxなどの他の参加システムを大きく引き離しています。スクリーンショットには各システムの詳細な能力タグも対応表示されており、Writing Content、Creative、Data Analysisなどが含まれ、各モデルの異なるタスク次元でのパフォーマンスを直感的に示しています。これは文書内で言及されている文心助手がこのベンチマークの7月スナップショットで第1位になった内容と呼応しています。

このスクリーンショットでは、その特定のスナップショットにおいて、Orion Mission Modeが、Anthropic、Alibaba、NVIDIA、Xiaomi、xAI、OpenAIなどのモデルを基盤とするシステムを上回っていることが示されています。

重要なキーワードはスナップショットです。

エージェントのリーダーボードは急速に変化します。

モデル、ハーネス、プロンプト、ツールポリシー、ベンチマーク提出内容はすべて更新され得ます。

したがって、7月の首位獲得結果は、恒久的な世界的ランキングとしてではなく、日付を添えて引用されるべきものです。

PinchBench v2が実際にテストするもの

Kilo社はPinchBench 2.0を、実世界のエージェントワークフローのベンチマークと説明しています。

これには、システムが単に回答を選択するのではなく、ツールを使用して操作を完了することが求められるタスクが含まれています。

ベンチマークは以下のカテゴリをカバーしています:

  • ライティング
  • クリエイティブ業務
  • データ分析
  • リサーチおよび知識業務
  • コードおよび運用
  • その他のコンピュータベースのワークフロー

ソース記事によると、リーダーボードのスナップショットには59のモデルまたはエージェントのエントリが登録されていました。

この数は、提出物が追加または更新されるにつれて変化する可能性があります。

ベンチマーク自体は、リーダーボードの参加者よりも安定しています。

PinchBench 2.0の公式リリースでは、以下のように説明されています:

148タスク

ソースおよびいくつかの7月のレポートでは、文心の評価が147の完了タスクにわたって実施されたと説明する一方、PinchBenchを148タスクのベンチマークと説明しています。

最も安全な解釈は以下の通りです:

PinchBench v2には148のタスクが含まれています。報告されたOrion Mission Modeの評価では、そのスナップショットにおいて147のタスクでスコア結果が得られた可能性があります。

この区別が重要なのは、ベンチマークの報告では、ベンチマークの規模と成功した評価数が混同されることが多いためです。

完了した実行。

ベストスコア vs. 平均スコア

このソースは、Orion Mission Modeが以下を記録したことを強調しています:

ベストスコア 94.6%
平均スコア 94.4%

その0.2ポイントの差は小さいものです。

これは、報告された実行間のばらつきが小さいことを示唆しています。

しかし、これは普遍的な安定性の保証として解釈されるべきではありません。

ベンチマークのばらつきは、以下の要因に依存する可能性があります:

  • 繰り返しの回数。
  • サンプリング温度。
  • ツールの利用可能性。
  • 外部ウェブサイト。
  • ネットワーク状況。
  • グレーダーの挙動。
  • エージェントのタイムアウト。
  • モデルの更新。

実践的な教訓は単純で、報告されたPinchBenchの実行は、単発の幸運な結果に基づいて構築されたものではないということです。

その平均はベストスコアに近い値を維持していました。

エージェントは基盤モデル以上のものである

ソース記事で最も重要な点の一つは、ベンチマークが裸の言語モデルではなく、製品またはエージェントシステムを評価しているということです。

タスクエージェントは以下を組み合わせることができます:

  • 基盤モデル。
  • 検索。
  • メモリ。
  • ファイル処理。
  • ツール選択。
  • プランニング。
  • サブエージェント。
  • 文書生成スキル。
  • ブラウザまたはウェブアクセス。
  • コード実行。
  • 検証。

これは次のように表現できます:

エージェントの結果
=
モデルの能力
+
ツール
+
メモリ
+
プランニング
+
検索
+
実行環境
+
検証

このため、「モデルXがモデルYに勝った」と言うときには注意が必要です。

リーダーボードは実際には、異なるツールとオーケストレーションを使用した2つの異なるエージェントスタックを比較している可能性があります。

より正確な表現は次のとおりです:

「エージェントシステムXは、このベンチマーク構成においてエージェントシステムYよりも高いスコアを獲得しました。」

この言い回しは、AI製品が複雑なソフトウェアシステムへと進化するにつれて、ますます重要になっています。

質問に答えることから仕事を完了することへ

ソース記事は、有用なAI製品の基準が変わる年として2026年を位置づけています。

従来のインタラクションは次のようなものでした:

ユーザーが質問する
→ モデルが答える
→ ユーザーが作業を行う

新しいエージェントパターンは次のようなものです:

ユーザーが目標を与える
→ エージェントが計画する
→ エージェントが文脈を収集する
→ エージェントがツールを呼び出す
→ エージェントがファイルを作成する
→ エージェントが結果を確認する
→ エージェントが成果物を納品する

これにより、ユーザーが気づく点が変わります。

モデルは非常に博識であっても、以下のことができないと苛立たしいものになります:

  • 以前の要件を覚えていること。
  • ファイルを開くこと。
  • スプレッドシートを整形すること。
  • 要求された文書を作成すること。
  • すべての手順を完了すること。
  • 自身のミスを修正すること。

新しい成功条件は、次のようなものに近くなります:

タスクは実際に完了したか?

というよりも:

回答は印象的だったか?

文心のタスクエントリポイント

BAAIの記事では、文心インターフェース内に直接「タスク」オプションが表示されています。

画像はBaidu文心アシスタントのインターフェースを示しています。上部には「今日は『効率の達人』になりたいですか、それとも樹洞(愚痴を聞く場所)を見つけて話したいですか?」というダイアログボックスがあり、下部には「面接用の自己紹介テンプレートを書いて」という入力ボックスがあります。インターフェースの下部には複数の機能オプションがあり、「タスク」オプションが赤い枠で強調表示されています。この画像は前述の「文心のタスクエントリポイント」に関連しており、文心インターフェース内の「タスク」オプションの位置を視覚的に示し、BAAI記事の「タスク」オプションが文心インターフェース内に直接あるという内容を裏付けています。

百度の公式文心ウェブサイトでは、この製品を以下のためのマルチモーダルAIアシスタントとして説明しています:

  • 信頼できる作成。
  • ディープ検索。
  • インテリジェントなツール使用。
  • 文書作業。
  • ライティング。
  • 画像。

端末間での利用。

百度アプリではまた、文心一言(Wenxin Assistant)を、深層リサーチ、検索、文章作成、画像生成、動画生成、対話支援のための統合AI機能としてリストアップしています。

これは、タスク指向型AIが、もはや開発者限定の実験ではなく、百度の主流の消費者向けインターフェースに進出したことを裏付けています。

文心一言は本当に無料かつ無制限なのか?

元の記事では、一つの商業的ポイントが繰り返し強調されています:

文心一言は無料であり、ペイウォールはない。

百度の公式文心一言ページは現在、無料アクセスまたは無料体験を提供しています。

これは簡単に確認できます。

より強い主張、つまりすべてのタスクエージェント機能に対して恒久的に無制限という点は、安定した公式ポリシーページから確認するのは困難です。

AI製品には以下のようなものが導入される可能性があります:

  • 日次クォータ。
  • 同時実行制限。
  • 機能固有の制限。
  • 一時的なプロモーション。
  • アカウントの階層。
  • 地域による制限。
  • 将来の価格変更。

公開用には、より安全な表現は次のとおりです:

文心一言は現在、個人ユーザー向けに無料アクセスオプションを提供しており、元の記事で示されたタスク体験は有料サブスクリプションを必要としませんでした。

百度がそれを保証する特定のポリシーを公開しない限り、「永久に無制限」という表現に基づいて長期的なコスト比較を構築しないでください。

検索体験がエージェントに役立つ理由

元の記事の最後のセクションでは、百度の検索履歴がエージェント設計において構造的優位性を与えると論じています。

実際に類似点があります。

検索エンジンは次のようなものを処理します:

ユーザークエリ
→ 意図理解
→ クエリ分解
→ 検索
→ ランキング
→ 結果の統合
→ 応答

エージェントは以下のものを処理します:

ユーザーの目標
→ 意図理解
→ タスク分解
→ ツール選択
→ 実行
→ 結果の統合
→ 提供

2つのパイプラインは同一ではありません。

エージェントははるかに大きなアクション空間を持ち、より高い実行リスクを伴います。

しかし、いくつかの技術的能力は自然に移行します:

  • 意図理解。
  • クエリ書き換え。
  • 検索。
  • ソースのランキング。
  • セッションコンテキスト。
  • 鮮度の管理。
  • 重複排除。
  • 証拠の統合。

これは特にリサーチエージェントに関連します。

強力な検索インフラをすでに持つシステムは、その上に、より深いワークフローを構築できます。

検索クエリ理解とエージェントのタスク理解

従来の検索リクエストを考えてみましょう:

北京から上海への最も安い航空券を見つける。

検索システムは以下を推測する必要があるかもしれません:

  • 出発地。
  • 目的地。
  • 旅行日。
  • 価格の好み。
  • 利用可能な航空券の在庫。
  • 並べ替え順。

エージェントが次のように求められた場合:

北京―上海間の最も安い航空券を見つけて旅程を準備する。

追加で必要になるかもしれません:

  • ツール選択。
  • 複数回の検索。
  • 比較。
  • 制約チェック。
  • ファイル生成。
  • 場合によってはカレンダーや予約のステップ。

問題の前半は検索に似ています。

後半はアクションのオーケストレーションです。

検索体験は有用なコンポーネントを提供しますが、エージェントの品質は依然として実行レイヤーに依存します。

メモリと検索セッションは関連しているが、同じではない

元の記事はまた、文心一言のメモリスコアを、検索セッション理解における百度の経験と結び付けています。

そこには

いくつかの概念的な重複がある。

両システムは、以前のやり取りからのどの情報が引き続き関連するかを推論する必要がある。

検索セッションには、次のものが含まれる場合がある:

クエリ1:電気自動車
クエリ2:航続距離600km以上
クエリ3:25万元以下

システムは、3番目のクエリが依然として電気自動車に関するものであることを理解する必要がある。

エージェントメモリシステムは、より困難な仕事を抱えている。

以下のことを記憶する必要があるかもしれない:

  • ユーザーの好み。
  • タスクの制約。
  • ファイルから得られた事実。
  • 意思決定。
  • ツールの出力。
  • 一時的な状態。
  • 長期的な好み。

検索セッションの専門知識は有用であるが、持続的なエージェントメモリには、追加の保存、検索、プライバシー、および関連性のメカニズムが必要である。

リサーチ分析こそ、Baiduの検索スタックが最も直接的に適用できる分野である

XClawの5つのカテゴリのうち、リサーチ分析は、Baiduの検索バックグラウンドが直接的に移転できる最も明確な分野である。

リサーチエージェントには、以下が必要である:

  • 検索カバレッジ。
  • 最新情報。
  • クエリ拡張。
  • ランキング。
  • 引用処理。
  • ソース比較。
  • エンティティ理解。
  • 多言語検索。

Baiduの公式Qianfan AI Assistantドキュメントも、Baidu検索、Baidu百科、画像検索、会話管理、メモリ管理、およびドキュメント機能を統合したエンタープライズエージェントソリューションを説明している。

これは、消費者向け文心製品が正確に同じ実装を使用していることを証明するものではない。

しかし、Baiduが検索、メモリ、ツール、およびマルチモーダル検索を中心とした共通のエージェントスタックを、製品ポートフォリオ全体にわたって構築していることを示している。

2つのベンチマーク勝利が証明しないこと

高いベンチマークスコアは有用な証拠である。

しかし、それらは評価全体ではない。

恒久的なグローバルリーダーシップを証明しない

リーダーボードは変化する。

新しいモデルや新しいエージェントの提出が、現在のリーダーを追い越す可能性がある。

すべてのタスクが97%を獲得することを証明しない

XClawは選択されたタスクとカテゴリを集約している。

ユーザーの実際のワークフローは大きく異なる可能性がある。

基盤モデルを切り離して評価しない

スコアは、完全なアシスタントまたはエージェントスタックに属する。

すべての安全問題を測定しない

タスクを効率的に完了できるエージェントでも、異なる環境では安全でないツール呼び出しを行ったり、機密情報を漏洩したりする可能性がある。

事実の正確性を保証しない

リサーチエージェントは、信頼性の低いソースを引用したり、変化するデータを誤って解釈したりする可能性がある。

無制限の無料利用を証明しない

製品の価格設定とクォータは商業ポリシーであり、ベンチマークの特性ではない。

文心アシスタントを自分で評価する方法

有用な個人テストは、実際の仕事に似ているべきである。

雑学クイズだけを尋ねてはいけない。

エージェントに完全なタスクを与えること。

テスト1:メモリ

長い会話の開始時に5つの制約を提供する。

いくつかの無関係なやり取りの後、最終成果物を要求し、5つすべてが保持されているか確認する。

テスト2:データ処理

以下をアップロードする:

  • スプレッドシート。
  • PDF。
  • 短いテキストファイル。

エージェントにそれらを1つのレポートに統合するよう依頼する。

すべての数値を独立して検証する。

テスト3:リサーチ

変化する情報を含むトピックを選択する。

以下を要求する:

  • 一次ソース。
  • 公開日。
  • 競合ソースの比較。
  • 直接リンク。
  • 不確実な主張のリスト。

テスト4:ドキュメント

作成

Word、PowerPoint、スプレッドシート、またはHTMLアーティファクトを依頼してください。

判定基準:

  • 構造。
  • 書式設定。
  • 完全性。
  • ダウンロード可能性。
  • ファイルが実際に開けるかどうか。

テスト5: コーディング

小さなインタラクティブアプリケーションを依頼してください。

確認項目:

  • 実行できるか。
  • 要求された機能がすべて存在するか。
  • エラーが修正されているか。
  • 要求された場合、最終ファイルが自己完結型であるか。

テスト6: 長期間実行

複数のツールを必要とするタスクを与えてください。

システムが次のことを行うかを確認してください:

  1. 計画を立てる。
  2. 合理的なツールを選択する。
  3. 失敗から回復する。
  4. 作業の重複を避ける。
  5. 最終結果を検証する。

エージェント製品を比較するより良い方法

文心を他のエージェントと比較する際は、「ベンチマークスコア」よりも広い表を使用してください。

側面 測定内容
タスク成功率 要求された作業が完了したか。
記憶力 以前の制約が保持されていたか。
正確性 数値と主張が正しいか。
リサーチ品質 情報源が権威的かつ最新か。
ツール信頼性 ツール呼び出しが一貫して成功するか。
アーティファクト品質 ファイルが手動修正なしで使用可能か。
回復力 エージェントが失敗したステップを修正できるか。
レイテンシー 完全なタスクにどれだけの時間がかかるか。
コスト 受理された結果1件のコストはいくらか。
プライバシー アップロードされたファイルと記憶はどのように扱われるか。
可用性 主要機能が無料か、割り当て制限付きか、有料か。

これにより、単一のリーダーボード順位よりも現実的な全体像が得られます。

より大きな変化:「成果を出せるか?」

元記事の最も強い論点は百度よりも広いものです。

エージェント競争はAI品質の定義を変えつつあります。

第一世代のチャットボットでは、ユーザーは回答品質に焦点を当てていました。

現在のタスクエージェントでは、重要な問いは次のようになっています:

  • 文脈を保持できるか。
  • 正しい情報を見つけられるか。
  • ツールを操作できるか。
  • ファイルを作成できるか。
  • 複数ステップのワークフローを完了できるか。
  • 自身の結果を検証できるか。
  • 繰り返しの作業を任せられるか。

だからこそ、XClawやPinchBenchなどのベンチマークが注目を集めています。

これらは評価を本番作業に近づけます。

ベンチマークとエンタープライズ展開の間にはまだ長い距離があります。

しかし、方向性は有用です:

知識ベンチマーク
→ 推論ベンチマーク
→ ツール使用ベンチマーク
→ エンドツーエンドタスクベンチマーク
→ 実際の本番成果

最終ステップこそが結局最も重要です。

よくある質問

百度文心一言アシスタントはSuperCLUE XClawで何点を獲得しましたか?

2026年8月のSuperCLUE XClawスナップショットでは、文心一言アシスタントの総合スコアは97.62で、表示された製品の中で1位でした。カテゴリ別スコアは、コーディング90.28、コンテンツ作成99.44、データ処理98.86、リサーチ分析96.44、記憶100でした。

記憶スコア100とはどういう意味ですか?

そのXClaw評価に含まれる記憶タスクで文心が満点を獲得したことを意味します。実際のあらゆる会話で文脈を決して忘れないという意味ではありません。

PinchBench v2とは何ですか?

PinchBench v2はKiloが作成したエージェントベンチマークで、実世界のコンピューターおよびワークフロータスクでシステムを評価します。バージョン2.0には148のタスクが含まれており、測定することを目的としています。

単純な質問応答ではなく、エンドツーエンドでの実行が重視されています。

文心のPinchBench v2スコアは?

2026年7月のリーダーボードスナップショットでは、百度のタスクエージェントは Orion Mission Mode として表示され、最高スコア94.6%、平均スコア94.4%を記録しました。リーダーボードは時間とともに変動するため、結果を引用する際にはスナップショットの日付を含める必要があります。

文心一言アシスタントは完全に無料ですか?

百度公式の文心ページでは現在、無料アクセスまたは無料体験オプションが提供されており、元の記事では、実演されたタスク機能は有料サブスクリプションなしで利用可能だったと記載されています。すべての機能の永久的な無制限利用に関する安定した公式保証は確認されなかったため、現在のクォータは製品内で直接確認する必要があります。

文心一言アシスタントはWord文書やWebページを生成できますか?

元の記事では、文心がフォーマット済みのWordビジネスプランやインタラクティブなHTMLページを生成したテストセッションが示されています。これらの例は製品のタスクワークフローを示すものですが、すべてのプロンプトや環境で同じ結果が得られることを保証するものではありません。

百度の検索技術がAIエージェントに役立つ可能性があるのはなぜですか?

検索とエージェントは、意図理解、クエリ分解、検索、ランキング、ソース集約、セッションコンテキストなどの機能を共有しています。エージェントはさらに、ツール呼び出し、ファイル作成、メモリ、プランニング、アクションなど、より広範な実行レイヤーを追加します。

XClawとPinchBenchはモデルベンチマークですか?

厳密な意味ではそうではありません。これらは、モデルとツール、メモリ、検索、プロンプト、オーケストレーション、実行環境を組み合わせた製品またはエージェントシステムを評価します。したがって、それらのスコアは完全なエージェント構成に帰属させるべきです。

関連ツール

  • Baidu Wenxin: 検索、作成、ドキュメント、タスク指向の作業のための百度公式マルチモーダルAIアシスタント。
  • SuperCLUE XClaw: 元の記事で引用されている製品指向の中国語エージェントベンチマーク。
  • PinchBench: コーディングおよびコンピューター使用エージェントワークフロー向けのKiloの実世界ベンチマーク。
  • Pandoc: 元のテストワークフローでドキュメントコンテンツの抽出・変換に使用されたドキュメント変換ツール。
  • Three.js: 元の記事で生成された太陽系の例で使用されたJavaScript 3Dグラフィックスライブラリ。
  • Baidu Qianfan: モデル、エージェント、データ、AIアプリケーション開発のための百度エンタープライズプラットフォーム。
  • Baidu AgentBuilder: カスタム文心ベースのエージェントを構築・公開するための百度プラットフォーム。

関連リンク

  • Baidu Wenxin公式サイト: Webおよびダウンロード可能なクライアントにおける文心一言アシスタントの現在の公式製品エントリーポイント。
  • Baidu Wenxinデスクトップアシスタント: ドキュメント分析、検索、作成、エクスポート、無料体験を紹介する公式デスクトップページ。
  • [SuperCLUE XClaw 2026年8月

Evaluation](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): 元記事が参照しているベンチマークページ。

まとめ

百度文心アシスタントは、SuperCLUEの2026年8月XClawスナップショットで97.62点を獲得し1位となった。メモリは満点の100点、データ処理、コンテンツ作成、リサーチ分析はすべて96点以上を記録した。

この結果は、7月のPinchBench v2リーダーボードスナップショットで、百度のオリオンミッションモードが**最高スコア94.6%、平均スコア94.4%**を記録したことに続くものだ。両ベンチマークは異なるタスクを使用しているが、いずれも単純な質問応答ではなく、実際のタスク完了を重視している。

最も重要な教訓は、あるアシスタントがエージェント競争で恒久的に「勝利」したということではない。エージェントのランキングは急速に変動し、評価対象のシステムにはモデル、ツール、検索、メモリ、プロンプト、オーケストレーションが含まれている。

2つの結果が示しているのは、AI評価がより実用的な基準へと移行していることだ。つまり、モデルが賢く聞こえるかどうかではなく、エージェントが作業を完了し、利用可能な結果を返せるかどうかである。