百度文心助手在领跑PinchBench v2后,登顶SuperCLUE XClaw榜单。
百度文心助手在另一项智能体风格基准测试中拔得头筹。在SuperCLUE于2026年8月发布的XClaw产品评测中,文心助手以97分的总成绩位居首位。

百度文心助手在领跑PinchBench v2后,登顶SuperCLUE XClaw
引言
百度文心助手在另一项智能体基准测试中夺得第一名。
在SuperCLUE 2026年8月的 XClaw 产品评测中,文心助手以 97.62 的综合得分位居已发布榜单之首。
其各项能力得分如下:
| 能力 | 得分 |
|---|---|
| 编程 | 90.28 |
| 内容创作 | 99.44 |
| 数据处理 | 98.86 |
| 研究分析 | 96.44 |
| 记忆 | 100.00 |
这一成绩公布时,距离其上一次亮眼表现还不到三周。
在 PinchBench v2 的7月榜单中,百度的任务智能体——以 Orion Mission Mode 名义提交——录得 94.6% 的最佳得分 和 94.4% 的平均得分,在该榜单中位列榜首。
这两项基准测试有所不同。SuperCLUE XClaw 聚焦于中文智能体产品及五个能力维度的实际交付成果。PinchBench v2 由 Kilo 创建,围绕真实世界的计算机与自动化任务构建。
两者共同指向同一个转变:
智能体评估正从“模型能否正确回答?”转向“系统能否完成任务并交付可用的成果?”
一个语言模型可能知道答案,但作为智能体仍然失败,因为它会忘记需求、选错工具、处理文件不当、在工作流中途停止,或返回错误的产物。
这使得文心助手的最新成绩更多关乎任务执行,而非原始的语言模型智能。

文心助手在SuperCLUE XClaw中夺得第一
SuperCLUE 将 XClaw 描述为针对“爪”式AI助手的面向产品的评测。
该基准测试并非主要依赖选择题,而是强调完成的交付成果。
2026年8月的榜单将主要产品排名如下:
| 排名 | 产品 | 得分 |
|---|---|---|
| 1 | 百度文心一言助手 | 97.62 |
| 2 | MiMoClaw | 96.74 |
| 3 | WorkBuddy | 96.61 |
| 4 | KimiClaw | 96.01 |
| 5 | MaxClaw | 94.79 |
该基准测试评估五个维度:
- 数据处理。
- 内容创作。
- 记忆能力。
- 编程能力。
- 研究分析。
基本逻辑很简单:智能体接收任务,必须产出可实际评判的最终成果或结果。
这使得指令遵循、文件处理、工具使用和长周期执行成为评分的一部分。

记忆能力达到100分
最引人注目的类别得分是记忆能力100.00分。
记忆能力之所以重要,是因为实际工作很少局限于单个孤立的提示中。
用户可能在对话早期提供约束条件,并期望智能体在很久之后仍能遵守这些约束。
例如:
Turn 1:
Use only Q2 2026 data.
Turn 3:
Keep the report under 10 pages.
Turn 6:
Use the same product segmentation as the spreadsheet.
Turn 10:
Generate the final Word document.
一个忘记最初指令的智能体,可能会产出精美但不可用的交付物。
因此,记忆能力影响:
- 需求保留。
- 多步骤规划。
- 一致性。
- 返工。
- 用户信任。
- 长周期任务完成。
在单一基准测试中获得满分类别得分,并不意味着该产品在任意真实世界会话中永远不会遗忘信息。但这确实表明,文心在本次XClaw评估所包含的记忆任务中表现极为出色。
数据处理得分98.86
文心助手在数据处理方面获得98.86分。
该来源将此类别描述为测试系统能否解释字段、整合信息、保持数值精度并生成结构化输出。
这些是看似简单实则困难的任务。
通用聊天模型可能能很好地总结电子表格,但在以下方面仍可能犯一个细微错误:
- 日期筛选。
- 小计。
- 跨表查找。
- 单位换算。
- 小数值。
- 类别映射。
在商业用途中,一个错误的数字就可能使整份文件失效。
源发布方使用一份公司信息文件测试了文心,并要求其生成一份2026年第二季度的商业计划书,输出为Word文档。
根据测试记录,该智能体:
- 使用Pandoc提取了上传的文件。
- 对源信息进行了结构化处理。
- 加载了文字处理能力。
- 生成了格式化的文档。
- 返回了一份包含超过6000个汉字和148个段落的文档。

这展示了聊天与智能体工作之间的区别。
聊天模型可能会在对话中直接撰写计划。
而智能体工作流可以做到:
Read source file
→ extract structured information
→ draft content
→ format Word document
→ validate output
→ return a file
产物(而非文字回复)成为最终交付成果。
内容创作得分99.44
文心在内容创作方面得分 99.44。
在智能体基准测试中,内容创作不仅仅是创意写作。
系统可能需要同时满足多个约束条件:
- 要求的格式。
- 语气。
- 长度。
- 章节结构。
- 目标受众。
- 文件类型。
- 事实依据。
- 视觉呈现。
一份草稿可能在语法上无可挑剔,但仍可能因忽略所要求的格式而失败。
这就是为什么产品基准测试越来越注重完成度,而不仅仅是语言质量。
编程得分90.28
文心在XClaw类别中得分最低的是编程,为 90.28。
这仍然是一个强劲的分数,但相对于内容创作和数据处理而言,这一差距具有参考价值。
编程智能体需要管理更广泛的操作循环:
Understand requirement
→ choose stack
→ write files
→ execute or preview
→ inspect errors
→ fix
→ verify interaction
→ package result
源发布方使用一句请求测试了该产品,要求生成一个 3D太阳系模拟器。
所报告的工作流程使用了Three.js,并生成了一个31 KB的单文件HTML应用程序。
文章还展示了一个通过类似交互式网页工作流程生成的天气模拟教学页面。
这些是说明性演示,而非官方的XClaw基准测试项目。

研究分析得分96.44
文心在研究中分析获得了96.44分。
一项严肃的研究任务可能涉及:
- 理解问题。
- 将其分解为子问题。
- 搜索多个来源。
- 评估来源质量。
- 比较相互矛盾的论点。
- 核对日期。
- 提取数值。
- 构建结构化的论证。
- 添加引用。
- 生成报告。
源文章描述了两个测试案例。
研究三维Kakeya问题
发布方要求文心在菲尔兹奖得主王虹的背景下研究三维Kakeya猜想。
所报告的智能体行为如下:
- 规划一个六步研究流程。
- 并行启动多个子智能体。
- 搜索16个学术来源。
- 生成一份Markdown文档。
- 生成一个62 KB的交互式HTML结果。

来源数量本身并不是衡量质量的指标。
关键在于最终智能体是否使用权威来源、是否正确归属引用、是否解决冲突、是否避免过时数据,以及是否将事实与解读区分开来。
近期AI模型与价格对比
出版商还要求文心分析上个月国内外主要模型的能力和定价。
文章称该智能体:
- 加载了一项行业研究技能。
- 在两轮中搜索了45个来源。
- 检测到某些关键数据存在不确定性。
- 又针对29个来源进行了定向搜索。
- 交叉核对了定价。
- 生成了约7000个汉字并附有图表的报告。

有用的研究循环是:
Search
→ identify uncertainty
→ search again
→ compare sources
→ resolve or flag disagreement
→ write
额外的验证环节往往是研究质量提升的关键所在。
第二个第一名:PinchBench v2
SuperCLUE的结果紧随7月在PinchBench v2上获得的第一名之后。
PinchBench由Kilo创建,用于评估智能体在真实工作流程中的表现,而非传统的问答基准测试。
Kilo的PinchBench 2.0版本将基准测试扩展到148项任务,并增加了更严格的评分和排行榜规则。
在来源文章复现的7月排行榜快照中,百度的系统显示为:
Orion-Mission-Mode
其中:
Best score: 94.6%
Average score: 94.4%

该截图将Orion Mission Mode置于基于Anthropic、阿里巴巴、NVIDIA、小米、xAI、OpenAI等公司模型的系统之前,但仅限于该特定快照。
关键词是快照。
智能体排行榜变化迅速。
模型、测试框架、提示词、工具策略和基准测试提交内容都可能随时更新。
因此,7月份的第一名结果应注明日期引用,而非视为永久性的全球排名。
PinchBench v2实际测试内容
Kilo将PinchBench 2.0描述为真实世界智能体工作流的基准测试。
它包含的任务要求系统使用工具并完成操作,而非简单选择答案。
该基准测试涵盖以下类别:
- 写作。
- 创意工作。
- 数据分析。
- 研究与知识工作。
- 代码与运维。
- 其他基于计算机的工作流。
来源文章指出,排行榜快照中包含了59个模型或智能体条目。
随着提交内容的增加或更新,该数量可能会变化。
基准测试本身比排行榜的参与者群体更为稳定。
PinchBench 2.0的官方发布描述:
148 tasks
来源及多份7月报告描述了文心在147项已完成任务上的评估结果,同时将PinchBench描述为包含148项任务的基准测试。
最稳妥的解释是:
PinchBench v2包含148项任务;所报告的Orion Mission Mode评估在该快照中可能对其中147项任务产生了评分结果。
这一区别很重要,因为基准测试报告常将基准规模与成功完成运行的数量混为一谈。
最佳得分与平均得分
来源强调Orion Mission Mode记录了:
94.6% best score
94.4% average score
0.2分的差距很小。
这表明所报告运行之间的差异较低。
然而,这不应被解读为一种普遍性的稳定性保证。
基准测试的方差可能取决于:
- 重复次数。
- 采样温度。
- 工具可用性。
- 外部网站。
- 网络条件。
- 评分者行为。
- 智能体超时。
- 模型更新。
实际的经验教训很简单:所报告的 PinchBench 运行并非建立在一次孤立的幸运结果之上。
其平均值始终接近其最佳得分。
智能体不仅仅是底层模型
源文章中最重要的观点之一是,该基准测试评估的是一个产品或智能体系统,而非一个裸露的语言模型。
任务智能体可以组合:
- 基础模型。
- 搜索。
- 记忆。
- 文件处理。
- 工具选择。
- 规划。
- 子智能体。
- 文档生成技能。
- 浏览器或网络访问。
- 代码执行。
- 验证。
这可以表示为:
Agent result
=
model capability
+
tools
+
memory
+
planning
+
search
+
execution environment
+
verification
这就是为什么在说以下话时要谨慎的原因:
“模型 X 击败了模型 Y。”
排行榜实际上可能是在比较两个使用不同工具和编排方式的智能体堆栈。
更精确的描述是:
“在此基准配置下,智能体系统 X 的得分高于智能体系统 Y。”
随着 AI 产品演变为复杂的软件系统,这种措辞变得越来越重要。
从回答问题到完成任务
源文章将 2026 年视为有用 AI 产品标准发生转变的一年。
较旧的交互方式如下:
User asks
→ model answers
→ user performs the work
新兴的智能体模式如下:
User gives goal
→ agent plans
→ agent gathers context
→ agent calls tools
→ agent creates files
→ agent checks results
→ agent delivers artifact
这改变了用户关注的重点。
一个模型可能知识极其渊博,但如果它无法做到以下几点,则会令人沮丧:
- 记住早期要求。
- 打开文件。
- 格式化电子表格。
- 创建所请求的文档。
- 完成所有步骤。
- 纠正自身错误。
新的成功条件更接近于:
Did the task actually get finished?
而不是:
Was the answer impressive?
文心的任务入口点
BAAI 文章展示了文心界面中直接存在的“任务”选项。

百度官方文心网站将该产品描述为一款多模态AI助手,功能涵盖:
- 可信创作。
- 深度搜索。
- 智能工具使用。
- 文档处理。
- 写作。
- 图像生成。
跨设备使用。
百度App也将文心一言助手列为集成AI功能,支持深度研究、搜索、写作、图像生成、视频生成和对话辅助。
这证实了任务导向型AI已进入百度主流消费级界面,而非仅停留在开发者专属实验阶段。
文心一言助手真的免费且无限制吗?
源文章反复强调一个商业要点:
文心一言助手免费,且无付费墙。
百度官方文心页面目前提供免费访问或免费体验。
这一点容易验证。
但更强烈的说法——所有任务代理功能永久无限制——则难以从稳定的官方政策页面得到验证。
AI产品可能引入:
- 每日配额。
- 并发限制。
- 特定功能限制。
- 临时促销活动。
- 账户等级。
- 区域限制。
- 未来定价变更。
在公开发布时,更稳妥的表述是:
文心一言助手目前向个人用户提供免费访问选项,且源文章中展示的任务体验无需付费订阅。
除非百度发布明确保证这一点的具体政策,否则不要围绕“永久无限制”构建长期成本比较。
搜索体验为何能助力代理
源文章最后部分认为,百度的搜索历史赋予其在代理设计上的结构性优势。
这确实有类比之处。
搜索引擎处理的内容大致如下:
User query
→ intent understanding
→ query decomposition
→ retrieval
→ ranking
→ result aggregation
→ response
代理处理的内容为:
User goal
→ intent understanding
→ task decomposition
→ tool selection
→ execution
→ result aggregation
→ delivery
这两条流程并不完全相同。
智能体的动作空间更大,执行风险也更高。
但有几项技术能力可以自然迁移:
- 意图理解。
- 查询改写。
- 检索。
- 来源排序。
- 会话上下文。
- 时效性处理。
- 去重。
- 证据聚合。
这对研究型智能体尤其重要。
一个已经拥有强大搜索基础设施的系统,可以在其上构建更深层的工作流。
搜索查询理解与智能体任务理解
考虑一个传统的搜索请求:
Find the cheapest flight from Beijing to Shanghai.
搜索系统可能需要推断:
- 出发地。
- 目的地。
- 旅行日期。
- 价格偏好。
- 符合条件的航班库存。
- 排序方式。
一个被要求执行以下任务的智能体:
Find the cheapest Beijing–Shanghai flight and prepare an itinerary.
可能需要额外处理:
- 工具选择。
- 多次搜索。
- 比较。
- 约束检查。
- 文件生成。
- 可能还包括日历或预订步骤。
问题的前半部分类似于搜索。
后半部分则是动作编排。
搜索经验提供了有用的组件,但智能体的质量仍然取决于执行层。
记忆与搜索会话相关——但并不相同
该来源还将文心的记忆评分与百度在搜索会话理解方面的经验联系起来。
两者存在
一定的概念重叠。
两个系统都需要推断早期交互中的哪些信息仍然相关。
一个搜索会话可能包含:
Query 1: electric cars
Query 2: range over 600 km
Query 3: under RMB 250,000
系统应理解第三个查询仍然与电动汽车相关。
智能体记忆系统的任务更为艰巨。
它可能需要记住:
- 用户偏好。
- 任务约束。
- 从文件中提取的事实。
- 决策。
- 工具输出。
- 临时状态。
- 长期偏好。
搜索会话的专业知识很有用,但持久化的智能体记忆需要额外的存储、检索、隐私和相关性机制。
研究分析是百度搜索栈最直接相关的领域
在XClaw的五个类别中,研究分析是百度搜索背景能直接迁移的最明显领域。
研究型智能体需要:
- 搜索覆盖范围。
- 新鲜信息。
- 查询扩展。
- 排序。
- 引用处理。
- 来源比较。
- 实体理解。
- 多语言检索。
百度官方的千帆AI助手文档还描述了一个企业智能体解决方案,集成了百度搜索、百度百科、图像搜索、对话管理、记忆管理和文档能力。
这并不能证明消费级文心产品使用了完全相同的实现。
这确实表明百度正在围绕搜索、记忆、工具和多模态检索,在其产品组合中构建一个通用的智能体技术栈。
两项基准测试胜利并未证明什么
高分基准测试成绩是有用的证据。
但它们并非完整的评估。
它们并未证明永久的全球领先地位
排行榜会变化。
新模型和新的智能体提交可能会超越当前的领先者。
它们并未证明每项任务都能获得97%的分数
XClaw 聚合了选定的任务和类别。
用户真实的工作流程可能大相径庭。
它们并未将基础模型单独隔离出来
该分数属于完整的助手或智能体技术栈。
它们并未衡量所有安全问题
一个能高效完成任务的智能体,在不同环境中仍可能进行不安全的工具调用或泄露敏感信息。
它们并未保证事实准确性
研究型智能体可能引用薄弱的来源或误读变化的数据。
它们并未证明可以无限免费使用
产品定价和配额是商业政策,而非基准测试的属性。
如何自行评估文心一言助手
有用的个人测试应贴近你的实际工作。
不要只问琐碎的问题。
给智能体一个完整的任务。
测试一:记忆
在长对话开始时提供五个约束条件。
经过几轮不相关的对话后,要求生成最终成果,并检查所有五个约束条件是否都被保留。
测试二:数据处理
上传:
- 一个电子表格。
- 一个 PDF 文件。
- 一个短文本文件。
要求智能体将它们合并成一份报告。
独立验证每一个数值。
测试三:研究
选择一个信息不断变化的主题。
要求:
- 主要来源。
- 发布日期。
- 冲突来源对比。
- 直接链接。
- 不确定声明的列表。
测试四:文档创建
要求生成 Word、PowerPoint、电子表格或 HTML 格式的成果文件。
评判标准:
- 结构。
- 格式。
- 完整性。
- 可下载性。
- 文件是否真的能打开。
测试五:编码
要求开发一个小型交互式应用程序。
检查:
- 它是否能运行。
- 所有要求的功能是否存在。
- 错误是否被修复。
- 按要求,最终文件是否自包含。
测试六:长周期执行
给出一个需要多个工具的任务。
观察系统是否:
- 制定计划。
- 选择合理的工具。
- 从失败中恢复。
- 避免重复工作。
- 验证最终结果。
比较智能体产品的更好方法
在比较文心一言与其他智能体时,使用一个比“基准测试分数”更全面的表格。
| 维度 | 衡量内容 |
|---|---|
| 任务成功率 | 请求的工作是否完成? |
| 记忆能力 | 是否保留了之前的约束条件? |
| 准确性 | 数字和陈述是否正确? |
| 研究质量 | 来源是否权威且最新? |
| 工具可靠性 | 工具调用是否持续成功? |
| 产物质量 | 文件是否无需手动修复即可使用? |
| 恢复能力 | 代理能否修复失败的步骤? |
| 延迟 | 完成一项完整任务需要多长时间? |
| 成本 | 一个被接受的结果花费多少? |
| 隐私 | 上传的文件和记忆如何处理? |
| 可用性 | 关键功能是免费、限次还是付费? |
这比单一排行榜排名更能反映真实情况。
更大的转变:“它能交付吗?”
源文章最有力的观点比百度本身更广泛。
智能体竞争正在改变AI质量的定义。
对于第一代聊天机器人,用户关注的是回答质量。
对于当前的任务型智能体,关键问题正变成:
- 它能保持上下文吗?
- 它能找到正确的信息吗?
- 它能操作工具吗?
- 它能创建文件吗?
- 它能完成多步骤工作流吗?
- 它能验证自己的结果吗?
- 我能信任它处理重复性工作吗?
这就是为什么像XClaw和PinchBench这样的基准测试正受到关注。
它们将评估更接近实际生产工作。
基准测试与企业部署之间仍有很长的距离。
但方向是有用的:
Knowledge benchmark
→ reasoning benchmark
→ tool-use benchmark
→ end-to-end task benchmark
→ real production outcome
最后一步最终才是最重要的。
常见问题解答
百度文心助手在SuperCLUE XClaw上获得了多少分?
2026年8月的SuperCLUE XClaw快照显示,文心助手的综合得分为97.62,在所展示的产品中排名第一。其分类得分为:编码90.28,内容创作99.44,数据处理98.86,研究分析96.44,记忆100。
记忆得分100意味着什么?
这意味着文心助手在该XClaw评估中包含的记忆任务中获得了满分。这并不表示该助手在现实世界中的每一次对话中都不会忘记上下文。
什么是PinchBench v2?
PinchBench v2是Kilo创建的一个智能体基准测试,用于评估系统在真实世界计算机和工作流任务上的表现。2.0版本包含148个任务,旨在衡量端到端执行能力,而非简单的问答。
文心助手在PinchBench v2上的得分是多少?
在2026年7月的排行榜快照中,百度的任务智能体以 Orion Mission Mode 名称出现,最佳得分为94.6%,平均得分为94.4%。排行榜会随时间变化,因此在引用结果时应包含快照日期。
文心一言完全免费吗?
百度官方文心页面目前提供免费访问或免费体验选项,来源文章指出所展示的任务功能无需付费订阅即可使用。但未找到官方对每个功能永久无限使用的稳定保证,因此当前配额应直接在产品中查看。
文心一言能生成Word文档和网页吗?
来源文章展示了文心生成格式化Word商业计划书和交互式HTML页面的测试会话。这些示例展示了产品的任务工作流,但并不能保证每个提示或环境都会产生相同结果。
为什么百度搜索技术可能有助于其AI智能体?
搜索和智能体共享意图理解、查询分解、检索、排序、来源聚合和会话上下文等能力。智能体增加了更广泛的执行层,包括工具调用、文件创建、记忆、规划和行动。
XClaw和PinchBench是模型基准吗?
从狭义上讲不是。它们评估的是可能将模型与工具、记忆、搜索、提示、编排和执行环境相结合的产品或智能体系统。因此,它们的分数应归因于完整的智能体配置。
相关工具
- 百度文心:百度官方的多模态AI助手,用于搜索、创作、文档和任务导向工作。
- SuperCLUE XClaw:来源文章中引用的面向产品的中国智能体基准。
- PinchBench:Kilo针对编码和计算机使用智能体工作流的真实世界基准。
- Pandoc:来源测试工作流中用于提取和转换文档内容的文档转换工具。
- Three.js:来源文章生成的太阳系示例中使用的JavaScript 3D图形库。
- 百度千帆:百度面向模型、智能体、数据和AI应用开发的企业级平台。
- 百度AgentBuilder:百度用于构建和发布基于文心的自定义智能体的平台。
相关链接
- 百度文心官方网站:当前文心一言助手在网页端及可下载客户端的官方产品入口。
- 百度文心桌面助手:官方桌面页面,突出文档分析、搜索、创作、导出及免费体验功能。
- SuperCLUE XClaw 2026年8月评测:原文引用的基准测试页面。
- Kilo:PinchBench 2.0 正式发布:关于PinchBench v2的148项任务、评分变化、并行评审及排行榜设计的官方说明。
- 百度千帆AI助手文档:官方文档,介绍百度集成搜索的企业级AI助手、记忆、对话及文件服务。
- 百度App官方下载页面:百度官方应用介绍,描述集成文心一言助手及深度研究功能。
- 百度文心AgentBuilder文档:在百度文心生态中构建智能体的官方文档。
总结
百度文心一言助手在SuperCLUE 2026年8月XClaw快照中排名第一,获得97.62分,其中记忆能力满分100分,数据处理、内容创作和研究分析得分均超过96分。
这一结果紧随7月PinchBench v2排行榜快照,彼时百度的猎户座任务模式取得了94.6%的最佳得分和94.4%的平均得分。两项基准测试任务不同,但都强调实际任务完成情况,而非简单的问答能力。
最重要的启示并非某个助手已永久“赢得”智能体竞赛。智能体排名变化迅速,且被测系统包含模型、工具、搜索、记忆、提示词及编排等多个环节。
两项结果共同表明,AI评测正转向更务实的标准:不在于模型听起来是否聪明,而在于智能体能否完成任务并交付可用的成果。