Помощник Baidu Wenxin возглавил SuperCLUE XClaw после лидерства в PinchBench v2
Помощник Baidu Wenxin занял первое место в очередном агентском бенчмарке. В продуктовой оценке XClaw от SuperCLUE за август 2026 года помощник Wenxin получил общий балл 97

Помощник Baidu Wenxin занимает первое место в SuperCLUE XClaw после лидерства в PinchBench v2
Введение
Помощник Baidu Wenxin занял первое место в очередном агентном бенчмарке.
В оценке продукта XClaw от SuperCLUE за август 2026 года помощник Wenxin получил общий балл 97,62 — самый высокий результат в опубликованном срезе данных.
Его оценки по категориям составили:
| Способность | Балл |
|---|---|
| Программирование | 90,28 |
| Создание контента | 99,44 |
| Обработка данных | 98,86 |
| Исследовательский анализ | 96,44 |
| Память | 100,00 |
Этот результат был получен менее чем через три недели после другого сильного выступления.
В июльском срезе PinchBench v2 агент задач Baidu — представленный как Orion Mission Mode — зафиксировал 94,6% лучшего результата и 94,4% среднего результата, что поставило его на вершину этого среза рейтинга.
Эти два бенчмарка различаются. SuperCLUE XClaw фокусируется на китайских агентных продуктах и практических результатах по пяти направлениям способностей. PinchBench v2, созданный Kilo, построен вокруг реальных компьютерных задач и задач автоматизации.
Вместе они указывают на один и тот же сдвиг:
Оценка агентов переходит от вопроса «Может ли модель ответить правильно?» к вопросу «Может ли система выполнить задачу и предоставить полезный результат?»
Языковая модель может знать ответ и всё равно потерпеть неудачу как агент, потому что она забывает требования, выбирает неправильный инструмент, неверно обрабатывает файлы, останавливается на полпути в рабочем процессе или возвращает неправильный артефакт.
Это делает последние результаты Wenxin больше связанными с выполнением задач, чем с чистой интеллектуальной мощью языковой модели.

Помощник Wenxin занимает первое место в SuperCLUE XClaw
SuperCLUE описывает XClaw как продукто-ориентированную оценку для ИИ-ассистентов в стиле «Claw».
Вместо того чтобы полагаться в основном на вопросы с множественным выбором, бенчмарк делает акцент на готовых результатах.
Срез за август 2026 года ранжирует ведущие продукты следующим образом:
| Ранг | Продукт | Балл |
|---|---|---|
| 1 | Помощник Baidu Wenxin | 97,62 |
| 2 | MiMoClaw | 96,74 |
| 3 | WorkBuddy | 96,61 |
| 4 | KimiClaw | 96,01 |
| 5 | MaxClaw | 94,79 |
Бенчмарк оценивает пять направлений:
- Обработка данных.
- Создание контента.
- Память.
- Программирование.
- Исследовательский анализ.
Базовая логика проста: агент получает задачу и должен создать конечный артефакт или результат, который можно объективно оценить.
Это делает следование инструкциям, работу с файлами, использование инструментов и выполнение длительных операций частью оценки.

Память достигает 100
Самый заметный показатель категории — 100.00 по памяти.
Память важна, потому что реальная работа редко умещается в один изолированный запрос.
Пользователь может задать ограничения в начале разговора и ожидать, что агент будет их соблюдать значительно позже.
Например:
Шаг 1:
Используй только данные за Q2 2026 года.
Шаг 3:
Сократи отчёт до 10 страниц.
Шаг 6:
Используй ту же сегментацию продуктов, что и в таблице.
Шаг 10:
Создай итоговый документ Word.
Агент, который забывает первую инструкцию, может выдать отполированный, но непригодный результат.
Таким образом, память влияет на:
- Сохранение требований.
- Многошаговое планирование.
- Последовательность.
- Переработку.
- Доверие пользователя.
- Выполнение длительных задач.
Идеальный балл по категории в одном бенчмарке не означает, что продукт никогда не забудет информацию в произвольных реальных сценариях. Это показывает, что Wenxin продемонстрировал исключительные результаты на задачах памяти, включённых в эту оценку XClaw.
Обработка данных: 98.86
Ассистент Wenxin получил 98.86 за обработку данных.
Источник описывает эту категорию как проверку способности системы интерпретировать поля, объединять информацию, сохранять числовую точность и создавать структурированные результаты.
Это обманчиво сложные задачи.
Обычная чат-модель может хорошо резюмировать таблицу, но при этом допустить одну тонкую ошибку в:
- Фильтре по датам.
- Промежуточном итоге.
- Поиске между листами.
- Конвертации единиц.
- Десятичном значении.
- Сопоставлении категорий.
Для бизнес-использования одно неверное число может сделать недействительным весь документ.
Издатель источника протестировал Wenxin с файлом информации о компании и попросил создать бизнес-план за Q2 2026 года в виде документа Word.
Согласно записи теста, агент:
- Использовал Pandoc для извлечения загруженного файла.
- Структурировал исходную информацию.
- Загрузил возможность работы с Word.
- Создал форматированный документ.
- Вернул документ, содержащий более 6000 китайских символов и 148 абзацев.

Это показывает разницу между чатом и работой агента.
Чат-модель может написать план прямо в диалоге.
Агентный рабочий процесс может сделать следующее:
Прочитать исходный файл
→ извлечь структурированную информацию
→ подготовить черновик
→ отформатировать документ Word
→ проверить результат
→ вернуть файл
Артефакт, а не прозаический ответ, становится конечным продуктом.
Создание контента: 99.44
Wenxin получил 99.44 за создание контента.
В агентном бенчмарке создание контента — это не просто творческое письмо.
Системе может потребоваться одновременно удовлетворить несколько ограничений:
- Требуемый формат.
- Тон.
- Объём.
- Структура разделов.
- Аудитория.
- Тип файла.
- Фактическая обоснованность.
- Визуальное представление.
Черновик может быть грамматически корректным и всё равно не пройти, потому что он
игнорирует запрошенный формат.
Именно поэтому бенчмарки продуктов всё чаще оценивают завершённость, а не только лингвистическое качество.
Кодинг — 90.28
Самый низкий показатель Wenxin по категории XClaw — кодинг — составил 90.28.
Это по-прежнему сильный результат, однако разрыв по сравнению с созданием контента и обработкой данных показателен.
Кодинг-агентам приходится управлять более широким операционным циклом:
Понять требование
→ выбрать стек
→ написать файлы
→ запустить или просмотреть
→ проверить ошибки
→ исправить
→ проверить взаимодействие
→ упаковать результат
Издатель источника протестировал продукт с помощью запроса в одно предложение на 3D-симулятор Солнечной системы.
В описанном рабочем процессе использовался Three.js, и результатом стало HTML-приложение в одном файле размером 31 КБ.
В статье также показана обучающая страница по симуляции погоды, созданная с помощью аналогичного интерактивного веб-процесса.
Это иллюстративные демонстрации, а не официальные позиции бенчмарка XClaw.

Анализ исследований — 96.44
Wenxin получил 96.44 в категории анализа исследований.
Серьёзная исследовательская задача может включать:
- Понимание вопроса.
- Разбиение его на подвопросы.
- Поиск по нескольким источникам.
- Оценку качества источников.
- Сравнение противоречащих утверждений.
- Проверку дат.
- Извлечение числовых значений.
- Построение структурированной аргументации.
- Добавление цитат.
- Подготовку отчёта.
В исходной статье описано два тестовых случая.
Исследование трёхмерной проблемы Какеи
Издатель попросил Wenxin исследовать трёхмерную гипотезу Какеи в контексте лауреата Филдсовской премии Хун Ван.
Согласно описанию, поведение агента было следующим:
- Составить план исследовательского процесса из шести шагов.
- Запустить несколько субагентов параллельно.
- Найти 16 академических источников.
- Подготовить документ в Markdown.
- Создать интерактивный HTML-результат размером 62 КБ.

Количество источников само по себе не является показателем качества.
Важно то, использует ли конечный агент авторитетные источники, корректно ли атрибутирует утверждения, разрешает ли противоречия, избегает ли устаревших данных и отделяет ли факты от интерпретации.
Сравнение последних моделей ИИ и цен
Издатель также попросил Wenxin проанализировать возможности и цены основных отечественных и зарубежных моделей за предыдущий месяц.
Согласно статье, агент:
- Загрузил навык отраслевого исследования.
- Изучил 45 источников в два раунда.
- Обнаружил неопределённость в некоторых ключевых показателях.
- Провёл дополнительный целенаправленный поиск по 29 источникам.
- Перекрёстно проверил цены.
- Подготовил отчёт объёмом примерно 7000 китайских иероглифов с графиками.

Полезный цикл исследования выглядит так:
Поиск
→ выявление неопределённости
→ повторный поиск
→ сравнение источников
→ устранение разногласий или их маркировка
→ написание
Именно этот дополнительный этап проверки часто и повышает качество исследования.
Второе первое место: PinchBench v2
Результат SuperCLUE стал продолжением июльского первого места в бенчмарке PinchBench v2.
PinchBench был создан компанией Kilo для оценки агентов на реальных рабочих сценариях, а не на традиционных бенчмарках типа «вопрос — ответ».
Релиз PinchBench 2.0 от Kilo расширил бенчмарк до 148 задач и добавил более строгие правила оценки и рейтингования.
В июльском срезе лидерборда, воспроизведённом в статье-источнике, система Baidu была представлена как:
Orion-Mission-Mode
с показателями:
Лучший результат: 94,6%
Средний результат: 94,4%

На скриншоте Orion Mission Mode опережает системы, основанные на моделях от Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI и других, в данном конкретном срезе.
Ключевое слово здесь — срез.
Рейтинги агентов меняются стремительно.
Модели, конфигурации тестирования, промпты, правила использования инструментов и заявки на участие в бенчмарке — всё это может обновляться.
Таким образом, июльский результат первого места следует указывать с привязкой к дате, а не рассматривать как постоянный глобальный рейтинг.
Что именно тестирует PinchBench v2
Kilo описывает PinchBench 2.0 как бенчмарк реальных рабочих сценариев для агентов.
Он содержит задачи, требующие от системы использования инструментов и выполнения операций, а не просто выбора ответа.
Бенчмарк охватывает такие категории, как:
- Написание текстов.
- Творческая работа.
- Анализ данных.
- Исследовательская и аналитическая работа.
- Код и операции.
- Другие компьютерные сценарии работы.
В статье-источнике указано, что в срезе лидерборда было представлено 59 моделей или агентов.
Это число может меняться по мере добавления или обновления заявок.
Сам бенчмарк более стабилен, чем состав лидерборда.
В официальном релизе PinchBench 2.0 указано:
148 задач
В источнике и ряде июльских отчётов говорится, что оценка Wenxin проводилась по 147 выполненным задачам, при этом сам PinchBench описывается как бенчмарк на 148 задач.
Наиболее безопасная интерпретация такова:
PinchBench v2 содержит 148 задач; в отчётной оценке Orion Mission Mode в данном срезе, по всей видимости, были получены результаты по 147 из них.
Это различие важно, поскольку в отчётах по бенчмаркам часто смешивают размер бенчмарка с количеством успешно
завершённые прогоны.
Лучший результат против среднего результата
В источнике подчёркивается, что режим миссии Orion зафиксировал:
94,6% — лучший результат
94,4% — средний результат
Разрыв в 0,2 пункта незначителен.
Это указывает на низкую вариативность по зафиксированным прогонам.
Однако это не следует трактовать как универсальную гарантию стабильности.
Разброс результатов бенчмарка может зависеть от:
- Количества повторений.
- Температуры сэмплирования.
- Доступности инструментов.
- Внешних веб-сайтов.
- Состояния сети.
- Поведения оценивающей системы.
- Тайм-аутов агента.
- Обновлений модели.
Практический вывод прост: зафиксированный прогон PinchBench не строился вокруг одного изолированного удачного результата.
Его средний показатель остался близким к лучшему результату.
Агент — это больше, чем базовая модель
Один из важнейших моментов в статье-источнике заключается в том, что бенчмарк оценивает продукт или агентную систему, а не «голую» языковую модель.
Агент задачи может объединять:
- Базовую модель.
- Поиск.
- Память.
- Работу с файлами.
- Выбор инструментов.
- Планирование.
- Субагентов.
- Навыки создания документов.
- Доступ к браузеру или интернету.
- Выполнение кода.
- Проверку результатов.
Это можно выразить так:
Результат агента
=
возможности модели
+
инструменты
+
память
+
планирование
+
поиск
+
среда выполнения
+
верификация
Именно поэтому стоит быть осторожным с утверждениями вида:
«Модель X превзошла модель Y».
Лидерборд на самом деле может сравнивать два разных агентных стека, использующих разные инструменты и оркестрацию.
Более точная формулировка:
«Агентная система X набрала больше баллов, чем агентная система Y, в рамках данной конфигурации бенчмарка».
Такая формулировка становится всё более важной по мере того, как ИИ-продукты превращаются в сложные программные системы.
От ответов на вопросы к выполнению работы
В статье-источнике 2026 год обозначен как год, в котором стандарт полезного ИИ-продукта меняется.
Прежний сценарий взаимодействия выглядел так:
Пользователь спрашивает
→ модель отвечает
→ пользователь выполняет работу
Новый агентный паттерн выглядит так:
Пользователь ставит цель
→ агент планирует
→ агент собирает контекст
→ агент вызывает инструменты
→ агент создаёт файлы
→ агент проверяет результаты
→ агент предоставляет результат
Это меняет то, что замечают пользователи.
Модель может быть чрезвычайно эрудированной, но вызывать раздражение, если она не может:
- Запомнить более ранние требования.
- Открыть файл.
- Отформатировать таблицу.
- Создать запрошенный документ.
- Довести все шаги до конца.
- Исправить собственные ошибки.
Новое условие успеха ближе к:
Была ли задача фактически выполнена?
чем к:
Был ли ответ впечатляющим?
Точка входа задачи в Wenxin
В статье BAAI показана опция «Задача» прямо в интерфейсе Wenxin.

Официальный сайт Baidu Wenxin описывает продукт как мультимодального ИИ-ассистента для:
- Надёжного творчества.
- Глубокого поиска.
- Интеллектуального использования инструментов.
- Работы с документами.
- Письма.
- Изображений.
Кроссплатформенное использование.
Приложение Baidu также включает Wenxin Assistant как встроенную AI-функцию для углублённого исследования, поиска, написания текстов, генерации изображений и видео, а также разговорной помощи.
Это подтверждает, что ориентированные на задачи AI-решения перешли в основные потребительские интерфейсы Baidu, а не остались экспериментом только для разработчиков.
Действительно ли Wenxin Assistant бесплатен и без ограничений?
В исходной статье неоднократно подчёркивается один коммерческий момент:
Wenxin Assistant бесплатен и не имеет платного доступа.
Официальные страницы Baidu для Wenxin в настоящее время предлагают бесплатный доступ или бесплатное ознакомление.
Это легко проверить.
Более сильное утверждение — постоянно без ограничений для всех функций задач-агентов — сложнее подтвердить стабильной официальной страницей политики.
AI-продукты могут вводить:
- Ежедневные квоты.
- Ограничения на параллельность.
- Ограничения для конкретных функций.
- Временные акции.
- Уровни аккаунтов.
- Региональные ограничения.
- Будущие изменения цен.
Для публикации более безопасная формулировка:
Wenxin Assistant в настоящее время доступен индивидуальным пользователям с бесплатными вариантами доступа, и демонстрация задач, показанная в исходной статье, не требовала платной подписки.
Не стройте долгосрочное сравнение затрат на основе «бессрочно без ограничений», если Baidu не опубликует конкретную политику, гарантирующую это.
Почему поисковый опыт может помочь агенту
Заключительный раздел исходной статьи утверждает, что поисковая история Baidu даёт ей структурное преимущество в разработке агентов.
Здесь есть реальная аналогия.
Поисковая система обрабатывает примерно следующее:
Пользовательский запрос
→ понимание намерения
→ декомпозиция запроса
→ извлечение
→ ранжирование
→ агрегация результатов
→ ответ
Агент обрабатывает:
Цель пользователя
→ понимание намерения
→ декомпозиция задачи
→ выбор инструмента
→ выполнение
→ агрегация результатов
→ доставка
Эти два конвейера не идентичны.
У агента гораздо большее пространство действий и выше риск выполнения.
Но несколько технических возможностей переносятся естественным образом:
- Понимание намерения.
- Переписывание запроса.
- Извлечение информации.
- Ранжирование источников.
- Контекст сессии.
- Обработка актуальности.
- Дедупликация.
- Агрегация доказательств.
Это особенно актуально для исследовательских агентов.
Система, которая уже имеет мощную поисковую инфраструктуру, может строить более глубокие рабочие процессы на её основе.
Понимание поисковых запросов против понимания задач агента
Рассмотрим традиционный поисковый запрос:
Найди самый дешёвый рейс из Пекина в Шанхай.
Поисковой системе может потребоваться определить:
- Пункт отправления.
- Пункт назначения.
- Даты поездки.
- Предпочтения по цене.
- Доступные рейсы.
- Порядок сортировки.
Когда агенту задают:
Найди самый дешёвый рейс Пекин–Шанхай и подготовь маршрут.
может потребоваться добавить:
- Выбор инструмента.
- Несколько поисков.
- Сравнение.
- Проверку ограничений.
- Генерацию файлов.
- Возможно, шаг с календарём или бронированием.
Первая половина задачи напоминает поиск.
Вторая половина — это оркестрация действий.
Поисковый опыт даёт полезные компоненты, но качество агента всё равно зависит от уровня выполнения.
Память и поисковые сессии связаны — но не одно и то же
В источнике также связывается оценка памяти Wenxin с опытом Baidu в понимании поисковых сессий.
некоторое концептуальное пересечение.
Обеим системам необходимо определять, какая информация из более ранних взаимодействий остаётся актуальной.
Сеанс поиска может содержать:
Запрос 1: электромобили
Запрос 2: запас хода более 600 км
Запрос 3: до 250 000 юаней
Система должна понимать, что третий запрос по-прежнему касается электромобилей.
Система памяти агента решает более сложную задачу.
Ей может потребоваться запоминать:
- Предпочтения пользователя.
- Ограничения задачи.
- Факты, извлечённые из файлов.
- Решения.
- Результаты работы инструментов.
- Временное состояние.
- Долгосрочные предпочтения.
Опыт в области поисковых сессий полезен, но постоянная память агента требует дополнительных механизмов хранения, извлечения, конфиденциальности и релевантности.
Анализ исследований — область, где поисковый стек Baidu наиболее напрямую применим
Среди пяти категорий XClaw анализ исследований — это самое очевидное место, где поисковый опыт Baidu может быть напрямую перенесён.
Исследовательскому агенту необходимы:
- Охват поиска.
- Актуальная информация.
- Расширение запросов.
- Ранжирование.
- Обработка цитирования.
- Сравнение источников.
- Понимание сущностей.
- Многоязычный поиск.
Официальная документация Baidu Qianfan AI Assistant также описывает корпоративное решение для агентов, интегрирующее поиск Baidu, энциклопедию Baidu Baike, поиск по изображениям, управление диалогами, управление памятью и работу с документами.
Это не доказывает, что потребительский продукт Wenxin использует ту же самую реализацию.
Но это показывает, что Baidu строит общий стек для агентов на основе поиска, памяти, инструментов и мультимодального поиска во всей линейке своих продуктов.
Чего не доказывают две победы в бенчмарках
Высокие результаты в бенчмарках — это полезное свидетельство.
Но они не являются полной оценкой.
Они не доказывают постоянное глобальное лидерство
Рейтинги меняются.
Новые модели и новые submissions агентов могут обогнать текущего лидера.
Они не доказывают, что каждая задача получит 97%
XClaw объединяет выбранные задачи и категории.
Реальный рабочий процесс пользователя может сильно отличаться.
Они не изолируют базовую модель
Результат принадлежит полному стеку ассистента или агента.
Они не оценивают все вопросы безопасности
Агент, который эффективно выполняет задачи, всё равно может совершать опасные вызовы инструментов или раскрывать конфиденциальную информацию в другой среде.
Они не гарантируют фактическую точность
Исследовательские агенты могут ссылаться на слабые источники или неверно интерпретировать изменяющиеся данные.
Они не доказывают безлимитное бесплатное использование
Цены на продукты и квоты — это коммерческие политики, а не свойства бенчмарков.
Как самостоятельно оценить Wenxin Assistant
Полезный личный тест должен соответствовать вашей реальной работе.
Не задавайте только вопросы на эрудицию.
Дайте агенту полную задачу.
Тест 1: Память
В начале длинного разговора укажите пять ограничений.
После нескольких посторонних реплик попросите итоговый артефакт и проверьте, сохранены ли все пять.
Тест 2: Обработка данных
Загрузите:
- Электронную таблицу.
- PDF-файл.
- Короткий текстовый файл.
Попросите агента объединить их в один отчёт.
Самостоятельно проверьте каждое числовое значение.
Тест 3: Исследование
Выберите тему с изменяющейся информацией.
Потребуйте:
- Первичные источники.
- Даты публикации.
- Сравнение конфликтующих источников.
- Прямые ссылки.
- Список сомнительных утверждений.
Тест 4: Документ
Создание
Запросите артефакт Word, PowerPoint, электронную таблицу или HTML.
Оценка:
- Структура.
- Форматирование.
- Полнота.
- Возможность загрузки.
- Открывается ли файл на самом деле.
Тест 5: Программирование
Запросите небольшое интерактивное приложение.
Проверка:
- Запускается ли оно.
- Присутствуют ли все запрошенные функции.
- Исправлены ли ошибки.
- Является ли итоговый файл автономным, если это запрашивалось.
Тест 6: Долгосрочное выполнение
Дайте задание, требующее использования нескольких инструментов.
Понаблюдайте, как система:
- Составляет план.
- Выбирает разумные инструменты.
- Восстанавливается после сбоев.
- Избегает повторной работы.
- Проверяет конечный результат.
Лучший способ сравнения агентных продуктов
При сравнении Wenxin с другими агентами используйте таблицу более широкую, чем «оценка бенчмарка».
| Измерение | Что оценивать |
|---|---|
| Успешность задачи | Была ли запрошенная работа завершена? |
| Память | Сохранялись ли ранее заданные ограничения? |
| Точность | Корректны ли числа и утверждения? |
| Качество исследований | Являются ли источники авторитетными и актуальными? |
| Надёжность инструментов | Успешны ли вызовы инструментов последовательно? |
| Качество артефактов | Можно ли использовать файлы без ручного исправления? |
| Восстановление | Может ли агент исправить неудачные шаги? |
| Задержка | Сколько времени занимает выполнение полной задачи? |
| Стоимость | Сколько стоит один принятый результат? |
| Конфиденциальность | Как обрабатываются загруженные файлы и память? |
| Доступность | Бесплатны ли ключевые функции, ограничены ли квотой или платны? |
Это даёт более реалистичную картину, чем одна позиция в рейтинге.
Более масштабный сдвиг: «Способен ли он выполнить задачу?»
Ключевой момент исходной статьи шире, чем Baidu.
Конкуренция агентов меняет определение качества ИИ.
Для первого поколения чат-ботов пользователи сосредотачивались на качестве ответов.
Для современных агентов задач ключевыми становятся следующие вопросы:
- Может ли он удерживать контекст?
- Может ли он найти нужную информацию?
- Может ли он управлять инструментами?
- Может ли он создать файл?
- Может ли он завершить многошаговый рабочий процесс?
- Может ли он проверить собственный результат?
- Могу ли я доверить ему повторяющуюся работу?
Именно поэтому бенчмарки, такие как XClaw и PinchBench, привлекают внимание.
Они приближают оценку к реальной производственной работе.
Между бенчмарком и корпоративным внедрением всё ещё огромная дистанция.
Но направление полезно:
Бенчмарк знаний
→ бенчмарк рассуждений
→ бенчмарк использования инструментов
→ сквозной бенчмарк задач
→ реальный производственный результат
Последний шаг в конечном счёте — тот, который имеет значение.
Часто задаваемые вопросы
Какой результат получил ассистент Baidu Wenxin в SuperCLUE XClaw?
Снимок SuperCLUE XClaw за август 2026 года даёт ассистенту Wenxin общий балл 97,62, что ставит его на первое место среди представленных продуктов. Его категориальные баллы составили 90,28 по программированию, 99,44 по созданию контента, 98,86 по обработке данных, 96,44 по исследовательскому анализу и 100 по памяти.
Что означает результат 100 по памяти?
Это означает, что Wenxin получил полные баллы за задания на память, включённые в эту оценку XClaw. Это не означает, что ассистент никогда не может забыть контекст в любом возможном реальном разговоре.
Что такое PinchBench v2?
PinchBench v2 — это агентный бенчмарк, созданный Kilo, который оценивает системы на реальных компьютерных задачах и рабочих процессах. Версия 2.0 содержит 148 заданий и разработана для измерения
сквозное выполнение, а не просто ответы на вопросы.
Какой результат Wenxin показала в PinchBench v2?
В срезе рейтинга за июль 2026 года агент задач Baidu появился как Orion Mission Mode с лучшим результатом 94,6% и средним результатом 94,4%. Рейтинги меняются со временем, поэтому при цитировании результата следует указывать дату среза.
Полностью ли бесплатен Wenxin Assistant?
Официальные страницы Baidu, посвящённые Wenxin, в настоящее время предлагают варианты свободного доступа или бесплатного ознакомления, а в исходной статье указано, что продемонстрированные функции задач были доступны без платной подписки. Стабильной официальной гарантии бессрочного неограниченного использования всех функций обнаружено не было, поэтому текущие лимиты следует проверять непосредственно в продукте.
Может ли Wenxin Assistant создавать документы Word и веб-страницы?
В исходной статье показаны тестовые сессии, в ходе которых Wenxin создал отформатированный бизнес-план в Word и интерактивные HTML-страницы. Эти примеры демонстрируют рабочий процесс задач продукта, но не гарантируют, что каждый запрос или окружение дадут одинаковый результат.
Почему поисковые технологии Baidu могут помочь её ИИ-агентам?
Поиск и агенты используют общие возможности, такие как понимание намерений, декомпозиция запросов, поиск, ранжирование, агрегация источников и контекст сессии. Агенты добавляют более широкий уровень выполнения, включая вызовы инструментов, создание файлов, память, планирование и действия.
Являются ли XClaw и PinchBench эталонами для моделей?
Не в узком смысле. Они оценивают продукты или агентные системы, которые могут сочетать модели с инструментами, памятью, поиском, промптами, оркестрацией и средами выполнения. Поэтому их результаты следует относить к полной конфигурации агента.
Связанные инструменты
- Baidu Wenxin: официальный мультимодальный ИИ-ассистент Baidu для поиска, творчества, документов и выполнения задач.
- SuperCLUE XClaw: ориентированный на продукт китайский бенчмарк агентов, указанный в исходной статье.
- PinchBench: реальный бенчмарк Kilo для рабочих процессов агентов, связанных с программированием и использованием компьютера.
- Pandoc: инструмент преобразования документов, используемый в тестовом процессе исходной статьи для извлечения и преобразования содержимого документов.
- Three.js: библиотека JavaScript для 3D-графики, используемая в сгенерированном примере Солнечной системы из исходной статьи.
- Baidu Qianfan: корпоративная платформа Baidu для моделей, агентов, данных и разработки ИИ-приложений.
- Baidu AgentBuilder: платформа Baidu для создания и публикации пользовательских агентов на основе Wenxin.
Связанные ссылки
Официальный сайт Baidu Wenxin: текущая официальная точка входа в продукт Wenxin Assistant для веб-версии и загружаемых клиентов.
Настольный ассистент Baidu Wenxin: официальная страница для настольной версии, демонстрирующая анализ документов, поиск, создание, экспорт и бесплатное ознакомление.
[SuperCLUE XClaw, август 2026
SuperCLUE-XClaw 产品评测: 原始文章引用的基准测试页面。
Kilo: PinchBench 2.0 已发布: 关于 PinchBench v2 的 148 项任务、评分变化、并行评审和排行榜设计的官方说明。
百度千帆 AI 助手文档: 官方文档,描述了百度集成了搜索的企业级 AI 助手、记忆、对话和文件服务。
百度 App 官方下载页面: 百度官方应用页面,介绍了集成的文心助手和深度研究功能。
百度文心智能体构建器文档: 在百度文心生态中构建智能体的官方文档。
总结
百度文心助手在 SuperCLUE 2026 年 8 月的 XClaw 快照中排名第一,获得 97.62 分,其中记忆能力满分 100 分,数据处理、内容创作和研究分析得分均超过 96 分。
这一成绩紧随 7 月 PinchBench v2 排行榜快照中百度 Orion 任务模式 取得的 94.6% 最佳得分和 94.4% 平均分。两个基准测试使用不同的任务,但都强调实际任务完成情况,而非简单的问答能力。
最重要的结论并不是某个助手已经永久“赢得”了智能体竞赛。智能体排名变化很快,被测系统包括模型、工具、搜索、记忆、提示词和编排能力。
这两个结果真正表明的是,AI 评估正在转向更实际的标准:不是模型听起来是否智能,而是智能体能否完成工作并交回可用的结果。