바이두 원신 어시스턴트, PinchBench v2 1위에 이어 SuperCLUE XClaw에서도 정상 등극

바이두 원신 어시스턴트가 또 다른 에이전트 스타일 벤치마크에서 1위를 차지했습니다. SuperCLUE의 2026년 8월 XClaw 제품 평가에서 원신 어시스턴트는 종합 점수 97점을 받았습니다.

发布于 2026年8月7日generalGEO 评分: 05 次阅读
바이두 원신 어시스턴트, PinchBench v2 1위에 이어 SuperCLUE XClaw에서도 정상 등극

바이두 원신 어시스턴트, PinchBench v2 1위에 이어 SuperCLUE XClaw 정상 등극

서론

바이두 원신 어시스턴트가 또 다른 에이전트형 벤치마크에서 1위를 차지했다.

SuperCLUE의 2026년 8월 XClaw 제품 평가에서 원신 어시스턴트는 종합 점수 97.62점을 기록하며 공개된 스냅샷 중 가장 높은 점수를 받았다.

카테고리별 점수는 다음과 같다:

역량 점수
코딩 90.28
콘텐츠 창작 99.44
데이터 처리 98.86
연구 분석 96.44
메모리 100.00

이 결과는 앞선 강력한 성과가 나온 지 3주도 채 지나지 않아 도출됐다.

7월 PinchBench v2 스냅샷에서 바이두의 태스크 에이전트는 오리온 미션 모드라는 이름으로 제출되어 94.6% 최고 점수94.4% 평균 점수를 기록하며 해당 리더보드 스냅샷의 정상에 올랐다.

두 벤치마크는 서로 다르다. SuperCLUE XClaw는 중국어 에이전트 제품과 5개 역량 차원에 걸친 실용적 산출물에 초점을 맞춘다. Kilo가 만든 PinchBench v2는 실제 컴퓨터 및 자동화 작업을 중심으로 설계됐다.

두 벤치마크가 함께 가리키는 변화는 분명하다:

에이전트 평가는 "모델이 정확하게 답변할 수 있는가?"에서 "시스템이 작업을 끝까지 완수하고 실용적인 결과물을 제공할 수 있는가?"로 이동하고 있다.

언어 모델은 정답을 알고 있어도 에이전트로서 실패할 수 있다. 요구사항을 잊어버리거나, 잘못된 도구를 선택하거나, 파일을 잘못 처리하거나, 워크플로우 중간에 멈추거나, 잘못된 산출물을 반환하기 때문이다.

따라서 이번 원신의 최신 결과는 순수한 언어 모델 지능보다 작업 실행 능력에 더 초점이 맞춰져 있다.

이 이미지는 SuperCLUE XClaw 랍스터 제품 평가의 2026년 8월 평균 점수 순위표로, 평가에 참여한 각 제조사 제품의 순위와 점수를 명확히 보여준다. 바이두 원신 어시스턴트가 97.62점으로 1위, 샤오미 MiMoClaw가 96.74점으로 2위, 텐센트 WorkBuddy와 문샷 AI KimiClaw가 각각 96.61점, 96.01점으로 뒤를 이었으며, 시유 테크놀로지 MaxClaw가 94.79점으로 3위를 기록했다. 페이지에는 순위의 산출 기준과 데이터 배치 등 정보가 표시되어 있으며, 각 제품의 중국어 지능 제품 평가에서의 역량을 직관적으로 보여준다. 이는 문서에서 언급한 원신 어시스턴트가 SuperCLUE XClaw 평가에서 최고 점수를 받았다는 내용과 대응된다.

원신 어시스턴트, SuperCLUE XClaw 1위 달성

SuperCLUE는 XClaw를 "Claw" 스타일 AI 어시스턴트를 위한 제품 중심 평가로 설명한다.

주로 객관식 문제에 의존하기보다, 이 벤치마크는 완성된 산출물을 중시한다.

2026년 8월 스냅샷의 주요 제품 순위는 다음과 같다:

순위 제품 점수
1 바이두 원신 어시스턴트 97.62
2 MiMoClaw 96.74
3 WorkBuddy 96.61
4 KimiClaw 96.01
5 MaxClaw 94.79

벤치마크는 5개 차원을 평가한다:

  1. 데이터 처리.
  2. 콘텐츠 창작.
  3. 메모리.
  4. 코딩.
  5. 연구 분석.

기본 로직은 단순하다: 에이전트가 작업을 받고 실제로 평가 가능한 최종 산출물 또는 결과를 생성해야 한다.

따라서 지시 이행, 파일 처리, 도구 사용, 장기 실행 능력이 점수에 포함된다.

![이 이미지는 Baidu Wenxin Assistant의 SuperCLUE XClaw 역량 차원(평균 점수) 순위를 보여준다. 코드 개발, 콘텐츠 창작, 데이터 처리, 연구 분석, 메모리 능력 5개 차원에서 각각 90.28, 99.44, 98.86, 96.44, 100.00점을 기록했다. 이 이미지는 앞서 언급한 SuperCLUE XClaw가 "Claw" 스타일 AI 어시스턴트를 위한 제품 중심 평가라는 점과 대응되며, Baidu Wenxin Assistant의 평가 시스템 내 성과를 직관적으로 보여줘 SuperCLUE XClaw 1위 달성에 데이터 기반을 제공한다.](https://we0-cms.oss-cn-beijing.aliyuncs.

메모리 100점 달성

가장 눈에 띄는 카테고리 점수는 메모리 부문 100.00점입니다.

메모리가 중요한 이유는 실제 업무가 단일 프롬프트 안에 들어오는 경우가 드물기 때문입니다.

사용자는 대화 초반에 제약 조건을 제시하고, 에이전트가 훨씬 나중에까지 이를 존중하기를 기대할 수 있습니다.

예를 들어:

턴 1:
2026년 2분기 데이터만 사용하세요.

턴 3:
보고서를 10페이지 미만으로 유지하세요.

턴 6:
스프레드시트와 동일한 제품 세분화를 사용하세요.

턴 10:
최종 Word 문서를 생성하세요.

첫 번째 지시를 잊어버린 에이전트는 정교하지만 사용할 수 없는 결과물을 만들 수 있습니다.

따라서 메모리는 다음에 영향을 미칩니다:

  • 요구사항 유지
  • 다단계 계획 수립
  • 일관성
  • 재작업
  • 사용자 신뢰
  • 장기 실행 작업 완료

하나의 벤치마크에서 완벽한 카테고리 점수를 받았다고 해서 실제 세계의 임의 세션에서 정보를 절대 잊지 않는다는 의미는 아닙니다. 다만 이번 XClaw 평가에 포함된 메모리 작업에서 Wenxin이 매우 우수한 성능을 보였음을 나타냅니다.

데이터 처리 98.86점

Wenxin 어시스턴트는 데이터 처리 부문에서 98.86점을 받았습니다.

소스 자료에서는 이 카테고리가 시스템이 필드를 해석하고, 정보를 결합하며, 숫자 정밀도를 유지하고, 구조화된 출력을 생성할 수 있는지 테스트하는 것이라고 설명합니다.

이것은 겉보기보다 어려운 작업들입니다.

일반 챗 모델은 스프레드시트를 잘 요약하면서도 다음과 같은 부분에서 미묘한 오류를 범할 수 있습니다:

  • 날짜 필터
  • 소계
  • 시트 간 조회
  • 단위 변환
  • 소수 값
  • 카테고리 매핑

비즈니스 용도에서는 하나의 잘못된 숫자가 전체 문서를 무효화할 수 있습니다.

테스트 게시자는 회사 정보 파일로 Wenxin을 테스트하고 2026년 2분기 사업 계획서를 Word 문서로 생성하도록 요청했습니다.

테스트 기록에 따르면 에이전트는:

  1. Pandoc을 사용하여 업로드된 파일을 추출했습니다.
  2. 소스 정보를 구조화했습니다.
  3. Word 처리 기능을 로드했습니다.
  4. 서식이 지정된 문서를 생성했습니다.
  5. 6,000자 이상의 중국어 문자와 148개의 단락이 포함된 문서를 반환했습니다.

이 이미지는 바이두 원신 어시스턴트가 에이전트로서 사업 계획서 생성 작업을 완료한 테스트 결과를 보여줍니다. 이미지 상단에는 사용자가 에이전트에게 AI 스마트 하드웨어 스타트업 '지씬웨이라이'를 위한 2026년 2분기 사업 계획서를 작성하고 Word 문서로 생성하며 지정된 섹션 요구사항을 충족하라는 지시를 내린 것이 표시됩니다. 이미지 하단에는 작업 실행 결과가 표시되어 관련 Word 문서가 성공적으로 생성되었고, 문서는 약 6,000자, 148개 단락으로 구성되어 분량 요구사항을 충족하고 검증을 통과했으며, 문서 다운로드 옵션도 제공됩니다. 이는 데이터 처리 및 구조화된 콘텐츠 생성에 있어 원신 어시스턴트의 역량을 직관적으로 보여줍니다.

이는 채팅과 에이전트 작업의 차이를 보여줍니다.

챗 모델은 대화 안에서 계획서를 작성할 수 있습니다.

에이전트 워크플로우는 다음과 같이 할 수 있습니다:

소스 파일 읽기
→ 구조화된 정보 추출
→ 콘텐츠 초안 작성
→ Word 문서 서식 지정
→ 출력 검증
→ 파일 반환

산출물, 즉 문장형 응답이 아닌 결과물이 최종 제품이 됩니다.

콘텐츠 제작 99.44점

Wenxin은 콘텐츠 제작 부문에서 99.44점을 받았습니다.

에이전트 벤치마크에서 콘텐츠 제작은 단순한 창의적 글쓰기가 아닙니다.

시스템은 여러 제약 조건을 동시에 충족해야 할 수 있습니다:

  • 필수 형식
  • 어조
  • 분량
  • 섹션 구조
  • 대상 독자
  • 파일 유형
  • 사실 기반
  • 시각적 표현

초안은 문법적으로 훌륭해도 여전히 실패할 수 있습니다

요청된 형식을 무시합니다.

그래서 제품 벤치마크는 점점 단순한 언어 품질보다는 완성도를 기준으로 점수를 매기고 있습니다.

코딩 점수 90.28

원신(Wenxin)의 XClaw 카테고리 중 가장 낮은 점수는 코딩 부문의 90.28이었습니다.

그래도 강력한 점수이지만, 콘텐츠 제작 및 데이터 처리와의 격차는 시사하는 바가 큽니다.

코딩 에이전트는 더 넓은 운영 루프를 관리해야 합니다:

요구사항 이해
→ 기술 스택 선택
→ 파일 작성
→ 실행 또는 미리보기
→ 오류 확인
→ 수정
→ 상호작용 검증
→ 결과 패키징

출처 게시자는 3D 태양계 시뮬레이터에 대한 한 문장 요청으로 제품을 테스트했습니다.

보고된 워크플로우는 Three.js를 사용했으며 31KB 단일 파일 HTML 애플리케이션을 반환했습니다.

기사는 또한 유사한 인터랙티브 웹 워크플로우를 통해 생성된 날씨 시뮬레이션 교육 페이지도 보여줍니다.

이는 공식 XClaw 벤치마크 항목이 아닌 예시 데모입니다.

이미지는 2026년 2분기 사업계획서 표지로, 배경이 연한 파란색이며 상단에 '지신미래 - 2026년 2분기 사업계획서'라는 문구가 있습니다. 제목은 '2026년 2분기 사업계획서'이고, 부제는 'AI 스마트 하드웨어에 집중: 중국 제조에서 중국 지조로'입니다. 하단에는 회사명 '지신미래 테크놀로지 유한회사'가 표시되어 있으며 기밀 문서로 내부 및 관심 있는 투자자 참고용임을 명시하고 날짜는 2026년 6월입니다. 이 표지는 문서 시작 부분에 위치하여 이후의 AI 스마트 하드웨어 사업계획 내용을 이끌어냅니다.

연구 분석 점수 96.44

원신(Wenxin)은 연구 분석 부문에서 96.44를 받았습니다.

진지한 연구 과제는 다음을 포함할 수 있습니다:

  1. 질문 이해하기.
  2. 하위 질문으로 분해하기.
  3. 여러 출처 검색하기.
  4. 출처 품질 평가하기.
  5. 상충되는 주장 비교하기.
  6. 날짜 확인하기.
  7. 수치 추출하기.
  8. 구조화된 논증 구축하기.
  9. 인용 추가하기.
  10. 보고서 작성하기.

출처 기사는 두 가지 테스트 사례를 설명합니다.

3차원 카케야 문제 연구

게시자는 원신(Wenxin)에게 필즈상 수상자 홍왕(Hong Wang)의 맥락에서 3차원 카케야 추측을 연구하도록 요청했습니다.

보고된 에이전트의 행동은 다음과 같았습니다:

  1. 6단계 연구 프로세스 계획.
  2. 여러 하위 에이전트를 병렬로 실행.
  3. 16개 학술 출처 검색.
  4. Markdown 문서 생성.
  5. 62KB 인터랙티브 HTML 결과 생성.

이 이미지는 원신 어시스턴트가 완료한 최신 필즈상 3차원 카케야 추측 관련 연구 성과를 보여줍니다. 이 연구는 사전에 계획된 6단계 절차에 따라 진행되었으며, 해당 추측의 핵심 정의, 과거 연구 흐름, 혁신적 돌파점을 정리하고 관련 분야의 교차 논리를 분석했으며, 16개의 권위 있는 학술 출처를 수집하여 연구를 완료하고 최종적으로 63.746KB의 Markdown 문서와 62.83KB의 인터랙티브 시각화 HTML 결과 보고서를 생성했습니다. 전체 성과는 문서에서 언급된 3차원 카케야 문제 연구 사례 내용에 직접적으로 대응합니다.

출처의 수는 그 자체로 품질 지표가 아닙니다.

중요한 것은 최종 에이전트가 권위 있는 출처를 사용하고, 주장을 올바르게 귀속시키고, 충돌을 해결하며, 오래된 데이터를 피하고, 사실과 해석을 분리하는지 여부입니다.

최근 AI 모델 및 가격 비교

게시자는 또한 원신(Wenxin)에게 지난달 주요 국내외 모델의 기능과 가격을 분석하도록 요청했습니다.

기사에 따르면 에이전트는 다음과 같이 행동했습니다:

  • 산업 조사 스킬 로드.
  • 두 차례에 걸쳐 45개 출처 검색.
  • 일부 핵심 수치의 불확실성 감지.
  • 29개 출처에 대한 추가 표적 검색 수행.
  • 가격 상호 검증.
  • 차트가 포함된 약 7,000자 분량의 중국어 보고서 생성.

이 이미지는 2026년 7월 국내외 주요 대형 언어 모델(LLM) 역량 분석 및 가격 분석 보고서의 표지입니다. 표지 상단에는 날짜 '2026년 7월'이 표시되어 있고, 중앙에는 '국내외 주요 대형 언어 모델 역량 분석 및 가격 분석 보고서'라는 큰 제목이 있으며, 하단에는 '—Artificial Analysis, LMSYS Arena 및 제조사 공개 데이터 기반 종합 분석—'이라는 작은 설명이 있습니다. 보고서는 논문 표절 검사 표시가 있으며, 페이지는 1/76페이지, 단어 수 6900자입니다. 이 이미지는 문서 내 '국내외 주요 대형 언어 모델 역량 및 가격 분석' 내용과 관련된 보고서 표지입니다.

유용한 연구 루프는 다음과 같습니다:

검색
→ 불확실성 식별
→ 다시 검색
→ 소스 비교
→ 불일치 해결 또는 표시
→ 작성

이 추가 검증 과정은 종종 연구 품질을 향상시키는 지점입니다.

두 번째 1위: PinchBench v2

SuperCLUE 결과는 7월 PinchBench v2 1위에 이어 나온 것입니다.

PinchBench는 Kilo가 전통적인 질문-답변 벤치마크가 아닌 실제 업무 워크플로우에서 에이전트를 평가하기 위해 만든 벤치마크입니다.

Kilo의 PinchBench 2.0 릴리스는 벤치마크를 148개 태스크로 확장했으며, 더 강화된 채점 및 리더보드 규칙을 추가했습니다.

소스 기사에 재현된 7월 리더보드 스냅샷에서 바이두의 시스템은 다음과 같이 표시되었습니다:

Orion-Mission-Mode

다음과 같은 점수와 함께:

최고 점수:    94.6%
평균 점수: 94.4%

이 이미지는 PinchBench v2 관련 시스템 점수 순위 스크린샷으로, 각 AI 시스템의 핵심 지표와 점수를 보여줍니다. 화면에서 주황색 막대는 'Average Score'로 표시되며, 가장 상단의 Orion-Mission-Mode는 평균 점수 94.6%, 94.4%로 1위를 기록해 anthropic/claude-opus-4.1, qwen1.5/3.7-max 등 다른 참가 시스템을 크게 앞섰습니다. 스크린샷에는 각 시스템의 세부 능력 태그(Writing Content, Creative, Data Analysis 등)도 함께 표시되어, 각 모델이 다양한 작업 차원에서 보여준 성과를 직관적으로 보여주며, 문서에서 언급된 원신 어시스턴트가 해당 벤치마크 7월 스냅샷에서 1위를 차지했다는 내용과 일치합니다.

해당 스크린샷은 Orion Mission Mode가 해당 특정 스냅샷에서 Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI 등의 모델 기반 시스템보다 앞선 것으로 보여줍니다.

중요한 단어는 스냅샷입니다.

에이전트 리더보드는 빠르게 변화합니다.

모델, 하네스, 프롬프트, 도구 정책, 벤치마크 제출물은 모두 업데이트될 수 있습니다.

따라서 7월 1위 결과는 영구적인 글로벌 순위로 취급되지 않고 날짜와 함께 인용되어야 합니다.

PinchBench v2가 실제로 테스트하는 것

Kilo는 PinchBench 2.0을 실제 업무 에이전트 워크플로우의 벤치마크로 설명합니다.

단순히 답변을 선택하는 것이 아닌, 시스템이 도구를 사용하고 작업을 완료해야 하는 태스크가 포함되어 있습니다.

벤치마크는 다음과 같은 범주를 포함합니다:

  • 글쓰기.
  • 창의적 작업.
  • 데이터 분석.
  • 리서치 및 지식 작업.
  • 코드 및 운영.
  • 기타 컴퓨터 기반 워크플로우.

소스 기사에 따르면 리더보드 스냅샷에는 59개의 모델 또는 에이전트 항목이 포함되었습니다.

이 수치는 제출물이 추가되거나 업데이트됨에 따라 변경될 수 있습니다.

벤치마크 자체는 리더보드 구성보다 더 안정적입니다.

PinchBench 2.0의 공식 릴리스는 다음과 같이 설명합니다:

148개 태스크

소스와 여러 7월 보고서는 원신(Wenxin)이 147개의 완료된 태스크에 걸쳐 평가를 수행했다고 설명하면서도 PinchBench를 148개 태스크 벤치마크로 설명합니다.

가장 안전한 해석은 다음과 같습니다:

PinchBench v2에는 148개의 태스크가 포함되어 있으며, 보고된 Orion Mission Mode 평가는 해당 스냅샷에서 그중 147개에 대해 점수 결과를 산출했을 수 있습니다.

이 구분이 중요한 이유는 벤치마크 보고가 벤치마크 규모와 성공적으로 완료된 태스크 수를 혼합하는 경우가 많기 때문입니다.

completed runs.

최고 점수 대 평균 점수

해당 소식통은 오라이언 미션 모드가 다음을 기록했음을 강조합니다:

94.6% 최고 점수
94.4% 평균 점수

0.2점 차이는 작습니다.

이는 보고된 실행들 간의 변동이 낮다는 것을 시사합니다.

그러나 이것이 보편적인 안정성 보장으로 해석되어서는 안 됩니다.

벤치마크 변동은 다음에 따라 달라질 수 있습니다:

  • 반복 횟수.
  • 샘플링 온도.
  • 도구 사용 가능 여부.
  • 외부 웹사이트.
  • 네트워크 상태.
  • 채점자 동작.
  • 에이전트 시간 초과.
  • 모델 업데이트.

실질적인 교훈은 단순히 보고된 PinchBench 실행이 하나의 고립된 행운의 결과에 기반하지 않았다는 것입니다.

평균은 최고 점수에 가깝게 유지되었습니다.

에이전트는 기반 모델 그 이상이다

소스 기사에서 가장 중요한 점 중 하나는 벤치마크가 제품 또는 에이전트 시스템을 평가한다는 것이지, 단순한 언어 모델을 평가하는 것이 아니라는 것입니다.

작업 에이전트는 다음을 결합할 수 있습니다:

  • 기반 모델.
  • 검색.
  • 메모리.
  • 파일 처리.
  • 도구 선택.
  • 계획 수립.
  • 하위 에이전트.
  • 문서 생성 능력.
  • 브라우저 또는 웹 접근.
  • 코드 실행.
  • 검증.

이는 다음과 같이 표현할 수 있습니다:

에이전트 결과
=
모델 능력
+
도구
+
메모리
+
계획
+
검색
+
실행 환경
+
검증

이것이 바로 다음과 같이 말할 때 주의해야 하는 이유입니다:

"모델 X가 모델 Y를 이겼다."

리더보드는 실제로 서로 다른 도구와 오케스트레이션을 사용하는 두 개의 서로 다른 에이전트 스택을 비교하고 있을 수 있습니다.

더 정확한 표현은 다음과 같습니다:

"에이전트 시스템 X가 이 벤치마크 구성에서 에이전트 시스템 Y보다 높은 점수를 기록했다."

AI 제품이 복잡한 소프트웨어 시스템으로 변모하면서 이 표현은 점점 더 중요해지고 있습니다.

질문에 답하기에서 작업 완료로

소스 기사는 2026년을 유용한 AI 제품의 기준이 전환되는 해로 설명합니다.

기존의 상호작용은 다음과 같았습니다:

사용자가 질문
→ 모델이 답변
→ 사용자가 작업 수행

새롭게 부상하는 에이전트 패턴은 다음과 같습니다:

사용자가 목표 제시
→ 에이전트가 계획
→ 에이전트가 맥락 수집
→ 에이전트가 도구 호출
→ 에이전트가 파일 생성
→ 에이전트가 결과 확인
→ 에이전트가 산출물 전달

이것은 사용자가 인식하는 바를 변화시킵니다.

모델이 매우 지식이 풍부하더라도 다음을 수행하지 못하면 실망스러울 수 있습니다:

  • 이전 요구사항을 기억하지 못함.
  • 파일을 열지 못함.
  • 스프레드시트 형식을 지정하지 못함.
  • 요청된 문서를 만들지 못함.
  • 모든 단계를 완료하지 못함.
  • 자신의 실수를 수정하지 못함.

새로운 성공 조건은 다음과 같은 질문에 더 가깝습니다:

작업이 실제로 완료되었는가?

다음보다:

답변이 인상적이었는가?

원신의 작업 진입점

BAAI 기사는 원신 인터페이스 내부에 "작업" 옵션이 직접 있음을 보여줍니다.

이미지는 바이두 원신 어시스턴트의 인터페이스를 보여줍니다. 상단에는 "오늘은 '고효율 달인'이 되고 싶나요, 아니면 나무늘보와 대화하고 싶나요?"라는 대화 상자가 있고, 하단에는 "면접 자기소개 템플릿 작성 도와주기" 입력란이 있습니다. 인터페이스 하단에는 여러 기능 옵션이 있으며, "작업" 옵션이 빨간색 상자로 강조 표시되어 있습니다. 이 이미지는 앞서 언급한 "원신의 작업 진입점"과 관련이 있으며, 원신 인터페이스에서 "작업" 옵션의 위치를 시각적으로 보여주고, BAAI 기사에서 "작업" 옵션이 원신 인터페이스 내부에 직접 있다는 내용을 뒷받침합니다.

바이두의 공식 원신 웹사이트는 제품을 다음과 같은 용도를 위한 멀티모달 AI 어시스턴트로 설명합니다:

  • 신뢰할 수 있는 창작.
  • 심층 검색.
  • 지능형 도구 사용.
  • 문서 작업.
  • 글쓰기.
  • 이미지.

크로스 디바이스 사용.

바이두 앱은 또한 원신 어시스턴트를 딥 리서치, 검색, 글쓰기, 이미지 생성, 영상 생성, 대화 지원을 위한 통합 AI 기능으로 나열하고 있습니다.

이는 태스크 중심 AI가 개발자 전용 실험이 아니라 바이두의 주류 소비자 영역으로 진입했음을 확인시켜 줍니다.

원신 어시스턴트는 정말 무료이고 무제한인가요?

원문 기사는 한 가지 상업적 요점을 반복해서 강조합니다:

원신 어시스턴트는 무료이며 유료 장벽이 없습니다.

바이두의 공식 원신 페이지는 현재 무료 접근 또는 무료 체험을 제공하고 있습니다.

이는 쉽게 확인할 수 있습니다.

더 강한 주장—모든 태스크 에이전트 기능에 대해 영구적으로 무제한—은 안정적인 공식 정책 페이지에서 확인하기가 더 어렵습니다.

AI 제품은 다음을 도입할 수 있습니다:

  • 일일 할당량.
  • 동시성 제한.
  • 기능별 제한.
  • 임시 프로모션.
  • 계정 등급.
  • 지역 제한.
  • 향후 가격 변경.

게재를 위해 더 안전한 표현은 다음과 같습니다:

원신 어시스턴트는 현재 개인 사용자에게 무료 접근 옵션으로 제공되며, 원문 기사에 제시된 태스크 경험은 유료 구독을 요구하지 않았습니다.

바이두가 이를 보장하는 특정 정책을 공개하지 않는 한 "영원한 무제한"을 중심으로 장기 비용 비교를 구축하지 마십시오.

검색 경험이 에이전트에 도움이 될 수 있는 이유

원문 기사의 마지막 섹션은 바이두의 검색 기록이 에이전트 설계에서 구조적 우위를 제공한다고 주장합니다.

실제 유사점이 있습니다.

검색 엔진은 다음과 같은 것을 처리합니다:

사용자 쿼리
→ 의도 이해
→ 쿼리 분해
→ 검색
→ 순위 결정
→ 결과 집계
→ 응답

에이전트는 다음과 같은 것을 처리합니다:

사용자 목표
→ 의도 이해
→ 태스크 분해
→ 도구 선택
→ 실행
→ 결과 집계
→ 전달

두 파이프라인은 동일하지 않습니다.

에이전트는 훨씬 더 큰 액션 공간을 가지며 더 큰 실행 위험을 수반합니다.

그러나 여러 기술적 역량은 자연스럽게 전이됩니다:

  • 의도 이해.
  • 쿼리 재작성.
  • 검색.
  • 소스 순위 결정.
  • 세션 컨텍스트.
  • 최신성 처리.
  • 중복 제거.
  • 증거 집계.

이는 특히 리서치 에이전트와 관련이 있습니다.

강력한 검색 인프라를 이미 갖춘 시스템은 그 위에 더 깊은 워크플로우를 구축할 수 있습니다.

검색 쿼리 이해 vs. 에이전트 태스크 이해

전통적인 검색 요청을 고려해 보십시오:

베이징에서 상하이까지 가장 저렴한 항공편을 찾아줘.

검색 시스템은 다음을 추론해야 할 수 있습니다:

  • 출발지.
  • 목적지.
  • 여행 날짜.
  • 가격 선호도.
  • 적격 항공편 재고.
  • 정렬 순서.

다음과 같은 요청을 받은 에이전트:

가장 저렴한 베이징–상하이 항공편을 찾고 일정을 준비해줘.

다음을 추가로 수행해야 할 수 있습니다:

  • 도구 선택.
  • 여러 번의 검색.
  • 비교.
  • 제약 조건 확인.
  • 파일 생성.
  • 캘린더 또는 예약 단계 가능성.

문제의 전반부는 검색과 유사합니다.

후반부는 액션 오케스트레이션입니다.

검색 경험은 유용한 구성 요소를 제공하지만, 에이전트 품질은 여전히 실행 계층에 달려 있습니다.

메모리와 검색 세션은 관련이 있지만—동일하지는 않습니다

원문은 또한 원신의 메모리 점수를 바이두의 검색 세션 이해 경험과 연결합니다.

일부 개념적 중첩이 존재합니다.

두 시스템 모두 이전 상호작용 중 어떤 정보가 여전히 유효한지 추론해야 합니다.

검색 세션에는 다음이 포함될 수 있습니다:

질의 1: 전기 자동차
질의 2: 주행거리 600km 이상
질의 3: 25만 위안 미만

시스템은 세 번째 질의가 여전히 전기 자동차에 관한 것임을 이해해야 합니다.

에이전트 메모리 시스템은 더 어려운 작업을 수행합니다.

다음을 기억해야 할 수 있습니다:

  • 사용자 선호도.
  • 작업 제약 조건.
  • 파일에서 파생된 사실.
  • 결정 사항.
  • 도구 출력.
  • 임시 상태.
  • 장기 선호도.

검색 세션 전문성은 유용하지만, 지속적인 에이전트 메모리에는 추가적인 저장, 검색, 개인정보 보호 및 관련성 메커니즘이 필요합니다.

연구 분석은 바이두의 검색 스택이 가장 직접적으로 관련되는 분야입니다

다섯 가지 XClaw 카테고리 중 연구 분석은 바이두의 검색 배경이 직접적으로 전이될 수 있는 가장 명확한 영역입니다.

연구 에이전트에게 필요한 것:

  • 검색 범위.
  • 최신 정보.
  • 질의 확장.
  • 순위 지정.
  • 인용 처리.
  • 출처 비교.
  • 엔터티 이해.
  • 다국어 검색.

바이두의 공식 첸판 AI 어시스턴트 문서는 또한 바이두 검색, 바이두 백과, 이미지 검색, 대화 관리, 메모리 관리 및 문서 기능을 통합한 엔터프라이즈 에이전트 솔루션을 설명합니다.

이는 소비자용 원신 제품이 정확히 동일한 구현을 사용한다는 것을 증명하지는 않습니다.

다만 바이두가 제품 포트폴리오 전반에 걸쳐 검색, 메모리, 도구 및 다중 모달 검색을 중심으로 공통 에이전트 스택을 구축하고 있음을 보여줍니다.

두 벤치마크 우승이 증명하지 못하는 것

높은 벤치마크 점수는 유용한 증거입니다.

그러나 전체 평가는 아닙니다.

영구적인 글로벌 리더십을 증명하지 않습니다

리더보드는 변경됩니다.

새로운 모델과 새로운 에이전트 제출물이 현재 선두를 추월할 수 있습니다.

모든 작업이 97%의 점수를 받을 것임을 증명하지 않습니다

XClaw는 선택된 작업과 카테고리를 집계합니다.

사용자의 실제 워크플로는 매우 다를 수 있습니다.

기반 모델을 분리하지 않습니다

점수는 완전한 어시스턴트 또는 에이전트 스택에 속합니다.

모든 안전 문제를 측정하지 않습니다

작업을 효율적으로 완료할 수 있는 에이전트라도 다른 환경에서는 안전하지 않은 도구 호출을 하거나 민감한 정보를 노출할 수 있습니다.

사실적 정확성을 보장하지 않습니다

연구 에이전트는 신뢰할 수 없는 출처를 인용하거나 변화하는 데이터를 잘못 읽을 수 있습니다.

무제한 무료 사용을 증명하지 않습니다

제품 가격과 할당량은 상업 정책이지 벤치마크 속성이 아닙니다.

원신 어시스턴트를 직접 평가하는 방법

유용한 개인 테스트는 실제 작업과 유사해야 합니다.

퀴즈 질문만 하지 마십시오.

에이전트에게 완전한 작업을 부여하십시오.

테스트 1: 메모리

긴 대화의 시작 부분에 다섯 가지 제약 조건을 제공하십시오.

여러 무관한 대화 후에 최종 결과물을 요청하고 다섯 가지가 모두 보존되었는지 확인하십시오.

테스트 2: 데이터 처리

업로드:

  • 스프레드시트.
  • PDF.
  • 짧은 텍스트 파일.

에이전트에게 이를 하나의 보고서로 결합하도록 요청하십시오.

모든 숫자 값을 독립적으로 검증하십시오.

테스트 3: 연구

변화하는 정보가 있는 주제를 선택하십시오.

요구 사항:

  • 1차 출처.
  • 발행일.
  • 상충되는 출처 비교.
  • 직접 링크.
  • 불확실한 주장 목록.

테스트 4: 문서

Creation

Word, PowerPoint, 스프레드시트 또는 HTML 파일을 요청하세요.

평가 기준:

  • 구조
  • 서식
  • 완성도
  • 다운로드 가능 여부
  • 파일이 실제로 열리는지 여부

테스트 5: 코딩

작은 대화형 애플리케이션을 요청하세요.

확인 사항:

  • 실행되는지 여부
  • 요청한 모든 기능이 존재하는지 여부
  • 오류가 수정되었는지 여부
  • 요청 시 최종 파일이 자체 포함형인지 여부

테스트 6: 장기 실행

여러 도구가 필요한 작업을 부여하세요.

시스템이 다음을 수행하는지 관찰하세요:

  1. 계획을 세우는지
  2. 합리적인 도구를 선택하는지
  3. 실패에서 복구하는지
  4. 반복 작업을 피하는지
  5. 최종 결과를 검증하는지

에이전트 제품을 비교하는 더 나은 방법

원신(Wenxin)을 다른 에이전트와 비교할 때는 "벤치마크 점수"보다 더 넓은 표를 사용하세요.

차원 측정 항목
작업 성공 요청한 작업이 완료되었는가?
메모리 이전의 제약 조건이 유지되었는가?
정확성 숫자와 주장이 올바른가?
연구 품질 출처가 권위 있고 최신인가?
도구 신뢰성 도구 호출이 일관되게 성공하는가?
결과물 품질 파일이 수동 수정 없이 사용 가능한가?
복구 에이전트가 실패한 단계를 수정할 수 있는가?
지연 시간 전체 작업을 완료하는 데 얼마나 걸리는가?
비용 수용 가능한 결과 하나의 비용은 얼마인가?
개인정보 보호 업로드된 파일과 메모리는 어떻게 처리되는가?
가용성 주요 기능이 무료인가, 할당량 제한이 있는가, 유료인가?

이것은 리더보드 순위 하나보다 더 현실적인 그림을 제공합니다.

더 큰 변화: "실제로 결과물을 낼 수 있는가?"

원문 기사의 가장 강력한 요점은 바이두보다 더 광범위합니다.

에이전트 경쟁은 AI 품질의 정의를 바꾸고 있습니다.

첫 번째 세대의 챗봇에서 사용자는 답변 품질에 집중했습니다.

현재의 작업 에이전트에서는 핵심 질문이 다음과 같이 바뀌고 있습니다:

  • 맥락을 유지할 수 있는가?
  • 올바른 정보를 찾을 수 있는가?
  • 도구를 작동할 수 있는가?
  • 파일을 만들 수 있는가?
  • 다단계 워크플로우를 완료할 수 있는가?
  • 자신의 결과를 검증할 수 있는가?
  • 반복적인 작업을 신뢰하고 맡길 수 있는가?

그렇기 때문에 XClaw와 PinchBench 같은 벤치마크가 주목을 받고 있습니다.

이들은 평가를 실제 작업 환경에 더 가깝게 이동시킵니다.

벤치마크와 기업 배포 사이에는 여전히 긴 거리가 있습니다.

하지만 방향은 유용합니다:

지식 벤치마크
→ 추론 벤치마크
→ 도구 사용 벤치마크
→ 종단 간 작업 벤치마크
→ 실제 생산 결과

마지막 단계가 궁극적으로 가장 중요한 단계입니다.

자주 묻는 질문

바이두 원신 어시스턴트는 SuperCLUE XClaw에서 어떤 점수를 받았나요?

2026년 8월 SuperCLUE XClaw 스냅샷에서 원신 어시스턴트는 전체 점수 97.62를 받아 공개된 제품 중 1위를 차지했습니다. 카테고리별 점수는 코딩 90.28, 콘텐츠 제작 99.44, 데이터 처리 98.86, 연구 분석 96.44, 메모리 100이었습니다.

메모리 점수 100은 무엇을 의미하나요?

이는 원신이 해당 XClaw 평가에 포함된 메모리 작업에서 만점을 받았다는 것을 의미합니다. 실제 모든 대화 상황에서 어시스턴트가 맥락을 절대 잊지 않는다는 의미는 아닙니다.

PinchBench v2란 무엇인가요?

PinchBench v2는 Kilo가 만든 에이전트 벤치마크로, 실제 컴퓨터 및 워크플로우 작업에서 시스템을 평가합니다. 버전 2.0에는 148개의 작업이 포함되어 있으며, 측정을 위해 설계되었습니다.

단순한 질의응답이 아닌 종단 간 실행(end-to-end execution)을 의미합니다.

원신(Wenxin)의 PinchBench v2 점수는 어땠나요?

2026년 7월 리더보드 스냅샷에서 바이두의 태스크 에이전트는 Orion Mission Mode로 표시되었으며, 최고 점수 94.6%, 평균 점수 94.4%를 기록했습니다. 리더보드는 시간이 지남에 따라 변동되므로, 결과를 인용할 때는 스냅샷의 날짜를 포함해야 합니다.

원신 어시스턴트는 완전히 무료인가요?

바이두 공식 원신 페이지에서는 현재 무료 이용 또는 무료 체험 옵션을 제공하고 있으며, 원본 기사에 따르면 시연된 태스크 기능은 유료 구독 없이 이용 가능했습니다. 모든 기능에 대해 영구적으로 무제한 사용을 보장하는 공식적인 안정적 약속은 확인되지 않았으므로, 현재 할당량은 제품 내에서 직접 확인해야 합니다.

원신 어시스턴트는 Word 문서와 웹 페이지를 생성할 수 있나요?

원본 기사에는 원신이 서식이 지정된 Word 사업 계획서와 인터랙티브 HTML 페이지를 생성한 테스트 세션이 나와 있습니다. 이러한 예시는 제품의 태스크 워크플로우를 보여주지만, 모든 프롬프트나 환경에서 동일한 결과가 보장된다는 의미는 아닙니다.

바이두의 검색 기술이 AI 에이전트에 왜 도움이 될 수 있나요?

검색과 에이전트는 의도 이해, 쿼리 분해, 검색(retrieval), 랭킹, 소스 집계, 세션 컨텍스트와 같은 기능을 공유합니다. 에이전트는 도구 호출, 파일 생성, 메모리, 계획, 실행을 포함한 더 넓은 실행 계층을 추가합니다.

XClaw와 PinchBench는 모델 벤치마크인가요?

좁은 의미에서는 아닙니다. 이들은 모델과 도구, 메모리, 검색, 프롬프트, 오케스트레이션, 실행 환경을 결합할 수 있는 제품 또는 에이전트 시스템을 평가합니다. 따라서 이들의 점수는 전체 에이전트 구성에 귀속되어야 합니다.

관련 도구

  • Baidu Wenxin: 검색, 창작, 문서, 태스크 중심 작업을 위한 바이두의 공식 멀티모달 AI 어시스턴트입니다.
  • SuperCLUE XClaw: 원본 기사에서 인용된 제품 중심의 중국어 에이전트 벤치마크입니다.
  • PinchBench: 코딩 및 컴퓨터 사용 에이전트 워크플로우를 위한 Kilo의 실사용 벤치마크입니다.
  • Pandoc: 원본 테스트 워크플로우에서 문서 콘텐츠를 추출하고 변환하는 데 사용된 문서 변환 도구입니다.
  • Three.js: 원본 기사에서 생성된 태양계 예시에 사용된 JavaScript 3D 그래픽 라이브러리입니다.
  • Baidu Qianfan: 모델, 에이전트, 데이터, AI 애플리케이션 개발을 위한 바이두의 엔터프라이즈 플랫폼입니다.
  • Baidu AgentBuilder: 원신 기반 맞춤형 에이전트를 구축하고 게시할 수 있는 바이두의 플랫폼입니다.

관련 링크

요약

바이두 원심 어시스턴트는 SuperCLUE의 2026년 8월 XClaw 스냅샷에서 97.62점으로 1위를 차지했으며, 메모리 부문에서 100점 만점을 기록했고 데이터 처리, 콘텐츠 제작, 리서치 분석 부문에서도 96점 이상을 받았다.

이 결과는 7월 PinchBench v2 리더보드 스냅샷에서 바이두의 Orion Mission Mode가 **최고 점수 94.6%, 평균 점수 94.4%**를 기록한 데 이은 것이다. 두 벤치마크는 서로 다른 태스크를 사용하지만, 단순한 질문 응답보다 실제 태스크 완료를 중시한다는 공통점이 있다.

가장 중요한 시사점은 특정 어시스턴트가 에이전트 경쟁에서 영구적으로 "승리"했다는 것이 아니다. 에이전트 순위는 빠르게 변하며, 측정된 시스템에는 모델, 도구, 검색, 메모리, 프롬프트, 오케스트레이션이 모두 포함된다.

두 결과가 보여주는 것은 AI 평가가 더 실용적인 기준으로 이동하고 있다는 점이다. 즉, 모델이 얼마나 지능적으로 보이는가가 아니라, 에이전트가 작업을 끝까지 완료하고 사용 가능한 결과물을 돌려줄 수 있는가가 핵심이다.