바이두 원신 어시스턴트, PinchBench v2 1위에 이어 SuperCLUE XClaw에서도 정상 등극
바이두 원신 어시스턴트가 또 다른 에이전트 스타일 벤치마크에서 1위를 차지했습니다. SuperCLUE의 2026년 8월 XClaw 제품 평가에서 원신 어시스턴트는 종합 점수 97점을 받았습니다.

바이두 원신 어시스턴트, PinchBench v2 1위에 이어 SuperCLUE XClaw 정상 등극
서론
바이두 원신 어시스턴트가 또 다른 에이전트형 벤치마크에서 1위를 차지했다.
SuperCLUE의 2026년 8월 XClaw 제품 평가에서 원신 어시스턴트는 종합 점수 97.62점을 기록하며 공개된 스냅샷 중 가장 높은 점수를 받았다.
카테고리별 점수는 다음과 같다:
| 역량 | 점수 |
|---|---|
| 코딩 | 90.28 |
| 콘텐츠 창작 | 99.44 |
| 데이터 처리 | 98.86 |
| 연구 분석 | 96.44 |
| 메모리 | 100.00 |
이 결과는 앞선 강력한 성과가 나온 지 3주도 채 지나지 않아 도출됐다.
7월 PinchBench v2 스냅샷에서 바이두의 태스크 에이전트는 오리온 미션 모드라는 이름으로 제출되어 94.6% 최고 점수와 94.4% 평균 점수를 기록하며 해당 리더보드 스냅샷의 정상에 올랐다.
두 벤치마크는 서로 다르다. SuperCLUE XClaw는 중국어 에이전트 제품과 5개 역량 차원에 걸친 실용적 산출물에 초점을 맞춘다. Kilo가 만든 PinchBench v2는 실제 컴퓨터 및 자동화 작업을 중심으로 설계됐다.
두 벤치마크가 함께 가리키는 변화는 분명하다:
에이전트 평가는 "모델이 정확하게 답변할 수 있는가?"에서 "시스템이 작업을 끝까지 완수하고 실용적인 결과물을 제공할 수 있는가?"로 이동하고 있다.
언어 모델은 정답을 알고 있어도 에이전트로서 실패할 수 있다. 요구사항을 잊어버리거나, 잘못된 도구를 선택하거나, 파일을 잘못 처리하거나, 워크플로우 중간에 멈추거나, 잘못된 산출물을 반환하기 때문이다.
따라서 이번 원신의 최신 결과는 순수한 언어 모델 지능보다 작업 실행 능력에 더 초점이 맞춰져 있다.

원신 어시스턴트, SuperCLUE XClaw 1위 달성
SuperCLUE는 XClaw를 "Claw" 스타일 AI 어시스턴트를 위한 제품 중심 평가로 설명한다.
주로 객관식 문제에 의존하기보다, 이 벤치마크는 완성된 산출물을 중시한다.
2026년 8월 스냅샷의 주요 제품 순위는 다음과 같다:
| 순위 | 제품 | 점수 |
|---|---|---|
| 1 | 바이두 원신 어시스턴트 | 97.62 |
| 2 | MiMoClaw | 96.74 |
| 3 | WorkBuddy | 96.61 |
| 4 | KimiClaw | 96.01 |
| 5 | MaxClaw | 94.79 |
벤치마크는 5개 차원을 평가한다:
- 데이터 처리.
- 콘텐츠 창작.
- 메모리.
- 코딩.
- 연구 분석.
기본 로직은 단순하다: 에이전트가 작업을 받고 실제로 평가 가능한 최종 산출물 또는 결과를 생성해야 한다.
따라서 지시 이행, 파일 처리, 도구 사용, 장기 실행 능력이 점수에 포함된다.

이는 채팅과 에이전트 작업의 차이를 보여줍니다.
챗 모델은 대화 안에서 계획서를 작성할 수 있습니다.
에이전트 워크플로우는 다음과 같이 할 수 있습니다:
소스 파일 읽기
→ 구조화된 정보 추출
→ 콘텐츠 초안 작성
→ Word 문서 서식 지정
→ 출력 검증
→ 파일 반환
산출물, 즉 문장형 응답이 아닌 결과물이 최종 제품이 됩니다.
콘텐츠 제작 99.44점
Wenxin은 콘텐츠 제작 부문에서 99.44점을 받았습니다.
에이전트 벤치마크에서 콘텐츠 제작은 단순한 창의적 글쓰기가 아닙니다.
시스템은 여러 제약 조건을 동시에 충족해야 할 수 있습니다:
- 필수 형식
- 어조
- 분량
- 섹션 구조
- 대상 독자
- 파일 유형
- 사실 기반
- 시각적 표현
초안은 문법적으로 훌륭해도 여전히 실패할 수 있습니다
요청된 형식을 무시합니다.
그래서 제품 벤치마크는 점점 단순한 언어 품질보다는 완성도를 기준으로 점수를 매기고 있습니다.
코딩 점수 90.28
원신(Wenxin)의 XClaw 카테고리 중 가장 낮은 점수는 코딩 부문의 90.28이었습니다.
그래도 강력한 점수이지만, 콘텐츠 제작 및 데이터 처리와의 격차는 시사하는 바가 큽니다.
코딩 에이전트는 더 넓은 운영 루프를 관리해야 합니다:
요구사항 이해
→ 기술 스택 선택
→ 파일 작성
→ 실행 또는 미리보기
→ 오류 확인
→ 수정
→ 상호작용 검증
→ 결과 패키징
출처 게시자는 3D 태양계 시뮬레이터에 대한 한 문장 요청으로 제품을 테스트했습니다.
보고된 워크플로우는 Three.js를 사용했으며 31KB 단일 파일 HTML 애플리케이션을 반환했습니다.
기사는 또한 유사한 인터랙티브 웹 워크플로우를 통해 생성된 날씨 시뮬레이션 교육 페이지도 보여줍니다.
이는 공식 XClaw 벤치마크 항목이 아닌 예시 데모입니다.

연구 분석 점수 96.44
원신(Wenxin)은 연구 분석 부문에서 96.44를 받았습니다.
진지한 연구 과제는 다음을 포함할 수 있습니다:
- 질문 이해하기.
- 하위 질문으로 분해하기.
- 여러 출처 검색하기.
- 출처 품질 평가하기.
- 상충되는 주장 비교하기.
- 날짜 확인하기.
- 수치 추출하기.
- 구조화된 논증 구축하기.
- 인용 추가하기.
- 보고서 작성하기.
출처 기사는 두 가지 테스트 사례를 설명합니다.
3차원 카케야 문제 연구
게시자는 원신(Wenxin)에게 필즈상 수상자 홍왕(Hong Wang)의 맥락에서 3차원 카케야 추측을 연구하도록 요청했습니다.
보고된 에이전트의 행동은 다음과 같았습니다:
- 6단계 연구 프로세스 계획.
- 여러 하위 에이전트를 병렬로 실행.
- 16개 학술 출처 검색.
- Markdown 문서 생성.
- 62KB 인터랙티브 HTML 결과 생성.

출처의 수는 그 자체로 품질 지표가 아닙니다.
중요한 것은 최종 에이전트가 권위 있는 출처를 사용하고, 주장을 올바르게 귀속시키고, 충돌을 해결하며, 오래된 데이터를 피하고, 사실과 해석을 분리하는지 여부입니다.
최근 AI 모델 및 가격 비교
게시자는 또한 원신(Wenxin)에게 지난달 주요 국내외 모델의 기능과 가격을 분석하도록 요청했습니다.
기사에 따르면 에이전트는 다음과 같이 행동했습니다:
- 산업 조사 스킬 로드.
- 두 차례에 걸쳐 45개 출처 검색.
- 일부 핵심 수치의 불확실성 감지.
- 29개 출처에 대한 추가 표적 검색 수행.
- 가격 상호 검증.
- 차트가 포함된 약 7,000자 분량의 중국어 보고서 생성.

유용한 연구 루프는 다음과 같습니다:
검색
→ 불확실성 식별
→ 다시 검색
→ 소스 비교
→ 불일치 해결 또는 표시
→ 작성
이 추가 검증 과정은 종종 연구 품질을 향상시키는 지점입니다.
두 번째 1위: PinchBench v2
SuperCLUE 결과는 7월 PinchBench v2 1위에 이어 나온 것입니다.
PinchBench는 Kilo가 전통적인 질문-답변 벤치마크가 아닌 실제 업무 워크플로우에서 에이전트를 평가하기 위해 만든 벤치마크입니다.
Kilo의 PinchBench 2.0 릴리스는 벤치마크를 148개 태스크로 확장했으며, 더 강화된 채점 및 리더보드 규칙을 추가했습니다.
소스 기사에 재현된 7월 리더보드 스냅샷에서 바이두의 시스템은 다음과 같이 표시되었습니다:
Orion-Mission-Mode
다음과 같은 점수와 함께:
최고 점수: 94.6%
평균 점수: 94.4%

해당 스크린샷은 Orion Mission Mode가 해당 특정 스냅샷에서 Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI 등의 모델 기반 시스템보다 앞선 것으로 보여줍니다.
중요한 단어는 스냅샷입니다.
에이전트 리더보드는 빠르게 변화합니다.
모델, 하네스, 프롬프트, 도구 정책, 벤치마크 제출물은 모두 업데이트될 수 있습니다.
따라서 7월 1위 결과는 영구적인 글로벌 순위로 취급되지 않고 날짜와 함께 인용되어야 합니다.
PinchBench v2가 실제로 테스트하는 것
Kilo는 PinchBench 2.0을 실제 업무 에이전트 워크플로우의 벤치마크로 설명합니다.
단순히 답변을 선택하는 것이 아닌, 시스템이 도구를 사용하고 작업을 완료해야 하는 태스크가 포함되어 있습니다.
벤치마크는 다음과 같은 범주를 포함합니다:
- 글쓰기.
- 창의적 작업.
- 데이터 분석.
- 리서치 및 지식 작업.
- 코드 및 운영.
- 기타 컴퓨터 기반 워크플로우.
소스 기사에 따르면 리더보드 스냅샷에는 59개의 모델 또는 에이전트 항목이 포함되었습니다.
이 수치는 제출물이 추가되거나 업데이트됨에 따라 변경될 수 있습니다.
벤치마크 자체는 리더보드 구성보다 더 안정적입니다.
PinchBench 2.0의 공식 릴리스는 다음과 같이 설명합니다:
148개 태스크
소스와 여러 7월 보고서는 원신(Wenxin)이 147개의 완료된 태스크에 걸쳐 평가를 수행했다고 설명하면서도 PinchBench를 148개 태스크 벤치마크로 설명합니다.
가장 안전한 해석은 다음과 같습니다:
PinchBench v2에는 148개의 태스크가 포함되어 있으며, 보고된 Orion Mission Mode 평가는 해당 스냅샷에서 그중 147개에 대해 점수 결과를 산출했을 수 있습니다.
이 구분이 중요한 이유는 벤치마크 보고가 벤치마크 규모와 성공적으로 완료된 태스크 수를 혼합하는 경우가 많기 때문입니다.
completed runs.
최고 점수 대 평균 점수
해당 소식통은 오라이언 미션 모드가 다음을 기록했음을 강조합니다:
94.6% 최고 점수
94.4% 평균 점수
0.2점 차이는 작습니다.
이는 보고된 실행들 간의 변동이 낮다는 것을 시사합니다.
그러나 이것이 보편적인 안정성 보장으로 해석되어서는 안 됩니다.
벤치마크 변동은 다음에 따라 달라질 수 있습니다:
- 반복 횟수.
- 샘플링 온도.
- 도구 사용 가능 여부.
- 외부 웹사이트.
- 네트워크 상태.
- 채점자 동작.
- 에이전트 시간 초과.
- 모델 업데이트.
실질적인 교훈은 단순히 보고된 PinchBench 실행이 하나의 고립된 행운의 결과에 기반하지 않았다는 것입니다.
평균은 최고 점수에 가깝게 유지되었습니다.
에이전트는 기반 모델 그 이상이다
소스 기사에서 가장 중요한 점 중 하나는 벤치마크가 제품 또는 에이전트 시스템을 평가한다는 것이지, 단순한 언어 모델을 평가하는 것이 아니라는 것입니다.
작업 에이전트는 다음을 결합할 수 있습니다:
- 기반 모델.
- 검색.
- 메모리.
- 파일 처리.
- 도구 선택.
- 계획 수립.
- 하위 에이전트.
- 문서 생성 능력.
- 브라우저 또는 웹 접근.
- 코드 실행.
- 검증.
이는 다음과 같이 표현할 수 있습니다:
에이전트 결과
=
모델 능력
+
도구
+
메모리
+
계획
+
검색
+
실행 환경
+
검증
이것이 바로 다음과 같이 말할 때 주의해야 하는 이유입니다:
"모델 X가 모델 Y를 이겼다."
리더보드는 실제로 서로 다른 도구와 오케스트레이션을 사용하는 두 개의 서로 다른 에이전트 스택을 비교하고 있을 수 있습니다.
더 정확한 표현은 다음과 같습니다:
"에이전트 시스템 X가 이 벤치마크 구성에서 에이전트 시스템 Y보다 높은 점수를 기록했다."
AI 제품이 복잡한 소프트웨어 시스템으로 변모하면서 이 표현은 점점 더 중요해지고 있습니다.
질문에 답하기에서 작업 완료로
소스 기사는 2026년을 유용한 AI 제품의 기준이 전환되는 해로 설명합니다.
기존의 상호작용은 다음과 같았습니다:
사용자가 질문
→ 모델이 답변
→ 사용자가 작업 수행
새롭게 부상하는 에이전트 패턴은 다음과 같습니다:
사용자가 목표 제시
→ 에이전트가 계획
→ 에이전트가 맥락 수집
→ 에이전트가 도구 호출
→ 에이전트가 파일 생성
→ 에이전트가 결과 확인
→ 에이전트가 산출물 전달
이것은 사용자가 인식하는 바를 변화시킵니다.
모델이 매우 지식이 풍부하더라도 다음을 수행하지 못하면 실망스러울 수 있습니다:
- 이전 요구사항을 기억하지 못함.
- 파일을 열지 못함.
- 스프레드시트 형식을 지정하지 못함.
- 요청된 문서를 만들지 못함.
- 모든 단계를 완료하지 못함.
- 자신의 실수를 수정하지 못함.
새로운 성공 조건은 다음과 같은 질문에 더 가깝습니다:
작업이 실제로 완료되었는가?
다음보다:
답변이 인상적이었는가?
원신의 작업 진입점
BAAI 기사는 원신 인터페이스 내부에 "작업" 옵션이 직접 있음을 보여줍니다.

바이두의 공식 원신 웹사이트는 제품을 다음과 같은 용도를 위한 멀티모달 AI 어시스턴트로 설명합니다:
- 신뢰할 수 있는 창작.
- 심층 검색.
- 지능형 도구 사용.
- 문서 작업.
- 글쓰기.
- 이미지.
크로스 디바이스 사용.
바이두 앱은 또한 원신 어시스턴트를 딥 리서치, 검색, 글쓰기, 이미지 생성, 영상 생성, 대화 지원을 위한 통합 AI 기능으로 나열하고 있습니다.
이는 태스크 중심 AI가 개발자 전용 실험이 아니라 바이두의 주류 소비자 영역으로 진입했음을 확인시켜 줍니다.
원신 어시스턴트는 정말 무료이고 무제한인가요?
원문 기사는 한 가지 상업적 요점을 반복해서 강조합니다:
원신 어시스턴트는 무료이며 유료 장벽이 없습니다.
바이두의 공식 원신 페이지는 현재 무료 접근 또는 무료 체험을 제공하고 있습니다.
이는 쉽게 확인할 수 있습니다.
더 강한 주장—모든 태스크 에이전트 기능에 대해 영구적으로 무제한—은 안정적인 공식 정책 페이지에서 확인하기가 더 어렵습니다.
AI 제품은 다음을 도입할 수 있습니다:
- 일일 할당량.
- 동시성 제한.
- 기능별 제한.
- 임시 프로모션.
- 계정 등급.
- 지역 제한.
- 향후 가격 변경.
게재를 위해 더 안전한 표현은 다음과 같습니다:
원신 어시스턴트는 현재 개인 사용자에게 무료 접근 옵션으로 제공되며, 원문 기사에 제시된 태스크 경험은 유료 구독을 요구하지 않았습니다.
바이두가 이를 보장하는 특정 정책을 공개하지 않는 한 "영원한 무제한"을 중심으로 장기 비용 비교를 구축하지 마십시오.
검색 경험이 에이전트에 도움이 될 수 있는 이유
원문 기사의 마지막 섹션은 바이두의 검색 기록이 에이전트 설계에서 구조적 우위를 제공한다고 주장합니다.
실제 유사점이 있습니다.
검색 엔진은 다음과 같은 것을 처리합니다:
사용자 쿼리
→ 의도 이해
→ 쿼리 분해
→ 검색
→ 순위 결정
→ 결과 집계
→ 응답
에이전트는 다음과 같은 것을 처리합니다:
사용자 목표
→ 의도 이해
→ 태스크 분해
→ 도구 선택
→ 실행
→ 결과 집계
→ 전달
두 파이프라인은 동일하지 않습니다.
에이전트는 훨씬 더 큰 액션 공간을 가지며 더 큰 실행 위험을 수반합니다.
그러나 여러 기술적 역량은 자연스럽게 전이됩니다:
- 의도 이해.
- 쿼리 재작성.
- 검색.
- 소스 순위 결정.
- 세션 컨텍스트.
- 최신성 처리.
- 중복 제거.
- 증거 집계.
이는 특히 리서치 에이전트와 관련이 있습니다.
강력한 검색 인프라를 이미 갖춘 시스템은 그 위에 더 깊은 워크플로우를 구축할 수 있습니다.
검색 쿼리 이해 vs. 에이전트 태스크 이해
전통적인 검색 요청을 고려해 보십시오:
베이징에서 상하이까지 가장 저렴한 항공편을 찾아줘.
검색 시스템은 다음을 추론해야 할 수 있습니다:
- 출발지.
- 목적지.
- 여행 날짜.
- 가격 선호도.
- 적격 항공편 재고.
- 정렬 순서.
다음과 같은 요청을 받은 에이전트:
가장 저렴한 베이징–상하이 항공편을 찾고 일정을 준비해줘.
다음을 추가로 수행해야 할 수 있습니다:
- 도구 선택.
- 여러 번의 검색.
- 비교.
- 제약 조건 확인.
- 파일 생성.
- 캘린더 또는 예약 단계 가능성.
문제의 전반부는 검색과 유사합니다.
후반부는 액션 오케스트레이션입니다.
검색 경험은 유용한 구성 요소를 제공하지만, 에이전트 품질은 여전히 실행 계층에 달려 있습니다.
메모리와 검색 세션은 관련이 있지만—동일하지는 않습니다
원문은 또한 원신의 메모리 점수를 바이두의 검색 세션 이해 경험과 연결합니다.
일부 개념적 중첩이 존재합니다.
두 시스템 모두 이전 상호작용 중 어떤 정보가 여전히 유효한지 추론해야 합니다.
검색 세션에는 다음이 포함될 수 있습니다:
질의 1: 전기 자동차
질의 2: 주행거리 600km 이상
질의 3: 25만 위안 미만
시스템은 세 번째 질의가 여전히 전기 자동차에 관한 것임을 이해해야 합니다.
에이전트 메모리 시스템은 더 어려운 작업을 수행합니다.
다음을 기억해야 할 수 있습니다:
- 사용자 선호도.
- 작업 제약 조건.
- 파일에서 파생된 사실.
- 결정 사항.
- 도구 출력.
- 임시 상태.
- 장기 선호도.
검색 세션 전문성은 유용하지만, 지속적인 에이전트 메모리에는 추가적인 저장, 검색, 개인정보 보호 및 관련성 메커니즘이 필요합니다.
연구 분석은 바이두의 검색 스택이 가장 직접적으로 관련되는 분야입니다
다섯 가지 XClaw 카테고리 중 연구 분석은 바이두의 검색 배경이 직접적으로 전이될 수 있는 가장 명확한 영역입니다.
연구 에이전트에게 필요한 것:
- 검색 범위.
- 최신 정보.
- 질의 확장.
- 순위 지정.
- 인용 처리.
- 출처 비교.
- 엔터티 이해.
- 다국어 검색.
바이두의 공식 첸판 AI 어시스턴트 문서는 또한 바이두 검색, 바이두 백과, 이미지 검색, 대화 관리, 메모리 관리 및 문서 기능을 통합한 엔터프라이즈 에이전트 솔루션을 설명합니다.
이는 소비자용 원신 제품이 정확히 동일한 구현을 사용한다는 것을 증명하지는 않습니다.
다만 바이두가 제품 포트폴리오 전반에 걸쳐 검색, 메모리, 도구 및 다중 모달 검색을 중심으로 공통 에이전트 스택을 구축하고 있음을 보여줍니다.
두 벤치마크 우승이 증명하지 못하는 것
높은 벤치마크 점수는 유용한 증거입니다.
그러나 전체 평가는 아닙니다.
영구적인 글로벌 리더십을 증명하지 않습니다
리더보드는 변경됩니다.
새로운 모델과 새로운 에이전트 제출물이 현재 선두를 추월할 수 있습니다.
모든 작업이 97%의 점수를 받을 것임을 증명하지 않습니다
XClaw는 선택된 작업과 카테고리를 집계합니다.
사용자의 실제 워크플로는 매우 다를 수 있습니다.
기반 모델을 분리하지 않습니다
점수는 완전한 어시스턴트 또는 에이전트 스택에 속합니다.
모든 안전 문제를 측정하지 않습니다
작업을 효율적으로 완료할 수 있는 에이전트라도 다른 환경에서는 안전하지 않은 도구 호출을 하거나 민감한 정보를 노출할 수 있습니다.
사실적 정확성을 보장하지 않습니다
연구 에이전트는 신뢰할 수 없는 출처를 인용하거나 변화하는 데이터를 잘못 읽을 수 있습니다.
무제한 무료 사용을 증명하지 않습니다
제품 가격과 할당량은 상업 정책이지 벤치마크 속성이 아닙니다.
원신 어시스턴트를 직접 평가하는 방법
유용한 개인 테스트는 실제 작업과 유사해야 합니다.
퀴즈 질문만 하지 마십시오.
에이전트에게 완전한 작업을 부여하십시오.
테스트 1: 메모리
긴 대화의 시작 부분에 다섯 가지 제약 조건을 제공하십시오.
여러 무관한 대화 후에 최종 결과물을 요청하고 다섯 가지가 모두 보존되었는지 확인하십시오.
테스트 2: 데이터 처리
업로드:
- 스프레드시트.
- PDF.
- 짧은 텍스트 파일.
에이전트에게 이를 하나의 보고서로 결합하도록 요청하십시오.
모든 숫자 값을 독립적으로 검증하십시오.
테스트 3: 연구
변화하는 정보가 있는 주제를 선택하십시오.
요구 사항:
- 1차 출처.
- 발행일.
- 상충되는 출처 비교.
- 직접 링크.
- 불확실한 주장 목록.
테스트 4: 문서
Creation
Word, PowerPoint, 스프레드시트 또는 HTML 파일을 요청하세요.
평가 기준:
- 구조
- 서식
- 완성도
- 다운로드 가능 여부
- 파일이 실제로 열리는지 여부
테스트 5: 코딩
작은 대화형 애플리케이션을 요청하세요.
확인 사항:
- 실행되는지 여부
- 요청한 모든 기능이 존재하는지 여부
- 오류가 수정되었는지 여부
- 요청 시 최종 파일이 자체 포함형인지 여부
테스트 6: 장기 실행
여러 도구가 필요한 작업을 부여하세요.
시스템이 다음을 수행하는지 관찰하세요:
- 계획을 세우는지
- 합리적인 도구를 선택하는지
- 실패에서 복구하는지
- 반복 작업을 피하는지
- 최종 결과를 검증하는지
에이전트 제품을 비교하는 더 나은 방법
원신(Wenxin)을 다른 에이전트와 비교할 때는 "벤치마크 점수"보다 더 넓은 표를 사용하세요.
| 차원 | 측정 항목 |
|---|---|
| 작업 성공 | 요청한 작업이 완료되었는가? |
| 메모리 | 이전의 제약 조건이 유지되었는가? |
| 정확성 | 숫자와 주장이 올바른가? |
| 연구 품질 | 출처가 권위 있고 최신인가? |
| 도구 신뢰성 | 도구 호출이 일관되게 성공하는가? |
| 결과물 품질 | 파일이 수동 수정 없이 사용 가능한가? |
| 복구 | 에이전트가 실패한 단계를 수정할 수 있는가? |
| 지연 시간 | 전체 작업을 완료하는 데 얼마나 걸리는가? |
| 비용 | 수용 가능한 결과 하나의 비용은 얼마인가? |
| 개인정보 보호 | 업로드된 파일과 메모리는 어떻게 처리되는가? |
| 가용성 | 주요 기능이 무료인가, 할당량 제한이 있는가, 유료인가? |
이것은 리더보드 순위 하나보다 더 현실적인 그림을 제공합니다.
더 큰 변화: "실제로 결과물을 낼 수 있는가?"
원문 기사의 가장 강력한 요점은 바이두보다 더 광범위합니다.
에이전트 경쟁은 AI 품질의 정의를 바꾸고 있습니다.
첫 번째 세대의 챗봇에서 사용자는 답변 품질에 집중했습니다.
현재의 작업 에이전트에서는 핵심 질문이 다음과 같이 바뀌고 있습니다:
- 맥락을 유지할 수 있는가?
- 올바른 정보를 찾을 수 있는가?
- 도구를 작동할 수 있는가?
- 파일을 만들 수 있는가?
- 다단계 워크플로우를 완료할 수 있는가?
- 자신의 결과를 검증할 수 있는가?
- 반복적인 작업을 신뢰하고 맡길 수 있는가?
그렇기 때문에 XClaw와 PinchBench 같은 벤치마크가 주목을 받고 있습니다.
이들은 평가를 실제 작업 환경에 더 가깝게 이동시킵니다.
벤치마크와 기업 배포 사이에는 여전히 긴 거리가 있습니다.
하지만 방향은 유용합니다:
지식 벤치마크
→ 추론 벤치마크
→ 도구 사용 벤치마크
→ 종단 간 작업 벤치마크
→ 실제 생산 결과
마지막 단계가 궁극적으로 가장 중요한 단계입니다.
자주 묻는 질문
바이두 원신 어시스턴트는 SuperCLUE XClaw에서 어떤 점수를 받았나요?
2026년 8월 SuperCLUE XClaw 스냅샷에서 원신 어시스턴트는 전체 점수 97.62를 받아 공개된 제품 중 1위를 차지했습니다. 카테고리별 점수는 코딩 90.28, 콘텐츠 제작 99.44, 데이터 처리 98.86, 연구 분석 96.44, 메모리 100이었습니다.
메모리 점수 100은 무엇을 의미하나요?
이는 원신이 해당 XClaw 평가에 포함된 메모리 작업에서 만점을 받았다는 것을 의미합니다. 실제 모든 대화 상황에서 어시스턴트가 맥락을 절대 잊지 않는다는 의미는 아닙니다.
PinchBench v2란 무엇인가요?
PinchBench v2는 Kilo가 만든 에이전트 벤치마크로, 실제 컴퓨터 및 워크플로우 작업에서 시스템을 평가합니다. 버전 2.0에는 148개의 작업이 포함되어 있으며, 측정을 위해 설계되었습니다.
단순한 질의응답이 아닌 종단 간 실행(end-to-end execution)을 의미합니다.
원신(Wenxin)의 PinchBench v2 점수는 어땠나요?
2026년 7월 리더보드 스냅샷에서 바이두의 태스크 에이전트는 Orion Mission Mode로 표시되었으며, 최고 점수 94.6%, 평균 점수 94.4%를 기록했습니다. 리더보드는 시간이 지남에 따라 변동되므로, 결과를 인용할 때는 스냅샷의 날짜를 포함해야 합니다.
원신 어시스턴트는 완전히 무료인가요?
바이두 공식 원신 페이지에서는 현재 무료 이용 또는 무료 체험 옵션을 제공하고 있으며, 원본 기사에 따르면 시연된 태스크 기능은 유료 구독 없이 이용 가능했습니다. 모든 기능에 대해 영구적으로 무제한 사용을 보장하는 공식적인 안정적 약속은 확인되지 않았으므로, 현재 할당량은 제품 내에서 직접 확인해야 합니다.
원신 어시스턴트는 Word 문서와 웹 페이지를 생성할 수 있나요?
원본 기사에는 원신이 서식이 지정된 Word 사업 계획서와 인터랙티브 HTML 페이지를 생성한 테스트 세션이 나와 있습니다. 이러한 예시는 제품의 태스크 워크플로우를 보여주지만, 모든 프롬프트나 환경에서 동일한 결과가 보장된다는 의미는 아닙니다.
바이두의 검색 기술이 AI 에이전트에 왜 도움이 될 수 있나요?
검색과 에이전트는 의도 이해, 쿼리 분해, 검색(retrieval), 랭킹, 소스 집계, 세션 컨텍스트와 같은 기능을 공유합니다. 에이전트는 도구 호출, 파일 생성, 메모리, 계획, 실행을 포함한 더 넓은 실행 계층을 추가합니다.
XClaw와 PinchBench는 모델 벤치마크인가요?
좁은 의미에서는 아닙니다. 이들은 모델과 도구, 메모리, 검색, 프롬프트, 오케스트레이션, 실행 환경을 결합할 수 있는 제품 또는 에이전트 시스템을 평가합니다. 따라서 이들의 점수는 전체 에이전트 구성에 귀속되어야 합니다.
관련 도구
- Baidu Wenxin: 검색, 창작, 문서, 태스크 중심 작업을 위한 바이두의 공식 멀티모달 AI 어시스턴트입니다.
- SuperCLUE XClaw: 원본 기사에서 인용된 제품 중심의 중국어 에이전트 벤치마크입니다.
- PinchBench: 코딩 및 컴퓨터 사용 에이전트 워크플로우를 위한 Kilo의 실사용 벤치마크입니다.
- Pandoc: 원본 테스트 워크플로우에서 문서 콘텐츠를 추출하고 변환하는 데 사용된 문서 변환 도구입니다.
- Three.js: 원본 기사에서 생성된 태양계 예시에 사용된 JavaScript 3D 그래픽 라이브러리입니다.
- Baidu Qianfan: 모델, 에이전트, 데이터, AI 애플리케이션 개발을 위한 바이두의 엔터프라이즈 플랫폼입니다.
- Baidu AgentBuilder: 원신 기반 맞춤형 에이전트를 구축하고 게시할 수 있는 바이두의 플랫폼입니다.
관련 링크
Baidu Wenxin 공식 웹사이트: 웹 및 다운로드 가능한 클라이언트 전반에 걸친 원신 어시스턴트의 현재 공식 제품 진입점입니다.
Baidu Wenxin 데스크톱 어시스턴트: 문서 분석, 검색, 창작, 내보내기, 무료 체험을 강조하는 공식 데스크톱 페이지입니다.
[SuperCLUE XClaw 2026년 8월
Evaluation: 원문 기사에서 참조한 벤치마크 페이지.
Kilo: PinchBench 2.0 Is Here: PinchBench v2의 148개 태스크, 채점 방식 변경, 병렬 심사, 리더보드 설계에 대한 공식 설명.
Baidu Qianfan AI Assistant Documentation: 바이두의 검색 연동 엔터프라이즈 AI 어시스턴트, 메모리, 대화, 파일 서비스를 설명하는 공식 문서.
Baidu App Official Download Page: 통합된 문심 어시스턴트 및 딥리서치 기능을 설명하는 바이두 공식 앱 소개 페이지.
Baidu Wenxin AgentBuilder Documentation: 바이두 원심 생태계에서 에이전트를 구축하기 위한 공식 문서.
요약
바이두 원심 어시스턴트는 SuperCLUE의 2026년 8월 XClaw 스냅샷에서 97.62점으로 1위를 차지했으며, 메모리 부문에서 100점 만점을 기록했고 데이터 처리, 콘텐츠 제작, 리서치 분석 부문에서도 96점 이상을 받았다.
이 결과는 7월 PinchBench v2 리더보드 스냅샷에서 바이두의 Orion Mission Mode가 **최고 점수 94.6%, 평균 점수 94.4%**를 기록한 데 이은 것이다. 두 벤치마크는 서로 다른 태스크를 사용하지만, 단순한 질문 응답보다 실제 태스크 완료를 중시한다는 공통점이 있다.
가장 중요한 시사점은 특정 어시스턴트가 에이전트 경쟁에서 영구적으로 "승리"했다는 것이 아니다. 에이전트 순위는 빠르게 변하며, 측정된 시스템에는 모델, 도구, 검색, 메모리, 프롬프트, 오케스트레이션이 모두 포함된다.
두 결과가 보여주는 것은 AI 평가가 더 실용적인 기준으로 이동하고 있다는 점이다. 즉, 모델이 얼마나 지능적으로 보이는가가 아니라, 에이전트가 작업을 끝까지 완료하고 사용 가능한 결과물을 돌려줄 수 있는가가 핵심이다.