DeepSeek V4 Pro가 SuperCLUE 터미널 프로그래밍 벤치마크에서 2위를 차지, 비용은 Kimi K3의 일부에 불과
DeepSeek-V4-Pro-0813은 최신 SuperCLUE-Terminal 중국어 스마트 터미널 프로그래밍 벤치마크에서 51.52점을 기록하며 Kimi K3에 이어 2위를 차지했습니다.

DeepSeek V4 Pro, SuperCLUE 터미널 코딩 벤치마크에서 Kimi K3의 일부 비용으로 2위 차지
서론
DeepSeek-V4-Pro-0813이 최신 SuperCLUE-Terminal 중국어 에이전트 터미널 코딩 벤치마크에서 51.52점을 기록하며 2위를 차지했습니다. 60.61점으로 리더보드 1위를 차지한 Kimi K3에 이은 결과입니다.
이번 결과가 특히 주목할 만한 이유는 비용 효율성에 있습니다. 벤치마크 실행에서 DeepSeek-V4-Pro-0813은 작업당 평균 약 1.42위안이 소요되어, 높은 점수를 기록한 모델들 사이에서 강력한 가성비를 입증했습니다.
SuperCLUE-Terminal은 중국 개발자의 실제 코딩 작업을 기반으로 설계되었습니다. 모델은 Claude Code 기반의 범용 에이전트 프레임워크를 통해 평가되며, 이를 통해 중국어 요구사항 이해, 다단계 작업 계획, 도구 사용, 디버깅, 엔드투엔드 워크플로우를 통한 코드 수정 능력을 비교할 수 있습니다.

DeepSeek V4 Pro, 최신 코딩 평가에서 2위 기록
이 벤치마크는 짧고 단편적인 코딩 문제가 아닌 실제 개발 작업을 반영하도록 설계되었습니다. 공개된 결과에 따르면, 단일 작업에는 약 50~110회의 상호작용이 필요할 수 있으며, 한 작업의 전체 실행에는 약 30~90분이 소요될 수 있습니다.
현재 순위에서 Kimi K3는 60.61점으로 1위를 유지하고 있습니다. DeepSeek-V4-Pro-0813은 51.52점으로 뒤를 이으며, GLM-5.2의 48.48점과 이전 버전인 DeepSeek-V4-Flash-0731의 46.46점을 앞섰습니다.
| 모델 | SuperCLUE-Terminal 점수 | 보고된 평균 단일 작업 비용 |
|---|---|---|
| Kimi K3(최대값) | 60.61 | 19.63위안 |
| DeepSeek-V4-Pro-0813(최대값) | 51.52 | 1.42위안 |
| GLM-5.2(최대값) | 48.48 | 23.30위안 |
| DeepSeek-V4-Flash-0731(최대값) | 46.46 | 0.64위안 |
위 데이터는 SuperCLUE-Terminal 벤치마크 환경에서 얻은 것으로, 벤치마크 실행 비용으로 이해해야 하며, 모델 제공업체의 고정 단일 작업 요금이 아닙니다.
DeepSeek은 별도로 확인하기를, 프로덕션 환경 API 모델 deepseek-v4-pro가 현재 DeepSeek-V4-Pro-0813을 가리키고 있습니다. 이 모델은 DeepSeek 웹 앱, 모바일 앱 및 API를 통해 사용할 수 있습니다.
작업당 단 1.42위안: 뛰어난 비용 효율성
이번 결과에서 가장 주목할 만한 부분은 DeepSeek-V4-Pro-0813의 보고된 비용입니다.
벤치마크에서 평균 비용은 약 1.42위안/작업으로, 동일한 SuperCLUE 비교에서 Kimi K3(19.63위안)의 약 14분의 1, GLM-5.2(23.30위안)의 약 16분의 1 수준입니다.
이 차이가 중요한 이유는 고성능 코딩 모델 간의 점수 차이는 상대적으로 작을 수 있지만, 장시간 실행되는 에이전트 작업의 비용은 크게 차이날 수 있기 때문입니다. 소규모 기업, 독립 개발자, 그리고 코딩 에이전트를 반복적으로 실행해야 하는 팀에게 실행 비용은 벤치마크의 최고 점수만큼 중요할 수 있습니다.
이 평가는 프론트엔드 페이지, 3D 게임 및 엔지니어링 스크립트 수정을 포함한 실제 개발 시나리오를 다룹니다. 보고된 테스트에서 DeepSeek-V4-Pro-0813은 충돌 처리, 점수 계산 및 종료 상태를 포함한 게임 개발 로직을 완료할 수 있었습니다.
동작 구현 측면에서도 생성된 UI 스타일과 상호작용 피드백은 기본적인 템플릿 수준을 넘어섰습니다.
일부 창의적인 드로잉 작업에서는 여전히 경미한 구조적 문제가 있지만, 전반적인 완성 품질은 선두 그룹과 동등한 수준을 유지했습니다.
예산에 민감한 개발 팀에게 이번 결과는 DeepSeek-V4-Pro-0813의 명확한 위치를 제시합니다: 최첨단 코딩 에이전트 성능에 근접하면서도, 벤치마크 실행 비용은 더 높은 가격의 여러 경쟁사보다 훨씬 낮습니다.
자주 묻는 질문
DeepSeek-V4-Pro-0813이란 무엇인가요?
DeepSeek-V4-Pro-0813은 deepseek-v4-pro API 모델 이름 뒤에 있는 현재 프로덕션 버전입니다. DeepSeek은 2026년 8월 13일에 GA 버전을 공식 출시했으며, 에이전트 기능을 강화하고 웹 앱, 모바일 앱 및 API를 지원합니다.
SuperCLUE-Terminal이란 무엇인가요?
SuperCLUE-Terminal은 에이전트 터미널 작업을 위한 벤치마크로, 실제 시나리오에서의 중국어 코딩 및 엔지니어링 워크플로우에 초점을 맞춥니다. 요구사항 이해, 계획, 명령 실행, 파일 수정, 디버깅 및 최종 작업 완료와 같은 엔드투엔드 성능을 평가합니다.
벤치마크가 Claude Code를 사용하는 이유는 무엇인가요?
이 벤치마크는 범용 에이전트 프레임워크를 사용하여 참여 모델이 더 비교 가능한 실행 환경에서 테스트되도록 합니다. Claude Code는 작업 실행을 위한 터미널형 에이전트 환경을 제공하며, 기본 모델은 각 평가에서 교체됩니다.
1.42위안이 DeepSeek V4 Pro의 단일 작업 공식 요금인가요?
아닙니다. 1.42위안은 이번 SuperCLUE-Terminal 벤치마크 실행에서 관찰된 작업당 평균 비용으로, 벤치마크의 토큰 사용량과 가격 책정 방법을 기반으로 계산되었습니다. 실제 API 비용은 입력 토큰, 출력 토큰, 캐시 사용량, 추론 설정 및 서비스 제공업체의 현재 요금에 따라 달라집니다.
이 벤치마크에서 DeepSeek V4 Pro는 Kimi K3와 비교하여 어떤 성과를 보였나요?
Kimi K3는 60.61점으로 더 높은 점수를 기록했으며, DeepSeek-V4-Pro-0813은 51.52점입니다. 그러나 벤치마크 보고서에 따르면 Kimi K3의 평균 작업 비용은 19.63위안인 반면, DeepSeek-V4-Pro-0813은 1.42위안에 불과하여, 이번 특정 평가에서 DeepSeek이 상당한 비용 이점을 가지고 있습니다.
DeepSeek V4 Pro는 긴 컨텍스트와 에이전트 워크플로우를 지원하나요?
네. DeepSeek 공식 API 문서에는 DeepSeek V4 Pro의 컨텍스트 길이가 100만 토큰이며, 도구 호출, Responses API, Anthropic 호환 API 및 다양한 추론 강도 설정을 지원한다고 명시되어 있습니다. DeepSeek은 GA 버전을 에이전트 워크로드용 업그레이드로 명확히 포지셔닝했습니다.
DeepSeek V4 Pro가 코딩에서 항상 GLM-5.2보다 우수한가요?
반드시 그렇지는 않습니다. 이번 SuperCLUE-Terminal 결과에서 DeepSeek-V4-Pro-0813은 51.52점, GLM-5.2는 48.48점을 기록했지만, 단일 벤치마크가 모든 코딩 워크로드에서의 성능을 결정하지는 않습니다. 저장소 규모, 언어, 도구 환경, 긴 컨텍스트 동작, 지연 시간 및 비용 모두 모델 선택에 영향을 미칩니다.
관련 도구
- DeepSeek API:
deepseek-v4-pro를 포함한 DeepSeek 모델에 접근할 수 있는 공식 API 플랫폼. - SuperCLUE-Terminal: 해당
이 문서에서 논의된 에이전트 터미널 프로그래밍 비교에 사용된 벤치마크입니다.
- Claude Code: Anthropic의 에이전트 코딩 도구로, 벤치마크에서 범용 실행 프레임워크로 사용됩니다.
- Kimi API: 월지암면테크놀로지(Moonshot AI)의 Kimi K3 및 기타 Kimi 모델을 위한 공식 개발자 플랫폼입니다.
- Z.AI GLM-5.2: 벤치마크에서 높은 점수를 기록한 GLM-5.2 모델의 공식 개요입니다.
관련 링크
- DeepSeek-V4-Pro 정식 버전 출시: DeepSeek의 프로덕션급 V4 Pro 버전에 대한 공식 발표입니다.
- DeepSeek 모델 및 가격: 공식 모델 버전, 컨텍스트 제한, 기능 및 현재 API 요금 정보입니다.
- DeepSeek API 빠른 시작: API를 통해
deepseek-v4-pro에 접근하는 공식 안내입니다. - SuperCLUE-Terminal 벤치마크: 순위 및 비용 비교를 포함한 공식 벤치마크 페이지입니다.
- Kimi K3 API 문서: K3 모델 및 API 사용법을 다루는 공식 Kimi 문서입니다.
- Claude Code 문서: 벤치마크에 사용된 코딩 에이전트 프레임워크의 공식 문서입니다.
- GLM-5.2 공식 개요: Z.AI의 GLM-5.2 및 장기 코딩 역량에 대한 공식 소개입니다.
요약
DeepSeek-V4-Pro-0813은 SuperCLUE-Terminal에서 51.52점을 기록하여 해당 벤치마크에서 Kimi K3에 이어 2위를 차지했으며, GLM-5.2 및 DeepSeek-V4-Flash-0731보다 앞섰습니다.
주요 강점은 비용에 있습니다. SuperCLUE가 보고한 평균 비용은 작업당 약 1.42위안으로, 동일 평가에서 기록된 Kimi K3 및 GLM-5.2의 비용보다 훨씬 낮습니다.
이 결과가 DeepSeek V4 Pro가 일반적으로 최고의 코딩 모델이라는 것을 의미하지는 않지만, 장시간의 도구 집약적 프로그래밍 작업에서 에이전트 코딩 성능과 실행 비용 사이의 좋은 균형을 제공한다는 것을 시사합니다.
코딩 에이전트 역량과 운영 비용을 모두 고려하는 팀에게 DeepSeek-V4-Pro-0813은 이번 SuperCLUE-Terminal 비교에서 가장 경쟁력 있는 옵션 중 하나입니다.