DeepSeek V4 Pro 대비 Grok 4.6: 첫 실제 세계 테스트에서 두 모델 모두 최상위권에 진입
두 AI 모델이 거의 동시에 출시되면서 DeepSeek V4 Pro와 Grok 4.6이 직접적인 주목을 받게 되었습니다. DeepSeek V4 Pro는 에이전트 및

DeepSeek V4 Pro 대비 Grok 4.6: 최초 실사용 테스트, 두 모델 모두 최상위권 진입
서론
두 개의 중량급 AI 모델이 거의 동시에 출시되면서 DeepSeek V4 Pro와 Grok 4.6이 직접적인 주목을 받게 되었다.
DeepSeek V4 Pro는 에이전트 및 소프트웨어 엔지니어링 성능에서 대폭적인 도약을 이뤘고, Grok 4.6은 코딩, 지식 작업 및 종합 역량에서 강력한 성능을 발휘한다. 원문 기사는 이 두 번의 출시를 OpenAI와 Anthropic의 현행 최첨단 모델에 대한 직접적인 도전으로 묘사한다.
이번 비교가 특히 흥미로운 이유는 두 모델이 단순히 벤치마크 표에서만 평가받는 것이 아니기 때문이다. 초기 실사용 테스트에서는 동일한 프롬프트를 사용해 웹사이트 구축, 게임 제작, 비주얼 디자인 재현, 3D 경험 생성까지 요구했다.
그 결과는 단순한 승자 독식 경쟁이라기보다는 팽팽한 접전에 가까웠다. 각 모델마다 두드러진 영역이 따로 있었다.
DeepSeek V4 Pro 등장, Grok 4.6 동시 합류
원문 기사는 DeepSeek V4 Pro의 여러 벤치마크 결과를 중점적으로 소개했다.
사이버보안 에이전트 평가 CyberGym에서 DeepSeek V4 Pro는 83.3점을 기록하며 Fable 5의 83.1점과 Opus 4.8의 78.3점을 근소한 차이로 앞질렀다.
AutomationBench에서는 31.8점으로 Fable 5의 29.1점과 Opus 4.8의 27.2점보다 앞섰다.
가장 근소한 차이를 보인 부문은 Terminal-Bench 2.1이었다. DeepSeek V4 Pro는 87.9점을 기록했고, Opus 4.8은 85.0점, Fable 5는 88.0점을 기록했다.
원문 기사는 도구가 활성화된 Humanity's Last Exam 환경에서 60.0점을 달성했다고도 보고했으며, Opus 4.8은 57.9점, Fable 5는 63.0점이었다.
DeepSWE도 보고서에서 또 다른 주요 개선 항목이었다. DeepSeek V4 Pro는 62.7점으로, 프리뷰 버전의 12.8점에서 대폭 상승했으며, Opus 4.8의 58.0점보다 높지만 Fable 5의 70.0점보다는 여전히 낮은 수치였다.
Grok 4.6은 여러 영역에서 GPT-5.6 및 Fable 5와 비교 테스트를 진행했다.
원문 기사는 종합 지능 지수에서 61점을 기록해 Fable 5의 62점에 1점 차이로 뒤졌다고 보고했다.
CursorBench에서 Grok 4.6은 **69.9%**를 기록하며 GPT-5.6의 67.2%를 앞서고 Fable 5의 70.5%에 근접했다.
FrontierCode에서는 **61.3%**로 GPT-5.6의 60.6%보다 약간 앞섰지만 Fable 5의 63.6%에는 뒤졌다.
원문 기사에 따르면 지식 작업 부문에서는 더욱 강력한 성과를 보였다. Grok 4.6은 세 가지 핵심 평가에서 모두 1위를 차지했다: GDPval-AA v2에서 1,753 Elo, AA-Briefcase에서 1,577 Elo, 전문 법률 벤치마크 Harvey LAB에서 **15.8%**였다.
원문 기사가 이 데이터에서 도출한 주요 결론은 단순하다. 두 모델 모두 선두권 프론티어 시스템과 어깨를 나란히 할 수 있는 대화에 합류했다는 것이다.
가격 차이도 이야기의 일부
성능은 이번 비교의 절반에 불과하다.
원문 기사는 추론 비용도 강조했다. 출시 시점의 출력 토큰 100만 개당 가격을 다음과 같이 보고했다:
| 모델 | 출력 토큰 100만 개당 가격(보고 기준) |
|---|---|
| DeepSeek V4 Pro | $0.87 |
| Grok 4.6 | $6 |
| GPT-5.6 Sol | $30 |
| Claude Opus 5 | $25 |
| Fable 5 | $50 |
현재 달러 가격 보기 기준, 캐시 미스 시 입력 토큰 100만 개당 0.435달러, 캐시 히트 시 0.003625달러다.
DeepSeek의 문서는 또한 V4 모델이 100만 토큰 컨텍스트 창, 도구 호출, 그리고 OpenAI 형식 및 Anthropic 형식의 API 접근을 지원한다고 명시한다.
다른 모델의 구체적인 가격은 시간에 따라 변하므로, 원문의 모델 간 가격 비교는 출시 시점의 스냅샷으로 간주해야 하며 장기적인 가격표로 보아서는 안 된다.
첫 실측: DeepSeek V4 Pro가 3D 지구본 구축
기사에서 설명된 첫 번째 실제 테스트는 DeepSeek V4 Pro에게 상당히 높은 수준의 요구를 제시했다.
단 한 개의 프롬프트만으로 이 모델은 브라우저에서 완전한 인터랙티브 3D 지구본 경험을 생성했다.
보고된 결과에 따르면 드래그, 회전, 확대/축소 같은 기본적인 인터랙션을 지원했으며, 글로벌 데이터 흐름, 동적 경로, 전 세계에 분포한 지리적 마커까지 포함했다.
시각적 디테일은 더 나아갔다. 대기 산란, 구름, 주야간 조명, 주변 인터페이스 모두 생성된 경험에 포함되었다.
이번 테스트의 핵심은 단순히 모델이 웹페이지를 생성했다는 점이 아니라, 단일 작업에서 시각 디자인, 3D 렌더링, 인터랙션, 애플리케이션 구조를 조율해야 하는 AI 프로그래밍 모델이 어디까지 갈 수 있는지를 보여준 데 있었다.
DeepSeek V4 Pro와 Grok 4.6, 세 가지 앱 태스크에서 대결
이후 원문은 동일하거나 거의 동일한 프롬프트를 사용해 두 모델을 비교했다.
AI 크리에이터 샹양차오무는 먼저 DeepSeek V4 Pro로 세 가지 소규모 작업을 실행한 다음, 그중 두 개의 동일한 프롬프트를 Grok 4.6에도 넘겼다.
세 가지 스킬로 웹사이트 구축 및 배포
첫 번째 작업은 모델이 세 가지 스킬을 사용해 웹사이트를 개발하고 배포하도록 요구했다.
보고에 따르면 DeepSeek V4 Pro는 전체 워크플로우를 성공적으로 완료했다. 원문은 페이지 디자인과 전반적인 완성도가 안정적이었다고 밝혔다.
이런 유형의 테스트는 에이전트 프로그래밍에서 특히 중요하다. 모델이 단순히 코드 한 조각을 생성하는 것이 아니라 여러 도구나 역량을 조율해야 하기 때문이다.
Bento 카드로 60가지 디자인 스타일 재현
두 번째 작업은 모델이 60가지 서로 다른 디자인 스타일을 재현해 Bento 카드 세트로 표현하도록 요구했다.
보고에 따르면 DeepSeek V4 Pro는 각기 다른 디자인에서 타이포그래피, 컬러 조합, 레이아웃을 구분해 냈다.
동일한 프롬프트가 Grok 4.6에 주어졌을 때, Grok이 우위를 점했다. 원문에 따르면 Grok의 일부 페이지는 레이아웃, 색감, 시각적 위계에서 더 성숙했고, 최종 결과물이 더 정교했다.
3D 브레이크아웃 게임 구축
세 번째 작업은 처음부터 3D 브레이크아웃 게임을 만드는 것이었다.
DeepSeek V4 Pro는 3D 환경, 배경 음악, 동적 사운드 효과, 인터랙션 피드백을 포함한 플레이 가능한 게임을 생성했다.
Grok 4.6도 이번 라운드에서 손색없는 성과를 냈다. 원문은 두 결과물의 시각적 품질, 장면 완성도, 플레이 가능성 측면에서 거의 동급이라고 평가했다.
Flappy Bird 테스트가 또 다른 트레이드오프를 드러내다
더 세밀한 테스트는 개발자 준 송이 진행했다. 그는 DeepSeek V4 Pro와 Grok 4.6에게 완전히 동일한 프롬프트를 주고 처음부터 Flappy Bird 스타일 게임을 구축하도록 요구했다.
두 모델은 완전히 다른 접근 방식을 취했다.
DeepSeek V4 Pro는 20,000개 이상의 토큰을 사용했지만, 보고된 API 비용은 0달러였다. 해당 모델의 API 가격 정책(DeepSeek 한시 프로모션 기간)이 입력 및 출력 토큰 모두를 완전히 무료로 처리했기 때문이다.
Grok 4.6은 약 5,000개의 토큰을 사용했고, 비용은 0.03달러로 보고되었다.
따라서 이번 특정 실행에서 Grok의 토큰 효율이 더 높았지만, 원문 기사에 따르면 DeepSeek이 더 강력한 최종 결과물을 생산했다.
보고에 따르면 DeepSeek 버전에는 층층이 겹친 산맥 배경, 구름, 그라데이션, 입체감 있는 파이프, 그리고 캐릭터가 파이프를 통과할 때 떠오르는 “+1” 애니메이션까지 포함되어 있었다.
원문 기사의 결론은 가치가 있다. 더 적은 토큰 소비가 자동으로 더 나은 애플리케이션 결과를 의미하지 않으며, 더 많은 토큰 소비가 반드시 더 높은 비용을 의미하지도 않는다는 것이다.
또 다른 프론트엔드 테스트도 DeepSeek의 우세
개발자 함자가 또 다른 프론트엔드 생성 테스트를 실행했고, 원문 기사는 DeepSeek V4 Pro가 다시 승리했다고 보도했다.
생성된 페이지는 전반적인 완성도와 시각적 품질에서 더 우월한 것으로 묘사되었다.
Grok 4.6의 결과입니다.
이는 이전 작업에서 관찰된 패턴을 강화합니다. 두 모델은 매우 근접하지만, 각각의 강점은 특정 애플리케이션과 프롬프트에 따라 달라집니다.
V4 Pro에는 여전히 약점이 있습니다
DeepSeek V4 Pro가 모든 시각적 생성 테스트에서 승리한 것은 아닙니다.
펠리컨과 관련된 비교에서 V4 Pro 버전은 전체적인 시각적 완성도에서 Flash 버전보다 우세했고 더 매력적인 코끼리 일러스트레이션을 생성했지만, 펠리컨의 이동 방향이 잘못되었습니다.
이는 작은 예시이지만, 생성형 코딩과 시각적 시스템의 일반적인 한계를 부각합니다. 결과물이 정교해 보일 수 있음에도 여전히 기본적인 의미론적 또는 운동 오류를 포함할 수 있다는 점입니다.
Three.js 벚꽃 나무: 격차가 더욱 두드러짐
출처 기사는 이후 난이도를 높여 DeepSeek V4 Pro, GPT-5.6 Sol, Claude Opus 5에게 Three.js를 사용해 동일한 벚꽃 나무를 생성하도록 요구했습니다.
이번에는 차이가 더욱 뚜렷했습니다.
기사에 따르면 DeepSeek V4 Pro는 나무 줄기와 가지 디테일, 잎사귀, 조명, 피사계 심도, 그리고 전반적인 분위기에서 다른 두 모델에 뒤처졌습니다.
이 결과는 비교가 단순한 승리 서사가 되는 것을 방지한다는 점에서 중요합니다. DeepSeek V4 Pro는 엔드투엔드 코딩 작업에서는 매우 강력할 수 있지만, 다른 최첨단 모델이 더 정교한 결과를 만들어내는 특정 시각적 생성 시나리오가 여전히 존재합니다.
전반적으로: DeepSeek V4 Pro와 Grok 4.6은 유사한 수준
여러 차례의 테스트를 거친 끝에 출처 기사의 전반적인 판단은 DeepSeek V4 Pro와 Grok 4.6이 유사한 경쟁 수준에 도달했다는 것입니다.
두 모델 모두 모든 작업에서 승리할 수는 없습니다.
DeepSeek V4 Pro는 일부 엔드투엔드 코딩 및 애플리케이션 구축 작업에서 특히 강력해 보였으며, Grok 4.6은 토큰을 더 절약하고 일부 시각적 디자인 및 지식 작업 비교에서 우위를 보였습니다.
이로 인해 이 비교는 단일 리더보드 점수보다 더 유용합니다. 개발자에게 더 나은 모델은 코딩 품질, 에이전트 신뢰성, 시각적 정교함, 토큰 효율성, 또는 API 비용 중 무엇을 우선시하는지에 따라 달라질 수 있습니다.
두 AI 모델이 최첨단과의 격차를 좁히고 있습니다
출처 기사는 DeepSeek V4 Pro와 Grok 4.6의 동시 출시를 AI 시장의 이례적인 순간으로 묘사했습니다.
Rick De Oliveira의 반응은 기사에서 다음과 같이 인용되었습니다.
원문 기사의 핵심 관점은 두 모델 모두 강력하면서도 가격이 저렴하다는 것입니다.
이러한 조합이 두 모델의 출시를 주목받게 만든 이유입니다.
DeepSeek의 공식 문서는 V4 Pro가 도구 호출, 긴 컨텍스트 작업 부하, 그리고 사고 및 비사고 모드를 위해 설계되었음을 확인합니다.
xAI의 공식 Grok 관련 자료 역시 최신 세대의 Grok을 코딩, 에이전트 작업, 지식 작업에 포지셔닝합니다. 예를 들어, 공식 Grok 4.5 발표에서는 이 모델을 코딩, 에이전트 작업, 지식 작업을 위해 구축되었다고 설명하고 실제 엔지니어링 벤치마크 결과를 보고했습니다.
개별 벤치마크 수치가 변하더라도 더 넓은 추세는 분명합니다. 최첨단 AI가 점점 더 개발자에게 접근 가능해지고 있으며, 가성비가 모델 경쟁에서 점점 더 중요한 부분이 되고 있습니다.
다음에는 무엇이 일어날까?
출처 기사는 마지막으로 다음 경쟁 라운드의 방향을 지적했습니다.
xAI가 이미 Grok 4.7을 예고했으며, OpenAI와 Anthropic도 각자의 모델 업데이트를 통해 계속 대응할 것으로 예상된다고 언급했습니다.
이는 오늘의 벤치마크 선두주자가 오랫동안 선두를 유지하지 못할 수 있음을 의미합니다.
개발자에게 더 지속적인 교훈은 다음과 같습니다. 실제로 자신의 워크플로우에 영향을 미치는 작업을 기준으로 모델을 평가해야 한다는 것입니다. 벤치마크에서 높은 점수를 받았지만 자신의 코드베이스, 배포 파이프라인, UI 요구 사항, 또는 도구 체인에서 성능이 좋지 않은 모델은 여전히 올바른 선택이 아닐 수 있습니다.
자주 묻는 질문
DeepSeek V4 Pro란 무엇인가요?
DeepSeek V4 Pro는 DeepSeek의 V4 플래그십 모델로, 추론, 코딩, 도구 사용, 긴 컨텍스트 작업 부하를 대상으로 합니다. DeepSeek 공식 문서는 100만 토큰 컨텍스트 창과 도구 호출 지원을 명시하며, OpenAI 형식과 Anthropic 형식의 API 액세스를 모두 제공합니다.
DeepSeek V4 Pro는 Grok 4.6과 어떻게 비교되나요?
출처 기사에 따르면 이 두 모델은 여러 에이전트 및 코딩 테스트에서 근접한 성적을 보이며 각각 승패를 주고받았습니다. DeepSeek V4 Pro는 여러 엔드투엔드 애플리케이션 구축 테스트에서 특히 뛰어난 성능을 보였고, Grok 4.6은 코딩, 지식 작업 및 일부 시각적 디자인 작업에서 강력한 결과를 보였습니다.
DeepSeek V4 Pro가 Grok보다 저렴한가요?
출처 기사의 2026년 8월 14일 비교에 따르면 DeepSeek V4 Pro의 보고된 출력 가격은 백만 토큰당 0.87달러인 반면, Grok 4.6은 6달러입니다. DeepSeek 공식 가격 페이지는 현재 V4 Pro 출력 토큰 백만 개당 0.87달러를 확인하지만, API 가격은 변동될 수 있습니다.
DeepSeek V4 Pro는 웹사이트와 게임을 구축할 수 있나요?
출처 기사는 DeepSeek V4 Pro가 3D 지구 체험, 웹사이트, Bento 스타일 디자인 모음, 3D 벽돌 깨기 게임, Flappy Bird 스타일 게임을 생성한 성공적인 테스트 사례를 보도했습니다. 이는 보고된 실제 테스트 결과이며, 모든 프롬프트에서 동일한 품질을 보장하는 약속이 아닙니다.
DeepSeek V4 Pro는 AI 코딩 에이전트에 적합한가요?
이 모델은 도구 호출과 에이전트 작업 부하를 위해 설계되었으며, 출처 기사는 여러 에이전트 및 소프트웨어 엔지니어링 벤치마크에서 강력한 성능을 보였다고 보도했습니다. DeepSeek 공식 문서 역시 V4 Pro의 도구 호출 지원을 명시합니다.
DeepSeek V4 Pro가 항상 다른 최첨단 모델을 이기나요?
아닙니다. 출처 기사에는 GPT-5.6 Sol과 Claude Opus 5가 더 나은 결과를 보인 테스트가 포함되어 있으며, 특히 Three.js 벚꽃 나무 생성 비교에서 그러했습니다. 작업에 따라 결과 차이가 상당합니다.
벤치마크 점수 외에 개발자는 무엇을 비교해야 하나요?
개발자는 API 비용, 지연 시간, 컨텍스트 길이, 도구 호출, 코딩 신뢰성, 출력 품질, 그리고 모델이 기존 에이전트 워크플로우와 얼마나 잘 맞는지도 비교해야 합니다. 프로덕션 시스템의 경우 일관성과 총비용이 벤치마크의 미세한 차이보다 더 중요할 수 있습니다.
관련 도구
- DeepSeek API: DeepSeek 모델에 접근하는 공식 API 엔드포인트.
- DeepSeek API 문서: 모델, 가격, 도구 호출, API 통합에 관한 공식 문서.
- xAI API: Grok 모델로 구축하기 위한 공식 개발자 리소스.
- Grok: xAI의 사용자 대상 Grok 서비스로, 모델과 상호작용하기 위한 것입니다.
- Three.js: 기사에서 설명된 Three.js 생성 테스트와 관련된 JavaScript 3D 라이브러리.
관련 링크
- DeepSeek 모델 및 가격: 공식 DeepSeek API 모델 사양 및 현재 토큰 가격.
- DeepSeek V4 문서: 공식 DeepSeek API 문서 및 통합 가이드.
- xAI Grok 4.5 발표: 현재 Grok 세대의 코딩 및 에이전트 기능을 다루는 xAI 공식 발표.
- xAI API 문서: xAI 개발자 플랫폼을 통해 Grok을 사용하는 공식 문서.
- Three.js: 공식 Three.js 프로젝트 웹사이트 및 문서.
- [DeepSeek API
GitHub](https://github.com/deepseek-ai): 공식 DeepSeek GitHub 조직입니다.
요약
DeepSeek V4 Pro와 Grok 4.6은 동시에 두 방향에서 첨단 AI를推动하고 있습니다: 더 강력한 현실 세계 에이전트 및 코딩 성능, 그리고 더 공격적인 가성비.
초기 테스트에서 올인원 승자는 나오지 않았습니다. DeepSeek V4 Pro는 여러 엔드투엔드 애플리케이션 구축 작업에서 강력한 성능을 보였고, Grok 4.6은 경쟁력 있는 코딩, 지식 작업 및 비주얼 디자인 능력을 보여주었습니다.
더 큰 변화는 개발자들이 이제 프론티어급 가격을 자동으로 지불하지 않고도 더 강력한 모델을 선택할 수 있게 되었다는 점입니다.