DeepSeek V4 Pro ocupa o segundo lugar no benchmark de programação de terminais SuperCLUE, com custo apenas uma fração do Kimi K3
O DeepSeek-V4-Pro-0813 ficou em segundo lugar no mais recente benchmark SuperCLUE-Terminal de programação para terminais inteligentes em chinês, com pontuação de 51,52, ficando atrás apenas do Kimi K3.

DeepSeek V4 Pro conquista o segundo lugar no benchmark de programação de terminal SuperCLUE com uma fração do custo do Kimi K3
Introdução
O DeepSeek-V4-Pro-0813 conquistou o segundo lugar no mais recente benchmark SuperCLUE-Terminal de programação de terminal para agentes de IA em chinês, com uma pontuação de 51,52 pontos. Ele fica atrás apenas do Kimi K3, que lidera o ranking com 60,61 pontos.
O que torna este resultado particularmente notável é a sua vantagem em termos de custo. Na execução do benchmark, o DeepSeek-V4-Pro-0813 custou em média cerca de R$ 1,42 por tarefa, demonstrando uma forte relação custo-benefício entre os modelos de alta pontuação.
O SuperCLUE-Terminal é projetado em torno de tarefas reais de programação para desenvolvedores chineses. Os modelos são avaliados através de um framework de agente genérico baseado no Claude Code, permitindo que o benchmark compare o desempenho dos modelos na compreensão de requisitos em chinês, planejamento de tarefas em múltiplas etapas, uso de ferramentas, depuração de problemas e modificação de código através de fluxos de trabalho de ponta a ponta.

DeepSeek V4 Pro fica em segundo lugar na mais recente avaliação de programação
O benchmark foi projetado para refletir o trabalho real de desenvolvimento, e não problemas curtos e isolados de programação. De acordo com os resultados publicados, uma única tarefa pode exigir cerca de 50 a 110 rodadas de interação, e uma execução completa de uma tarefa pode levar aproximadamente 30 a 90 minutos.
No ranking atual, o Kimi K3 mantém o primeiro lugar com 60,61 pontos. O DeepSeek-V4-Pro-0813 vem logo em seguida com 51,52 pontos, à frente do GLM-5.2 com 48,48 pontos e do DeepSeek-V4-Flash-0731, uma versão anterior, com 46,46 pontos.
| Modelo | Pontuação SuperCLUE-Terminal | Custo médio reportado por tarefa |
|---|---|---|
| Kimi K3 (máx.) | 60,61 | R$ 19,63 |
| DeepSeek-V4-Pro-0813 (máx.) | 51,52 | R$ 1,42 |
| GLM-5.2 (máx.) | 48,48 | R$ 23,30 |
| DeepSeek-V4-Flash-0731 (máx.) | 46,46 | R$ 0,64 |
Os dados acima vêm do ambiente de benchmark SuperCLUE-Terminal e devem ser entendidos como custos de execução do benchmark, não como preços fixos por tarefa dos provedores de modelos.
A DeepSeek confirmou separadamente que o modelo de API de produção deepseek-v4-pro agora aponta para o DeepSeek-V4-Pro-0813. O modelo está disponível através do aplicativo web da DeepSeek, aplicativos móveis e API.
Apenas R$ 1,42 por tarefa: uma vantagem de custo notável
A parte mais impressionante deste resultado é o custo reportado do DeepSeek-V4-Pro-0813.
No benchmark, seu custo médio foi de cerca de R$ 1,42/tarefa, aproximadamente um quatorze avos do Kimi K3 (R$ 19,63) e cerca de um dezesseis avos do GLM-5.2 (R$ 23,30) na mesma comparação do SuperCLUE.
Essa diferença é importante porque a diferença de pontuação entre modelos de programação de alto desempenho pode ser relativamente pequena, enquanto o custo de executar tarefas de agente de longa duração pode variar drasticamente. Para pequenas empresas, desenvolvedores independentes e equipes que precisam executar agentes de programação repetidamente, o custo de execução pode ser tão importante quanto a pontuação principal do benchmark.
A avaliação abrange cenários reais de desenvolvimento, incluindo páginas front-end, jogos 3D e modificações de scripts de engenharia. Nos testes reportados, o DeepSeek-V4-Pro-0813 foi capaz de completar a lógica de desenvolvimento de jogos envolvendo tratamento de colisões, pontuação e estados de fim de jogo.
Comportamento de desempenho, enquanto os estilos de interface e os feedbacks de interação produzidos também superaram os efeitos básicos de template.
Algumas tarefas criativas de desenho ainda apresentam pequenos problemas estruturais, mas a qualidade geral de conclusão permanece no mesmo nível do grupo líder.
Para equipes de desenvolvimento sensíveis a orçamento, este resultado dá ao DeepSeek-V4-Pro-0813 um posicionamento claro: desempenho próximo ao dos agentes de programação de ponta, com custo de execução de benchmark muito inferior ao de vários concorrentes com preços mais altos.
Perguntas Frequentes
O que é o DeepSeek-V4-Pro-0813?
O DeepSeek-V4-Pro-0813 é a versão de produção atual por trás do nome do modelo de API deepseek-v4-pro. A DeepSeek lançou oficialmente a versão GA em 13 de agosto de 2026, com capacidades aprimoradas de agente e suporte para seu aplicativo web, aplicativos móveis e API.
O que é o SuperCLUE-Terminal?
O SuperCLUE-Terminal é um benchmark voltado para tarefas de terminal de agentes, focado em fluxos de trabalho reais de programação e engenharia em chinês. Ele avalia o desempenho de ponta a ponta, como compreensão de requisitos, planejamento, execução de comandos, modificação de arquivos, depuração e conclusão final de tarefas.
Por que o benchmark usa o Claude Code?
O benchmark utiliza um framework de agente genérico para que os modelos participantes sejam testados em um ambiente de execução mais comparável. O Claude Code fornece o ambiente de agente tipo terminal para executar as tarefas, enquanto o modelo subjacente é trocado a cada avaliação.
R$ 1,42 é o preço oficial por tarefa do DeepSeek V4 Pro?
Não. R$ 1,42 é o custo médio observado por tarefa nesta execução do benchmark SuperCLUE-Terminal, calculado com base no uso de tokens e na metodologia de preços do benchmark. O custo real da API depende de tokens de entrada, tokens de saída, uso de cache, configurações de raciocínio e dos preços atuais do provedor.
Como o DeepSeek V4 Pro se compara ao Kimi K3 neste benchmark?
O Kimi K3 obteve uma pontuação maior, de 60,61 pontos, contra 51,52 do DeepSeek-V4-Pro-0813. No entanto, o relatório do benchmark mostra que o Kimi K3 teve um custo médio por tarefa de R$ 19,63, enquanto o DeepSeek-V4-Pro-0813 custou apenas R$ 1,42, o que dá à DeepSeek uma vantagem significativa de custo nesta avaliação específica.
O DeepSeek V4 Pro suporta contexto longo e fluxos de trabalho de agente?
Sim. A documentação oficial da API da DeepSeek lista o DeepSeek V4 Pro com comprimento de contexto de 1 milhão de tokens e suporte para chamada de ferramentas, API Responses, API compatível com Anthropic e várias configurações de intensidade de raciocínio. A DeepSeek posiciona explicitamente a versão GA como uma atualização para cargas de trabalho de agente.
O DeepSeek V4 Pro é sempre melhor que o GLM-5.2 em programação?
Não necessariamente. Neste resultado do SuperCLUE-Terminal, o DeepSeek-V4-Pro-0813 obteve 51,52 pontos contra 48,48 do GLM-5.2, mas um único benchmark não pode determinar o desempenho em todas as cargas de trabalho de programação. Tamanho do repositório, linguagem, ambiente de ferramentas, comportamento de contexto longo, latência e custo influenciam a escolha do modelo.
Ferramentas Relacionadas
- DeepSeek API: Plataforma oficial de API para acessar os modelos DeepSeek, incluindo
deepseek-v4-pro. - SuperCLUE-Terminal: Esta
Os benchmarks discutidos neste artigo comparam a programação terminal de agentes inteligentes.
- Claude Code: A ferramenta de codificação por agente da Anthropic, usada como estrutura de execução geral nos benchmarks.
- Kimi API: A plataforma oficial para desenvolvedores da Moonshot AI para os modelos Kimi K3 e outros modelos Kimi.
- Z.AI GLM-5.2: A visão geral oficial do GLM-5.2, que também obteve pontuações altas nos benchmarks.
Links relacionados
- Lançamento da versão oficial DeepSeek-V4-Pro: Anúncio oficial da DeepSeek sobre a versão V4 Pro de nível de produção.
- Modelos e preços da DeepSeek: Versões oficiais dos modelos, limites de contexto, recursos e preços atuais da API.
- Guia de início rápido da API DeepSeek: Instruções oficiais para acessar
deepseek-v4-provia API. - Benchmark SuperCLUE-Terminal: Página oficial do benchmark com rankings e comparação de custos.
- Documentação da API Kimi K3: Documentação oficial da Kimi cobrindo o modelo K3 e o uso da API.
- Documentação do Claude Code: Documentação oficial da estrutura de agente de codificação usada nos benchmarks.
- Visão geral oficial do GLM-5.2: Apresentação oficial da Z.AI sobre o GLM-5.2 e suas capacidades de codificação de longo alcance.
Resumo
O DeepSeek-V4-Pro-0813 obteve 51,52 pontos no SuperCLUE-Terminal, ficando em segundo lugar nesse benchmark, atrás apenas do Kimi K3, e à frente do GLM-5.2 e do DeepSeek-V4-Flash-0731.
Sua principal vantagem está no custo: o custo médio relatado pelo SuperCLUE é de aproximadamente R$ 1,42 por tarefa, muito abaixo dos custos registrados pelo Kimi K3 e GLM-5.2 na mesma avaliação.
Esse resultado não significa que o DeepSeek V4 Pro seja o melhor modelo de codificação de forma geral, mas indica que, para tarefas de programação longas e intensivas em ferramentas, o modelo oferece um bom equilíbrio entre desempenho de codificação por agente e custo de execução.
Para equipes que se preocupam tanto com a capacidade de agentes de codificação quanto com os custos operacionais, o DeepSeek-V4-Pro-0813 é uma das opções mais competitivas nesta comparação do SuperCLUE-Terminal.