DeepSeek V4 Pro ocupa o segundo lugar no benchmark de programação de terminais SuperCLUE, com custo apenas uma fração do Kimi K3

O DeepSeek-V4-Pro-0813 ficou em segundo lugar no mais recente benchmark SuperCLUE-Terminal de programação para terminais inteligentes em chinês, com pontuação de 51,52, ficando atrás apenas do Kimi K3.

发布于 2026年8月14日generalGEO 评分: 04 次阅读
DeepSeek V4 Pro ocupa o segundo lugar no benchmark de programação de terminais SuperCLUE, com custo apenas uma fração do Kimi K3

DeepSeek V4 Pro conquista o segundo lugar no benchmark de programação de terminal SuperCLUE com uma fração do custo do Kimi K3

Introdução

O DeepSeek-V4-Pro-0813 conquistou o segundo lugar no mais recente benchmark SuperCLUE-Terminal de programação de terminal para agentes de IA em chinês, com uma pontuação de 51,52 pontos. Ele fica atrás apenas do Kimi K3, que lidera o ranking com 60,61 pontos.

O que torna este resultado particularmente notável é a sua vantagem em termos de custo. Na execução do benchmark, o DeepSeek-V4-Pro-0813 custou em média cerca de R$ 1,42 por tarefa, demonstrando uma forte relação custo-benefício entre os modelos de alta pontuação.

O SuperCLUE-Terminal é projetado em torno de tarefas reais de programação para desenvolvedores chineses. Os modelos são avaliados através de um framework de agente genérico baseado no Claude Code, permitindo que o benchmark compare o desempenho dos modelos na compreensão de requisitos em chinês, planejamento de tarefas em múltiplas etapas, uso de ferramentas, depuração de problemas e modificação de código através de fluxos de trabalho de ponta a ponta.

DeepSeek V4 Pro fica em segundo lugar na mais recente avaliação de programação

O benchmark foi projetado para refletir o trabalho real de desenvolvimento, e não problemas curtos e isolados de programação. De acordo com os resultados publicados, uma única tarefa pode exigir cerca de 50 a 110 rodadas de interação, e uma execução completa de uma tarefa pode levar aproximadamente 30 a 90 minutos.

No ranking atual, o Kimi K3 mantém o primeiro lugar com 60,61 pontos. O DeepSeek-V4-Pro-0813 vem logo em seguida com 51,52 pontos, à frente do GLM-5.2 com 48,48 pontos e do DeepSeek-V4-Flash-0731, uma versão anterior, com 46,46 pontos.

Modelo Pontuação SuperCLUE-Terminal Custo médio reportado por tarefa
Kimi K3 (máx.) 60,61 R$ 19,63
DeepSeek-V4-Pro-0813 (máx.) 51,52 R$ 1,42
GLM-5.2 (máx.) 48,48 R$ 23,30
DeepSeek-V4-Flash-0731 (máx.) 46,46 R$ 0,64

Os dados acima vêm do ambiente de benchmark SuperCLUE-Terminal e devem ser entendidos como custos de execução do benchmark, não como preços fixos por tarefa dos provedores de modelos.

A DeepSeek confirmou separadamente que o modelo de API de produção deepseek-v4-pro agora aponta para o DeepSeek-V4-Pro-0813. O modelo está disponível através do aplicativo web da DeepSeek, aplicativos móveis e API.

Apenas R$ 1,42 por tarefa: uma vantagem de custo notável

A parte mais impressionante deste resultado é o custo reportado do DeepSeek-V4-Pro-0813.

No benchmark, seu custo médio foi de cerca de R$ 1,42/tarefa, aproximadamente um quatorze avos do Kimi K3 (R$ 19,63) e cerca de um dezesseis avos do GLM-5.2 (R$ 23,30) na mesma comparação do SuperCLUE.

Essa diferença é importante porque a diferença de pontuação entre modelos de programação de alto desempenho pode ser relativamente pequena, enquanto o custo de executar tarefas de agente de longa duração pode variar drasticamente. Para pequenas empresas, desenvolvedores independentes e equipes que precisam executar agentes de programação repetidamente, o custo de execução pode ser tão importante quanto a pontuação principal do benchmark.

A avaliação abrange cenários reais de desenvolvimento, incluindo páginas front-end, jogos 3D e modificações de scripts de engenharia. Nos testes reportados, o DeepSeek-V4-Pro-0813 foi capaz de completar a lógica de desenvolvimento de jogos envolvendo tratamento de colisões, pontuação e estados de fim de jogo.

Comportamento de desempenho, enquanto os estilos de interface e os feedbacks de interação produzidos também superaram os efeitos básicos de template.

Algumas tarefas criativas de desenho ainda apresentam pequenos problemas estruturais, mas a qualidade geral de conclusão permanece no mesmo nível do grupo líder.

Para equipes de desenvolvimento sensíveis a orçamento, este resultado dá ao DeepSeek-V4-Pro-0813 um posicionamento claro: desempenho próximo ao dos agentes de programação de ponta, com custo de execução de benchmark muito inferior ao de vários concorrentes com preços mais altos.

Perguntas Frequentes

O que é o DeepSeek-V4-Pro-0813?

O DeepSeek-V4-Pro-0813 é a versão de produção atual por trás do nome do modelo de API deepseek-v4-pro. A DeepSeek lançou oficialmente a versão GA em 13 de agosto de 2026, com capacidades aprimoradas de agente e suporte para seu aplicativo web, aplicativos móveis e API.

O que é o SuperCLUE-Terminal?

O SuperCLUE-Terminal é um benchmark voltado para tarefas de terminal de agentes, focado em fluxos de trabalho reais de programação e engenharia em chinês. Ele avalia o desempenho de ponta a ponta, como compreensão de requisitos, planejamento, execução de comandos, modificação de arquivos, depuração e conclusão final de tarefas.

Por que o benchmark usa o Claude Code?

O benchmark utiliza um framework de agente genérico para que os modelos participantes sejam testados em um ambiente de execução mais comparável. O Claude Code fornece o ambiente de agente tipo terminal para executar as tarefas, enquanto o modelo subjacente é trocado a cada avaliação.

R$ 1,42 é o preço oficial por tarefa do DeepSeek V4 Pro?

Não. R$ 1,42 é o custo médio observado por tarefa nesta execução do benchmark SuperCLUE-Terminal, calculado com base no uso de tokens e na metodologia de preços do benchmark. O custo real da API depende de tokens de entrada, tokens de saída, uso de cache, configurações de raciocínio e dos preços atuais do provedor.

Como o DeepSeek V4 Pro se compara ao Kimi K3 neste benchmark?

O Kimi K3 obteve uma pontuação maior, de 60,61 pontos, contra 51,52 do DeepSeek-V4-Pro-0813. No entanto, o relatório do benchmark mostra que o Kimi K3 teve um custo médio por tarefa de R$ 19,63, enquanto o DeepSeek-V4-Pro-0813 custou apenas R$ 1,42, o que dá à DeepSeek uma vantagem significativa de custo nesta avaliação específica.

O DeepSeek V4 Pro suporta contexto longo e fluxos de trabalho de agente?

Sim. A documentação oficial da API da DeepSeek lista o DeepSeek V4 Pro com comprimento de contexto de 1 milhão de tokens e suporte para chamada de ferramentas, API Responses, API compatível com Anthropic e várias configurações de intensidade de raciocínio. A DeepSeek posiciona explicitamente a versão GA como uma atualização para cargas de trabalho de agente.

O DeepSeek V4 Pro é sempre melhor que o GLM-5.2 em programação?

Não necessariamente. Neste resultado do SuperCLUE-Terminal, o DeepSeek-V4-Pro-0813 obteve 51,52 pontos contra 48,48 do GLM-5.2, mas um único benchmark não pode determinar o desempenho em todas as cargas de trabalho de programação. Tamanho do repositório, linguagem, ambiente de ferramentas, comportamento de contexto longo, latência e custo influenciam a escolha do modelo.

Ferramentas Relacionadas

Os benchmarks discutidos neste artigo comparam a programação terminal de agentes inteligentes.

  • Claude Code: A ferramenta de codificação por agente da Anthropic, usada como estrutura de execução geral nos benchmarks.
  • Kimi API: A plataforma oficial para desenvolvedores da Moonshot AI para os modelos Kimi K3 e outros modelos Kimi.
  • Z.AI GLM-5.2: A visão geral oficial do GLM-5.2, que também obteve pontuações altas nos benchmarks.

Links relacionados

Resumo

O DeepSeek-V4-Pro-0813 obteve 51,52 pontos no SuperCLUE-Terminal, ficando em segundo lugar nesse benchmark, atrás apenas do Kimi K3, e à frente do GLM-5.2 e do DeepSeek-V4-Flash-0731.

Sua principal vantagem está no custo: o custo médio relatado pelo SuperCLUE é de aproximadamente R$ 1,42 por tarefa, muito abaixo dos custos registrados pelo Kimi K3 e GLM-5.2 na mesma avaliação.

Esse resultado não significa que o DeepSeek V4 Pro seja o melhor modelo de codificação de forma geral, mas indica que, para tarefas de programação longas e intensivas em ferramentas, o modelo oferece um bom equilíbrio entre desempenho de codificação por agente e custo de execução.

Para equipes que se preocupam tanto com a capacidade de agentes de codificação quanto com os custos operacionais, o DeepSeek-V4-Pro-0813 é uma das opções mais competitivas nesta comparação do SuperCLUE-Terminal.

DeepSeek V4 Pro在SuperCLUE终端编程基准测试中排名第二,成本仅为Kimi K3的一小部分