DeepSeek V4 Pro vs Grok 4.6: Primeiro teste no mundo real coloca ambos os modelos no topo da categoria
Os dois grandes modelos de IA foram lançados quase ao mesmo tempo, colocando DeepSeek V4 Pro e Grok 4.6 diretamente no centro das atenções. O DeepSeek V4 Pro se destaca em agentes e

DeepSeek V4 Pro vs Grok 4.6: Primeiro Teste no Mundo Real Coloca Ambos os Modelos no Topo
Introdução
Dois modelos de IA de peso foram lançados quase simultaneamente, colocando o DeepSeek V4 Pro e o Grok 4.6 diretamente no centro das atenções.
O DeepSeek V4 Pro apresenta um salto significativo em desempenho de agentes e engenharia de software, enquanto o Grok 4.6 se destaca em codificação, trabalho do conhecimento e capacidades abrangentes. O artigo original descreve esses dois lançamentos como um desafio direto aos modelos de ponta atuais da OpenAI e da Anthropic.
O que torna esta comparação especialmente interessante é que ambos os modelos não estão sendo avaliados apenas em tabelas de benchmarks. Os primeiros testes no mundo real também exigiram que eles usassem os mesmos prompts para construir sites, criar jogos, reproduzir designs visuais e gerar experiências 3D.
O resultado não foi uma competição simples de "o vencedor leva tudo", mas sim um confronto equilibrado — cada modelo tem áreas em que se destaca.
DeepSeek V4 Pro Entra em Cena, Grok 4.6 Acompanha
O artigo original destaca vários resultados de benchmarks do DeepSeek V4 Pro.
Na avaliação de agentes de cibersegurança CyberGym, o DeepSeek V4 Pro teria obtido 83,3, superando por pouco o Fable 5 com 83,1 e o Opus 4.8 com 78,3.
No AutomationBench, alcançou 31,8, à frente do Fable 5 com 29,1 e do Opus 4.8 com 27,2.
O resultado mais acirrado foi no Terminal-Bench 2.1. O DeepSeek V4 Pro marcou 87,9, enquanto o Opus 4.8 obteve 85,0 e o Fable 5, 88,0.
O artigo original também relata uma pontuação de 60,0 na configuração com ferramentas habilitadas do Humanity's Last Exam, enquanto o Opus 4.8 obteve 57,9 e o Fable 5, 63,0.
O DeepSWE também foi outra melhoria significativa mencionada no relatório. O DeepSeek V4 Pro alcançou 62,7, um grande avanço em relação aos 12,8 da versão de pré-visualização, superando os 58,0 relatados pelo Opus 4.8, mas ainda abaixo dos 70,0 do Fable 5.
O Grok 4.6 foi testado em várias áreas em comparação com o GPT-5.6 e o Fable 5.
O artigo original relata um Índice de Inteligência Abrangente de 61, um ponto atrás do Fable 5, que obteve 62.
No CursorBench, o Grok 4.6 teria alcançado 69,9%, à frente dos 67,2% do GPT-5.6 e próximo dos 70,5% do Fable 5.
No FrontierCode, atingiu 61,3%, também ligeiramente à frente dos 60,6% do GPT-5.6, mas atrás dos 63,6% do Fable 5.
O artigo original mostra um desempenho ainda mais forte no trabalho do conhecimento. O Grok 4.6 teria ficado em primeiro lugar nas três avaliações principais: 1.753 Elo no GDPval-AA v2, 1.577 Elo no AA-Briefcase e 15,8% no benchmark jurídico especializado Harvey LAB.
A principal conclusão que o artigo original extrai desses dados é direta: ambos os modelos já estão na conversa entre os sistemas de ponta.
A Diferença de Preço Também Faz Parte da História
Desempenho é apenas metade desta comparação.
O artigo original também destaca os custos de inferência. Ele relata os preços por milhão de tokens de saída no lançamento:
| Modelo | Preço por milhão de tokens de saída (relatado) |
|---|---|
| DeepSeek V4 Pro | US$ 0,87 |
| Grok 4.6 | US$ 6 |
| GPT-5.6 Sol | US$ 30 |
| Claude Opus 5 | US$ 25 |
| Fable 5 | US$ 50 |
Na visualização atual de preços em dólares, o custo por milhão de tokens de entrada sem cache é de US$ 0,435 e com cache é de US$ 0,003625.
A documentação do DeepSeek também
indica que seu modelo V4 suporta uma janela de contexto de 1 milhão de tokens, chamadas de ferramentas e acesso à API nos formatos OpenAI e Anthropic.
Os preços específicos de outros modelos mudam ao longo do tempo, portanto, as comparações de preços entre modelos no artigo original devem ser vistas como um retrato da data de lançamento, e não como uma tabela de preços de longo prazo.
Primeiro Teste Real: DeepSeek V4 Pro Constrói um Globo 3D
O primeiro teste prático descrito no artigo apresenta um requisito bastante elevado para o DeepSeek V4 Pro.
Com apenas um prompt, o modelo gerou uma experiência 3D interativa completa de um globo terrestre no navegador.
Segundo o relato, o resultado suporta interações básicas como arrastar, girar e ampliar, além de incluir fluxos de dados globais, rotas dinâmicas e marcadores geográficos espalhados pelo mundo.
Os detalhes visuais vão além. Dispersão atmosférica, nuvens, iluminação dia/noite e a interface ao redor estão incluídas na experiência gerada.
O ponto central deste teste não é apenas o fato de o modelo ter gerado uma página web, mas sim demonstrar até onde um modelo de programação por IA pode ir quando solicitado a coordenar design visual, renderização 3D, interação e estrutura de aplicação em uma única tarefa.
DeepSeek V4 Pro e Grok 4.6 em Confronto em Três Tarefas de Aplicação
Em seguida, o artigo original compara os dois modelos usando prompts iguais ou muito semelhantes.
O criador de IA Xiangyang Qiaomu primeiro executou três pequenas tarefas com o DeepSeek V4 Pro e depois passou dois dos mesmos prompts para o Grok 4.6.
Construir e Implantar um Site com Três Habilidades
A primeira tarefa exigia que o modelo usasse três habilidades para desenvolver e implantar um site.
Segundo o relato, o DeepSeek V4 Pro concluiu com sucesso todo o fluxo de trabalho. O artigo afirma que o design da página e a integridade geral apresentaram desempenho consistente.
Esse tipo de teste é especialmente importante para programação com agentes, pois o modelo precisa coordenar múltiplas ferramentas ou capacidades, em vez de apenas gerar um trecho de código.
Reproduzir 60 Estilos de Design em Cartões Bento
A segunda tarefa exigia que o modelo reproduzisse 60 estilos de design diferentes e os apresentasse como um conjunto de cartões Bento.
Segundo o relato, o DeepSeek V4 Pro diferenciou tipografia, paletas de cores e layouts entre os diferentes designs.
Quando o mesmo prompt foi passado para o Grok 4.6, este levou vantagem. O artigo afirma que algumas páginas do Grok apresentavam layouts, cores e hierarquia visual mais maduros, resultando em um acabamento mais refinado.
Construir um Jogo 3D de Quebrar Blocos
A terceira tarefa foi criar um jogo 3D de quebrar blocos do zero.
O DeepSeek V4 Pro gerou um jogo jogável com ambiente 3D, música de fundo, efeitos sonoros dinâmicos e feedback interativo.
O Grok 4.6 teve desempenho equivalente nesta rodada. O artigo descreve os resultados de ambos como praticamente empatados em qualidade visual, integridade da cena e jogabilidade.
O Teste do Flappy Bird Revela Outra Troca
Um teste mais detalhado veio do desenvolvedor Jun Song, que deu ao DeepSeek V4 Pro e ao Grok 4.6 exatamente o mesmo prompt, pedindo para construir um jogo estilo Flappy Bird do zero.
Os dois modelos adotaram abordagens completamente diferentes.
O DeepSeek V4 Pro usou mais de 20.000 tokens, mas o custo relatado da API foi de US$ 0 — porque o preço da API do modelo (durante a oferta por tempo limitado do DeepSeek) tornou tanto os tokens de entrada quanto os de saída totalmente gratuitos.
O Grok 4.6 usou cerca de 5.000 tokens, com um custo relatado de US$ 0,03.
Portanto, nesta execução específica, o Grok foi mais eficiente em termos de tokens, mas, de acordo com o artigo original, o DeepSeek produziu um resultado final mais forte.
Segundo o relato, a versão do DeepSeek incluía um fundo de montanhas em camadas, nuvens, gradientes, tubos com efeito tridimensional e uma animação de "+1" flutuando quando o personagem passava pelos tubos.
A conclusão do artigo original é valiosa: menor consumo de tokens não significa automaticamente melhores resultados de aplicação, e maior consumo de tokens também não significa necessariamente custos mais altos.
Outro Teste de Front-End Também Favorece o DeepSeek
O desenvolvedor Hamza executou outro teste de geração de front-end, e o artigo original relata que o DeepSeek V4 Pro venceu novamente.
A página gerada foi descrita como superior em integridade geral e qualidade visual.
Resultados do Grok 4.6.
Isso reforça um padrão observado em tarefas anteriores: os dois modelos são muito próximos, mas seus pontos fortes variam dependendo da aplicação específica e do prompt.
V4 Pro ainda tem pontos fracos
O DeepSeek V4 Pro não venceu todos os testes de geração visual.
Em uma comparação envolvendo pelicanos, a versão V4 Pro supostamente superou a versão Flash em completude visual geral e gerou ilustrações de elefantes mais atraentes, mas a direção do movimento do pelicano estava errada.
Este é um exemplo pequeno, mas destaca uma limitação comum em sistemas de codificação generativa e visuais: os resultados podem parecer refinados e ainda assim conter erros semânticos ou de movimento básicos.
Cerejeira em Three.js: a diferença fica mais evidente
O artigo de origem então aumentou a dificuldade, pedindo que o DeepSeek V4 Pro, o GPT-5.6 Sol e o Claude Opus 5 gerassem a mesma cerejeira usando Three.js.
Desta vez, as diferenças foram mais claras.
O artigo relatou que o DeepSeek V4 Pro ficou atrás dos outros dois modelos em detalhes de tronco e galhos, folhagem, iluminação, profundidade de campo e atmosfera geral.
Esse resultado é importante porque impede que a comparação se torne uma narrativa simples de vitória. O DeepSeek V4 Pro pode ser extremamente poderoso em tarefas de codificação ponta a ponta, mas ainda existem alguns cenários especializados de geração visual em que outros modelos de fronteira produzem resultados mais refinados.
Visão geral: DeepSeek V4 Pro está em nível semelhante ao Grok 4.6
Após várias rodadas de testes, o veredito geral do artigo de origem é que o DeepSeek V4 Pro e o Grok 4.6 atingiram um nível competitivo semelhante.
Nenhum dos dois modelos consegue vencer todas as tarefas.
O DeepSeek V4 Pro parece particularmente forte em certas tarefas de codificação ponta a ponta e construção de aplicativos, enquanto o Grok 4.6 pode ser mais eficiente em tokens e demonstrou vantagens em algumas comparações de design visual e trabalho de conhecimento.
Isso torna essa comparação mais útil do que uma única pontuação de ranking. Para desenvolvedores, o modelo melhor pode depender de se a prioridade é qualidade de codificação, confiabilidade do agente, refinamento visual, eficiência de tokens ou custo de API.
Dois modelos de IA estão reduzindo a distância para a fronteira
O artigo de origem descreve o lançamento simultâneo do DeepSeek V4 Pro e do Grok 4.6 como um momento incomum no mercado de IA.
A reação de Rick De Oliveira, citada no artigo,
O ponto central do artigo original é que ambos os modelos são poderosos e acessíveis.
É essa combinação que torna seus lançamentos dignos de atenção.
A documentação oficial do DeepSeek confirma que o V4 Pro foi projetado para chamada de ferramentas, cargas de trabalho de contexto longo e modos de pensamento e não-pensamento.
Os materiais oficiais do Grok da xAI também posicionam sua geração mais recente do Grok em codificação, tarefas de agente e trabalho de conhecimento. Por exemplo, o anúncio oficial do Grok 4.5 descreve o modelo como construído especificamente para codificação, tarefas de agente e trabalho de conhecimento, e relata resultados reais de avaliações de engenharia.
Mesmo que os dados de benchmarks individuais variem, a tendência mais ampla é clara: IA de nível de fronteira está se tornando cada vez mais acessível para desenvolvedores, e o custo-benefício está se tornando uma parte cada vez mais importante da competição entre modelos.
O que vem a seguir?
O artigo de origem conclui apontando a direção da próxima rodada de competição.
Ele menciona que a xAI já antecipou o Grok 4.7, e espera-se que a OpenAI e a Anthropic continuem respondendo com suas próprias atualizações de modelos.
Isso significa que o líder de benchmarks de hoje pode não manter sua posição por muito tempo.
Para desenvolvedores, a lição mais duradoura é: avalie modelos com base nas tarefas que realmente impactam seu fluxo de trabalho. Um modelo com pontuação alta em benchmarks, mas que tenha desempenho ruim em seu código, pipeline de implantação, requisitos de UI ou cadeia de ferramentas, pode ainda não ser a escolha certa.
Perguntas frequentes
O que é o DeepSeek V4 Pro?
O DeepSeek V4 Pro é o modelo carro-chefe da série V4 da DeepSeek, voltado para raciocínio, codificação, uso de ferramentas e cargas de trabalho de contexto longo. A documentação oficial do DeepSeek lista uma janela de contexto de 1 milhão de tokens e suporte para chamada de ferramentas, além de oferecer acesso via API nos formatos OpenAI e Anthropic.
Como o DeepSeek V4 Pro se compara ao Grok 4.6?
O artigo de origem relata que os dois modelos tiveram desempenho semelhante em vários testes de agente e codificação, cada um vencendo em algumas áreas. O DeepSeek V4 Pro se destacou especialmente em vários testes de construção de aplicativos ponta a ponta, enquanto o Grok 4.6 mostrou resultados fortes em codificação, trabalho de conhecimento e algumas tarefas de design visual.
O DeepSeek V4 Pro é mais barato que o Grok?
De acordo com a comparação de 14 de agosto de 2026 no artigo de origem, o DeepSeek V4 Pro reportou um preço de saída de US$ 0,87 por milhão de tokens, enquanto o Grok 4.6 custa US$ 6. A página oficial de preços do DeepSeek atualmente confirma US$ 0,87 por milhão de tokens de saída para o V4 Pro, embora os preços de API possam mudar.
O DeepSeek V4 Pro consegue construir sites e jogos?
O artigo de origem relata casos de teste bem-sucedidos em que o DeepSeek V4 Pro gerou uma experiência de globo 3D, sites, uma coleção de designs estilo Bento, um jogo 3D de quebra-quebra e um jogo estilo Flappy Bird. Esses são resultados reais de testes relatados, não uma promessa de que toda solicitação produzirá qualidade equivalente.
O DeepSeek V4 Pro é adequado para agentes de codificação de IA?
Ele foi projetado para chamada de ferramentas e cargas de trabalho de agente, e o artigo de origem relata desempenho forte em várias avaliações de agente e engenharia de software. A documentação oficial do DeepSeek também lista suporte para chamada de ferramentas no V4 Pro.
O DeepSeek V4 Pro sempre supera outros modelos de fronteira?
Não. O artigo de origem inclui testes em que o GPT-5.6 Sol e o Claude Opus 5 tiveram desempenho
melhor, especialmente na comparação de geração da cerejeira em Three.js. Os resultados variam muito entre tarefas diferentes.
O que mais os desenvolvedores devem comparar além das pontuações de benchmark?
Os desenvolvedores também devem comparar custo de API, latência, comprimento do contexto, chamada de ferramentas, confiabilidade de codificação, qualidade de saída e o quão bem o modelo se adapta aos fluxos de trabalho de agente existentes. Para sistemas de produção, consistência e custo total podem ser mais importantes do que pequenas diferenças em benchmarks.
Ferramentas relacionadas
- API DeepSeek: Endpoint oficial da API para acessar os modelos DeepSeek.
- Documentação da API DeepSeek: Documentação oficial sobre modelos, preços, chamada de ferramentas e integração da API.
- API xAI: Recursos oficiais para desenvolvedores que desejam construir com os modelos Grok.
- Grok: Serviço oficial do Grok da xAI voltado ao usuário, para interagir com seus modelos.
- Three.js: Biblioteca JavaScript 3D relacionada aos testes de geração em Three.js descritos no artigo.
Links relacionados
- Modelos e preços DeepSeek: Especificações oficiais dos modelos da API DeepSeek e preços atuais de tokens.
- Documentação do DeepSeek V4: Documentação oficial da API DeepSeek e guias de integração.
- Anúncio do xAI Grok 4.5: Anúncio oficial da xAI cobrindo as capacidades de codificação e agente da geração atual do Grok.
- Documentação da API xAI: Documentação oficial para usar Grok por meio da plataforma de desenvolvedores da xAI.
- Three.js: Site oficial e documentação do projeto Three.js.
- [API DeepSeek
GitHub](https://github.com/deepseek-ai): organização oficial do DeepSeek no GitHub.
Resumo
O DeepSeek V4 Pro e o Grok 4.6 estão simultaneamente impulsionando a IA de ponta em duas direções: agentes de mundo real mais poderosos e desempenho de codificação, além de uma relação custo-benefício mais agressiva.
Os testes iniciais não produziram um vencedor absoluto. O DeepSeek V4 Pro apresentou um desempenho forte em diversas tarefas de construção de aplicativos de ponta a ponta, enquanto o Grok 4.6 demonstrou capacidades competitivas de codificação, trabalho de conhecimento e design visual.
A mudança mais significativa é que os desenvolvedores agora têm mais modelos mais capazes para escolher, sem precisar pagar automaticamente preços de nível avançado.