DeepSeek V4 Flash cria um jogo de tiro em 3D por US$ 0,07 — e é por isso que o modelo é tão barato

O DeepSeek V4 Flash 0731 entrou em versão beta pública e traz uma promessa conhecida: capacidade de codificação e agente mais forte a preços de API extremamente baixos. Os desenvolvedores rapidamente colocaram essa afirmação à prova.

发布于 2026年8月5日generalGEO 评分: 01 次阅读
Esta imagem é uma exibição relacionada ao DeepSeek V4 Flash 0731, destacando o conteúdo "Demonstração de Jogo por US$ 0,07". A imagem também menciona explicitamente os três principais componentes do produto: preços de API, arquitetura e testes de referência. O design geral adota um estilo tecnológico azul-marinho, incorporando elementos visuais como controle de jogo, gráficos de dados e diagramas estruturais, alinhando-se ao posicionamento do produto para cenários de jogos. Ela apresenta de forma intuitiva a estrutura básica de informações do produto, ecoando o tema da documentação que apresenta os preços do DeepSeek V4 Flash 0731 e os blocos de conteúdo relacionados.

DeepSeek V4 Flash criou um jogo de tiro 3D por apenas US$ 0,07 — por que esse modelo é tão barato

Introdução

O DeepSeek V4 Flash 0731 entrou em versão beta pública com uma promessa familiar: capacidades mais fortes de codificação e agentes a preços de API extremamente baixos.

Os desenvolvedores rapidamente transformaram essa afirmação em experimentos práticos.

Um dos casos mais divulgados veio de uma execução do Hermes Agent, na qual o DeepSeek V4 Flash gerou um jogo de tiro 3D em primeira pessoa jogável com apenas um prompt inicial. O projeto levou 32 minutos e o custo de uso do modelo foi de apenas US$ 0,07.

Os resultados finais incluíram:

  • Movimentação em primeira pessoa.
  • Pulo.
  • Tiro.
  • Colisão física com o ambiente.
  • Objetos de cobertura e alvos.
  • Contador de munição na interface.

Esta é uma captura de tela do demo do jogo de tiro 3D gerado pelo DeepSeek V4 Flash 0731, correspondente ao caso de jogo de tiro 3D jogável gerado por esse modelo no Hermes Agent mencionado no documento. A captura vem do conteúdo publicado pela conta chamada Elshayib, que menciona que gerar esse jogo levou apenas 32 minutos e custou US$ 0,07, além de explicar que o modelo é barato — com US$ 2 de custo de uso, é possível sustentar um dia inteiro de experimentos de desenvolvimento. A imagem mostra a cena em primeira pessoa do demo, incluindo elementos de interface de jogo correspondentes a funcionalidades como movimentação e tiro, além de exibir o contador de munição, em consonância com a lista de funcionalidades do jogo descritas no documento.

A conclusão viral foi simples: com esse preço, dois dólares sustentam um dia inteiro de experimentação.

Essa afirmação não deve ser interpretada como uma garantia universal de custo diário. Os gastos de um agente dependem do comprimento do prompt, do volume de saída, do número de tentativas, das chamadas de ferramentas, da taxa de acerto de cache, da sobrecarga do framework e da complexidade da tarefa.

Ainda assim, essa demonstração capturou o apelo central do V4 Flash: o modelo é barato o suficiente para que os desenvolvedores deixem os agentes iterarem continuamente, em vez de tratar cada tentativa como um custo elevado.

O preço oficial da API do modelo ajuda a explicar o motivo.

DeepSeek V4 Flash 0731 agora é a versão Flash oficial

A DeepSeek lançou a versão de produção do V4 Flash em beta público de API em 31 de julho de 2026.

O nome do modelo na API permanece o mesmo:

deepseek-v4-flash

As solicitações que usam esse modelo agora acessam o DeepSeek-V4-Flash-0731.

A DeepSeek afirma que a versão 0731 substitui o modelo de pré-visualização e melhora significativamente as capacidades de agente.

A atualização se aplica especificamente a:

  • API do DeepSeek V4 Flash.
  • Pesos públicos do modelo V4 Flash.
  • Compatibilidade com a Responses API.
  • Integração voltada para o Codex.

Ela não substitui, ao mesmo tempo:

  • API do DeepSeek V4 Pro.
  • Modelos usados no aplicativo web da DeepSeek.
  • Modelos usados no aplicativo móvel da DeepSeek.

A DeepSeek também informou que a versão oficial do V4 Pro será lançada separadamente.

Preço oficial da API extremamente baixo

A DeepSeek lista atualmente os seguintes preços regulares de API por milhão de tokens:

Item de cobrança DeepSeek V4 Flash
Entrada com cache acertado US$ 0,0028
Entrada com cache não acertado US$ 0,14
Saída US$ 0,28
Comprimento do contexto 1 milhão de tokens
Saída máxima 384.000 tokens
Modo de raciocínio padrão Thinking
Limite de concorrência 2.500

O preço com cache acertado é especialmente baixo.

A US$ 0,0028 por milhão de tokens de entrada em cache, um agente de longa duração pode reutilizar repetidamente prefixos estáveis — como instruções de sistema, arquiteturas de ferramentas ou contexto de repositório — sem pagar o preço integral sem cache a cada vez.

A DeepSeek também anunciou futuros preços diferenciados por horários de pico e vale.

Política de preços.

Quando essa política entrar em vigor, todos os preços listados serão dobrados nos seguintes horários no fuso de Pequim:

09:00–12:00
14:00–18:00

Até o momento da revisão da página de preços neste artigo, a DeepSeek ainda não havia definido a data final de vigência.

Portanto, quem for usar a API deve consultar a página oficial de preços antes de depender de um preço fixo de longo prazo.

Um centavo contra um dólar

O artigo original comparou o DeepSeek V4 Flash com o Claude Opus 5 por meio de um pequeno projeto de jogo de tiro espacial.

Segundo o relato, ambas as versões implementaram:

  • Movimentação da nave.
  • Função de tiro.
  • Asteroides destrutíveis.
  • Itens colecionáveis.
  • Loop de jogo jogável.

As diferenças apareceram no caminho até a conclusão.

De acordo com a comparação do desenvolvedor:

Detalhe DeepSeek V4 Flash Claude Opus 5
Tentativas até um resultado aceitável 3 1
Quantidade aproximada de código 900 linhas Quase 3.000 linhas
Custo do modelo relatado US$ 0,01 US$ 1,00

O resultado do Opus foi concluído de primeira, enquanto o V4 Flash exigiu iterações adicionais.

O projeto final foi descrito como funcionalmente semelhante o suficiente para que a diferença de custo de 100 vezes relatada se tornasse o foco da discussão.

Isso não é um benchmark controlado de modelos.

A comparação não publicou um pacote completo de reprodutibilidade, que incluiria:

  • O mesmo framework de agente.
  • Prompts e mensagens de acompanhamento exatamente idênticos.
  • Logs de chamadas de ferramentas.
  • Limites de tempo de execução.
  • Regras de contagem de tokens.
  • Configurações de computação do modelo.
  • Intervenção humana.
  • Se houve fornecimento de assets ou código boilerplate.

Portanto, esse resultado deve ser visto como um relato anedótico de desenvolvedor com valor de referência, e não como prova de que o V4 Flash é consistentemente 100 vezes mais barato que o Opus 5 em trabalhos equivalentes.

DeepSeek V4 Flash contra GPT-5.6 Sol

Outra comparação pedia que o DeepSeek V4 Flash e o GPT-5.6 Sol construíssem um pequeno jogo 3D de navegação em rio.

Segundo o relato, ambos produziram:

  • Cenário completo de rio.
  • Movimentação lateral.
  • Colisão com obstáculos.
  • Rastreamento de pontuação.
  • Árvores e paisagem ao fundo.
  • Interações centrais semelhantes.

Os custos relatados foram:

Modelo Custo relatado
DeepSeek V4 Flash US$ 0,05
GPT-5.6 Sol US$ 2,47

Isso representa uma diferença de quase 50 vezes nessa execução específica.

![A imagem mostra um tweet com o conteúdo: "DeepSeek is ridiculously cheap. GPT-5.6 → $2.47 DeepSeek → $0.05 How DeepSeek pulls off this pricing is wild. 50x cheaper than GPT 5.6 with similar output. O preço do DeepSeek é ridiculamente barato. GPT-5.6 → US$ 2,47 DeepSeek → US$ 0,05 Como o DeepSeek consegue esse preço é inacreditável. É 50 vezes mais barato que o GPT 5.6 com resultados semelhantes." O tweet foi publicado pelo usuário Dipankar, cujo avatar mostra um homem de óculos. A imagem está diretamente relacionada ao contexto, ilustrando que, na comparação de custos de desenvolvimento de jogos entre o DeepSeek V4 Flash e o GPT-5.6 Sol, o DeepSeek é muito mais barato que o GPT-5.6, destacando que sua estratégia de preços é surpreendente.](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/08/7e9939d1-1af3-498a-9747-03470f1e858d-44a7f7e1-4473-425a-97a8-4dcd163b4903.png)

O efeito visual foi descrito como amplamente semelhante, embora a versão DeepSeek tenha usado um ambiente em menor escala.

Da mesma forma, essa comparação também é de natureza circunstancial.

O GPT-5.6 Sol e o DeepSeek V4 Flash possuem comportamentos de raciocínio padrão, estruturas de preços, sistemas de gerenciamento de contexto, estruturas de agente e regras de cálculo de tokens diferentes.

Uma comparação justa de ambiente de produção deve medir:

Custo total da tarefa
÷
Número de resultados bem-sucedidos e aceitáveis

Isso

A solicitação individual mais barata nem sempre é o projeto completo mais barato.

Um modelo que exige muitas tentativas, gera código de alta manutenção ou requer muita revisão humana pode perder sua vantagem inicial de preço.

O impacto da quantidade de tokens no custo pode ser maior do que a qualidade visual

O artigo também descreve um teste em que o GPT-5.6 Luna e o DeepSeek V4 Flash geraram um modelo 3D no estilo Pokémon com base nas mesmas necessidades.

Os efeitos visuais relatados são difíceis de distinguir claramente em termos de qualidade, mas a quantidade total de tokens de saída varia enormemente:

Modelo Volume de saída relatado
GPT-5.6 Luna Mais de 2,3 milhões de tokens
DeepSeek V4 Flash Cerca de 477 mil tokens

A diferença no custo total da tarefa relatado pela fonte é de quase 14 vezes.

A lição principal não é que um modelo sempre usa exatamente essa quantidade de tokens.

Mas sim que a economia do agente depende de mais do que apenas o preço de tabela por milhão de tokens.

O custo total é determinado pelos seguintes fatores:

  • Redundância na saída.
  • Reescritas repetidas de arquivos.
  • Registros de chamadas de ferramentas.
  • Tokens de raciocínio.
  • Tentativas com falha.
  • Reprodução de contexto.
  • Reutilização de cache.
  • Quantidade de código gerado.
  • Comportamento da estrutura do agente.

O preço unitário por token de um modelo pode ser relativamente baixo, mas se ele produz saídas desnecessárias, ainda assim pode se tornar caro.

A proposta de valor do V4 Flash combina um preço de tabela mais baixo com um desempenho relativamente compacto em vários exemplos relatados.

Experimento de duas horas custou apenas sete centavos

Outro desenvolvedor afirmou que passou quase duas horas experimentando e gastou apenas sete centavos.

A imagem é um tweet, publicado por @Samking207, com data de 1º de agosto. O conteúdo do tweet é "Yea was playing with it today for almost 2 hrs and I only spent 7 cents, I’m like wtf 😳😂 是啊,今天玩了快两个小时了,才花了7美分,我都懵了 😳😂". O tweet é apresentado em formato bilíngue, em inglês e chinês, expressando a surpresa do autor ao usar o modelo DeepSeek V4 Flash por quase 2 horas gastando apenas 7 centavos. Este tweet está intimamente relacionado ao contexto, demonstrando diretamente a situação de "um experimento de quase duas horas custando apenas 7 centavos" mencionada no documento, exemplificando como o baixo custo marginal influencia o comportamento dos desenvolvedores.

Este comentário ilustra como o baixo custo marginal pode mudar o comportamento do usuário.

Quando uma única chamada de modelo parece cara, os desenvolvedores tendem a:

  • Limitar o número de iterações.
  • Encurtar os prompts.
  • Evitar ramificações exploratórias.
  • Parar quando o resultado é "bom o suficiente".
  • Reservar o agente para trabalhos de alto valor.

Quando o custo é medido em centavos, os desenvolvedores podem permitir mais:

  • Tentativa e erro.
  • Linhas de pensamento paralelas.
  • Testes automatizados.
  • Tentativas de correção.
  • Tarefas em segundo plano de longa duração.
  • Pequenos experimentos que, de outra forma, seriam ignorados.

Isso não significa que o poder computacional seja gratuito.

Em escala empresarial, frações de centavo multiplicadas por milhões de chamadas ainda se tornam uma despesa considerável.

A mudança mais significativa é que o limiar para experimentação se torna muito mais baixo.

Por que o DeepSeek V4 Flash é tão barato?

O artigo atribui o baixo custo do V4 Flash a múltiplas escolhas arquiteturais e a nível de sistema.

Os principais fatores incluem:

  1. Computação de mistura esparsa de especialistas (MoE).
  2. Mecanismo de atenção de contexto longo comprimido.
  3. Pesos de modelo de baixa precisão.
  4. Decodificação especulativa via DSpark.
  5. Melhorias pós-treinamento sem necessidade de pré-treinamento completo novamente.
  6. Serviço de API de alta concorrência.

Cada parte reduz uma categoria diferente de custo.

Um modelo de 284 bilhões de parâmetros com apenas 13 bilhões ativados

O núcleo do DeepSeek V4

O modelo Flash usa uma arquitetura de mistura de especialistas (MoE).

O relatório técnico lista as seguintes informações:

Detalhe da arquitetura DeepSeek V4 Flash
Parâmetros do modelo principal 284 bilhões
Parâmetros ativados por token 13 bilhões
Comprimento do contexto 1 milhão de tokens
Dados de treinamento Mais de 32 trilhões de tokens
Precisão principal Precisão mista FP4 + FP8

Embora o modelo armazene centenas de bilhões de parâmetros, nem todos são processados em cada token.

O mecanismo de roteamento seleciona um pequeno subconjunto de especialistas.

Isso reduz a computação ativa necessária por token, enquanto mantém o acesso a um pool maior de parâmetros.

Uma forma simplificada de comparar é a seguinte:

Modelo denso:
Cada token → A maioria ou todos os pesos do modelo

Modelo MoE:
Cada token → Apenas especialistas selecionados

É por isso que modelos MoE grandes podem ter custos de serviço muito mais baixos do que modelos densos com quantidade semelhante de parâmetros.

Por que algumas páginas mostram 304B parâmetros

Os metadados do Hugging Face do repositório completo DeepSeek-V4-Flash-0731 atualmente mostram cerca de 304B parâmetros.

Isso não contradiz os dados de 284B do modelo principal no relatório técnico.

A versão 0731 vem com um módulo de decodificação especulativa DSpark. Os metadados do repositório podem contar o modelo alvo juntamente com o componente de rascunho incluso.

Em relação à discussão da arquitetura, o relatório técnico do DeepSeek ainda é a fonte mais clara:

  • O modelo principal V4 Flash tem 284B parâmetros totais.
  • A ativação por token é de 13B parâmetros.
  • Pesos extras do DSpark para decodificação especulativa na versão 0731.

A imagem é o conteúdo de introdução do DeepSeek V4 Flash 0731. Indica que é a versão oficial de lançamento do DeepSeek V4 Flash, que, em comparação com a versão de pré-visualização, aprimora significativamente as capacidades de agente, com estrutura idêntica ao DeepSeek V4 Flash - DSpark, incluindo um módulo de decodificação especulativa. Apesar de ter um número de parâmetros ativados muito menor que o DeepSeek V4 Pro (pré-visualização), apresenta melhor desempenho em testes de referência e compete amplamente com os modelos proprietários mais fortes existentes. A imagem está intimamente relacionada ao contexto, sendo uma visão geral das principais características e vantagens de desempenho da versão 0731.

CSA e HCA reduzem o custo de contextos longos

O DeepSeek V4 suporta uma janela de contexto de 1 milhão de tokens.

Os sistemas de atenção tradicionais se tornam extremamente caros nessa escala, pois cada novo token pode precisar examinar uma grande quantidade de contexto anterior e manter um grande cache KV.

O relatório técnico do DeepSeek descreve um design de atenção híbrida, combinando:

  • Atenção esparsa comprimida (CSA)
  • Atenção altamente comprimida (HCA)

A estratégia geral é evitar computação de atenção completa e cara em todo o histórico a cada etapa.

O sistema comprime e filtra o contexto, permitindo que o modelo concentre a computação nas informações mais úteis.

O DeepSeek relatou que, em um contexto de 1 milhão de tokens, o V4 Pro precisa de:

27% dos FLOPs de inferência por token do DeepSeek V3.2.

  • 10% da capacidade do cache KV.

Essas porcentagens exatas são relatadas no artigo técnico para o V4 Pro, não são dados de auditoria separados para o Flash.

O V4 Flash usa a mesma família de arquitetura, portanto se beneficia dos mesmos princípios de design de contexto longo.

Os efeitos práticos incluem a redução de:

  • Memória do cache KV.
  • Pressão de memória da GPU.
  • Volume de movimentação de dados.
  • Computação por token.
  • Custo de serviço para contextos longos.

FP4 e FP8 reduzem armazenamento

e tráfego de memória

O modelo V4 Flash lançado usa pesos de precisão mista baixa.

A DeepSeek lista:

Precisão mista FP4 + FP8

A menor precisão reduz a quantidade de dados que precisam ser armazenados, carregados da memória, transferidos entre dispositivos e processados durante a inferência.

Isso é importante porque a inferência de modelos de linguagem modernos costuma ser limitada pela largura de banda da memória, não apenas pela capacidade bruta de operações aritméticas.

Se o hardware e o kernel forem projetados para executar esse formato com eficiência, representações menores de dados podem aumentar a taxa de transferência.

Baixa precisão não é gratuita por natureza.

Quantização ruim reduz a qualidade do modelo.

O lançamento da DeepSeek foi projetado e treinado em torno do esquema de precisão escolhido, não apenas dependendo de quantização comunitária posterior.

Arquitetura inalterada entre a versão de visualização e a 0731

A DeepSeek afirma que a versão oficial 0731 mantém a mesma arquitetura e escala do V4 Flash preview.

A empresa não realizou um pré-treinamento completo novamente para esta atualização.

Em vez disso, refez o processo de pós-treinamento.

O artigo original resume as mudanças como:

  • Novo ajuste fino supervisionado.
  • Novo aprendizado por reforço GRPO.
  • Decodificação especulativa DSpark.
  • Melhor comportamento de agente.
  • Maior taxa de transferência de serviço.

O relatório técnico da DeepSeek descreve o processo de pós-treinamento mais amplo do V4 como:

  1. Desenvolvimento independente de módulos especialistas por domínio.
  2. Ajuste fino supervisionado e aprendizado por reforço com GRPO.
  3. Destilação de política on-policy.
  4. Integração das capacidades dos especialistas em um único modelo.

A atualização 0731 foca em melhorar essas capacidades em fluxos de trabalho reais de agentes.

DSpark acelera a geração de tokens

O DeepSeek-V4-Flash-0731 vem com o módulo de decodificação especulativa DSpark.

A decodificação especulativa usa um caminho de rascunho menor ou mais barato para propor múltiplos tokens futuros.

O modelo principal valida essas propostas em lote.

O fluxo simplificado é:

O módulo de rascunho propõe tokens
→ O modelo principal valida simultaneamente
→ Tokens aceitos são emitidos
→ Caminhos rejeitados são corrigidos

Quando as previsões do rascunho são precisas, o sistema pode gerar múltiplos tokens aceitos com menos inferência sequencial cara do modelo principal.

A DeepSeek oferece suporte ao DSpark tanto para vLLM quanto para SGLang.

Para vLLM, o cartão oficial do modelo usa:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Para SGLang, a opção correspondente é:

--speculative-algorithm DSPARK

A DeepSeek afirma que os pesos do modelo alvo e do modelo de rascunho estão armazenados no mesmo checkpoint, portanto o SGLang não precisa de um caminho separado para o modelo de rascunho.

A decodificação especulativa melhora principalmente a velocidade de serviço e a taxa de transferência.

Por si só, ela não explica os ganhos de capacidade de raciocínio do modelo.

Esses avanços vêm do processo de pós-treinamento atualizado.

O lançamento oficial melhora as pontuações em benchmarks de agentes

A DeepSeek relatou grandes avanços em vários testes focados em agentes em comparação com o V4 Flash preview.

Benchmark V4 Flash 0731 V4 Flash preview V4 Pro preview
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3

12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

A imagem mostra o desempenho do DeepSeek V4 Flash em vários benchmarks, comparando com o V4 Flash Preview e o V4 Pro Preview. Terminal Bench 2.1 é 82.7, NL2Repo é 54.2, Cybergym é 76.7, DeepSWE é 54.4, Toolathlon verified é 70.3, Agent Last Exam é 25.2, Automation Bench (Public) é 25.1, DSBench-FullStack é 68.7 e DSBench-Hard é 59.6. A imagem reflete os grandes avanços da DeepSeek mencionados acima, ilustrando visualmente a melhoria de desempenho.

A DeepSeek afirma que os benchmarks públicos de agentes de código foram executados com a seguinte configuração:

Modo mínimo do DeepSeek Harness
reasoning_effort = max
top_p = 0.95
temperature = 1.0

Até o momento da atualização oficial, essa estrutura de testes ainda não havia sido publicada.

DSBench-FullStack e DSBench-Hard são benchmarks internos da DeepSeek.

Isso significa que suas pontuações podem servir como evidência de referência relatada pela empresa, mas não são verificáveis de forma independente como suítes de benchmark totalmente públicas.

O que medem o Terminal Bench e o Toolathlon

Terminal Bench 2.1

O Terminal Bench avalia a capacidade do agente de concluir tarefas em um ambiente de terminal.

O modelo pode precisar inspecionar arquivos, executar comandos, instalar dependências, depurar falhas, modificar código e verificar a conclusão.

Uma pontuação alta reflete o desempenho combinado do modelo, da estrutura do agente, da estratégia de ferramentas, do orçamento de raciocínio e do ambiente de execução.

Toolathlon-Verified

O Toolathlon avalia tarefas de longo ciclo em vários aplicativos e ferramentas de software.

O benchmark inclui cenários envolvendo calendário, sistemas de arquivos, Notion, WooCommerce, Kubernetes e BigQuery.

As tarefas exigem múltiplas interações com ferramentas e são validadas por avaliadores baseados em execução.

A pontuação de 70,3 relatada pela DeepSeek representa um grande avanço em relação ao modelo de visualização.

Mas isso não deve ser interpretado como uma garantia de 70,3% de sucesso em toda automação de negócios real.

Melhorias em benchmarks não garantem sucesso em um único prompt para cada jogo

O exemplo de jogo na fonte revela uma diferença importante entre desempenho em benchmarks e codificação criativa.

O V4 Flash teve desempenho forte nas avaliações oficiais de agentes, mas uma comparação de jogos ainda exigiu três iterações.

Benchmarks podem medir taxas de sucesso em conjuntos de tarefas bem definidos e regras de avaliação conhecidas.

Projetos criativos podem incluir requisitos visuais vagos, problemas de compatibilidade com navegadores, erros do motor de física, recursos ausentes, julgamentos subjetivos de qualidade e nenhuma suíte de testes única que defina sucesso.

Nesse cenário, modelos de baixo custo são especialmente úteis, pois o fluxo de trabalho pode tolerar múltiplas iterações.

Seu valor não está necessariamente em gerar perfeição na primeira tentativa.

Pode ser:

Qualidade aceitável
×
Grande número de tentativas acessíveis

V4 Flash suporta múltiplos formatos de API

A DeepSeek disponibiliza seus modelos das seguintes formas:

  • Interface Chat Completions compatível com OpenAI.
  • API Responses compatível com OpenAI.
  • API compatível com Anthropic.
  • Saída em JSON.
  • Chamada de ferramentas.
  • Preenchimento de prefixo de chat.
  • Preenchimento de intervalo no modo sem raciocínio.

A URL Base compatível com OpenAI é:

https://api.deepseek.com

A URL Base compatível com Anthropic é:

https://api.deepseek.com/anthropic

A DeepSeek afirma que o V4 Flash é atualmente o único modelo da API V4 que suporta a API Responses.

O suporte ao V4 Pro será planejado separadamente.

A compatibilidade com a API Responses também permite que o modelo seja usado no Codex por meio da configuração documentada da DeepSeek.

Modo de raciocínio ativado por padrão

O DeepSeek V4 Flash suporta modos de raciocínio e sem raciocínio.

O modo de raciocínio é o padrão.

Para inferência local, o cartão oficial do modelo suporta três níveis de esforço de raciocínio:

low
high
max

A DeepSeek recomenda:

temperature = 1.0
top_p = 0.95

para cenários de agentes.

Para os níveis de esforço de raciocínio high e max, a empresa recomenda permitir um comprimento máximo de saída de até 384 mil tokens.

Configurações de raciocínio mais altas podem melhorar o desempenho em tarefas difíceis, mas também podem aumentar a latência, o volume de saída, o custo da API e o tempo do ciclo do agente.

Sistemas de produção devem avaliar o nível de esforço mais baixo que atenda de forma confiável aos requisitos da tarefa.

Pesos publicados sob licença MIT

A DeepSeek publicou os pesos do V4 Flash 0731 no Hugging Face sob licença MIT.

Isso torna o modelo excepcionalmente permissivo em comparação com muitos lançamentos comerciais de grande porte.

Os desenvolvedores podem usar o repositório oficial do modelo com mecanismos suportados, incluindo:

  • vLLM.
  • SGLang.
  • Transformers.
  • Docker Model Runner.
  • Versões quantizadas compatíveis com llama.cpp.
  • Versões da comunidade compatíveis com LM Studio.

O modelo é bastante grande.

O modelo principal possui 284 bilhões de parâmetros, e o checkpoint 0731 inclui adicionalmente um componente DSpark.

Executá-lo em velocidades utilizáveis exige grandes quantidades de memória e recursos de hardware.

Os pesos poderem ser baixados não significa que o modelo completo funcione sem problemas em notebooks comuns de consumidor.

Versões quantizadas da comunidade podem reduzir os requisitos de memória, mas podem alterar a precisão, a taxa de transferência, a capacidade de contexto, o comportamento do DSpark e a confiabilidade da chamada de ferramentas.

O V4 Flash é sempre a opção com melhor custo-benefício?

As fontes concluem que o V4 Flash não produz os melhores resultados em todas as comparações, mas é difícil de superar em termos de custo-benefício.

Este é um resumo razoável dos exemplos, mas com uma ressalva importante:

O custo-benefício depende do fluxo de trabalho completo.

O V4 Flash é especialmente atraente quando:

  • O volume de requisições é alto.
  • Erros são fáceis de detectar.
  • As tarefas podem ser repetidas automaticamente.
  • O cache de contexto funciona bem.
  • O custo de revisão humana é baixo.
  • Código compacto é aceitável.
  • A aplicação pode usar modelos de pesos abertos.

Em contrapartida, modelos frontier mais caros ainda podem ser mais econômicos no geral quando:

  • Uma falha em uma tentativa causa grandes prejuízos.
  • A confiabilidade na primeira tentativa é crucial.
  • A tarefa exige conhecimento mais profundo.
  • Agentes não podem repetir com segurança.
  • O custo de revisão humana é alto.
  • Modelos menores produzem saídas difíceis de manter.

A comparação correta não é:

preço por token

mas sim:

custo por tarefa bem-sucedida e validada

Como avaliar o V4 Flash para projetos reais

Etapa 1: Escolha tarefas representativas

Não teste apenas demonstrações cuidadosamente elaboradas.

Use tarefas compatíveis com a carga de trabalho de produção, incluindo cenários difíceis e complexos.

Etapa 2: Fixe o ambiente do agente

Mantenha consistência entre modelos em prompts, ferramentas, limites de tempo, estratégias de repetição, frameworks, sandboxes, suítes de teste e configurações de raciocínio.

Etapa 3: Registre o custo completo

Acompanhe entradas sem cache, entradas com cache, tokens de saída, chamadas de ferramentas, tentativas de repetição, tempo de execução, revisão humana e tentativas falhas.

Etapa 4: Meça a aceitabilidade, não apenas a semelhança visual

Para código, execute testes e verifique a manutenibilidade.

Para jogos, verifique controles, colisões, desempenho e compatibilidade com navegadores.

Etapa 5: Teste o comportamento do cache

Quando um contexto estável é reutilizado repetidamente em múltiplas etapas do agente, modelos com preços muito baixos em cache hits tornam-se mais valiosos.

Etapa 6: Compare a primeira tentativa com o sucesso final

Um modelo que só tem sucesso após três tentativas baratas pode ter melhor custo-benefício do que um que acerta de primeira a um preço alto.

Quando repetições são lentas ou arriscadas, o inverso também pode ocorrer.

Perguntas frequentes

O que é o DeepSeek V4 Flash 0731?

O DeepSeek V4 Flash 0731 é a versão pós-treinada oficial do modelo V4 de mistura de especialistas de menor escala da DeepSeek. Ele substitui a versão de pré-visualização, adiciona o módulo de decodificação especulativa DSpark e foca em tarefas de codificação e agentes de uso de ferramentas.

Qual é o custo da API do DeepSeek V4 Flash?

A DeepSeek atualmente divulgou os seguintes preços regulares: US$ 0,0028 por milhão de tokens de entrada com cache, US$ 0,14 por milhão de tokens de entrada sem cache e US$ 0,28 por milhão de tokens de saída. A empresa anunciou que futuras políticas dobrarão os preços em horários de pico determinados.

O DeepSeek V4 Flash realmente criou um jogo 3D por US$ 0,07?

Um desenvolvedor relatou que uma execução do Hermes Agent gerou um jogo de tiro em primeira pessoa jogável em 32 minutos a um custo de US$ 0,07. Isso é um estudo de caso de mídia social, não um benchmark padronizado, portanto os custos para outras tarefas podem ser maiores ou menores.

Quantos parâmetros o DeepSeek V4 Flash tem?

O relatório técnico do V4 lista um total de 284 bilhões de parâmetros para o modelo Flash principal, com 13 bilhões de parâmetros ativados por token. O repositório completo da versão 0731 pode exibir cerca de 304 bilhões de parâmetros, pois inclui o componente de decodificação especulativa DSpark que o acompanha.

Por que o DeepSeek V4 Flash é tão barato?

Seu baixo custo vem da ativação esparsa de especialistas, atenção de contexto longo comprimida, precisão mista FP4/FP8, cache de prompts, decodificação especulativa e serviço de alta concorrência. Apenas uma pequena fração dos especialistas totais é ativada por token.

O DeepSeek V4 Flash é superior ao Claude Opus 5 ou ao GPT-5.6?

Com os preços atuais de API, ele é muito mais barato e demonstrou competitividade em várias demonstrações da comunidade. Opus 5 e GPT-5.6 ainda podem oferecer maior confiabilidade ou qualidade na primeira tentativa em algumas tarefas, e as comparações virais não são benchmarks controlados.

O DeepSeek V4 Flash pode ser executado localmente?

Sim. A DeepSeek publicou os pesos sob licença MIT e fornece orientação de uso com vLLM e SGLang. O modelo completo é extremamente grande, portanto uma implantação local prática requer uma quantidade substancial de memória de aceleradores ou esquemas de quantização agressivos da comunidade.

O V4 Flash suporta Codex e a API Responses?

Sim. A DeepSeek afirma que a versão Flash oficial suporta nativamente a API Responses e foi adaptada para uso no Codex. A API atual do V4 Pro ainda não suporta a API Responses.

Ferramentas relacionadas

  • DeepSeek API: endpoint hospedado oficial para o DeepSeek V4 Flash e outros modelos suportados.
  • [DeepSeek V4 Flash

0731: repositório oficial do modelo, com pesos, benchmarks, licença e guia de implantação.

  • vLLM: um mecanismo de inferência de alto rendimento, com receitas oficiais para V4 Flash e DSpark.
  • SGLang: um framework de serviço LLM com suporte documentado integrado para V4 Flash e DSpark.
  • DeepSpec: repositório de pesquisa de decodificação especulativa e métodos DSpark da DeepSeek.
  • Codex: um ambiente de codificação inteligente que pode se conectar ao V4 Flash por meio da interface compatível com a Responses API da DeepSeek.

Links relacionados

Resumo

O DeepSeek V4 Flash 0731 atraiu ampla atenção porque desenvolvedores relataram que construíram demos interativas completas por apenas alguns centavos. Segundo relatos, um jogo de tiro em primeira pessoa custou apenas US$ 0,07, enquanto comparações em outras redes sociais mostraram custos de tarefas dezenas de vezes menores que o Claude Opus 5 ou o GPT-5.6.

Esses exemplos não são benchmarks controlados, mas os preços oficiais da API apoiam o ponto central. O V4 Flash cobra US$ 0,14 por milhão de tokens de entrada não armazenados em cache, US$ 0,28 por milhão de tokens de saída, e surpreendentes US$ 0,0028 para acertos de cache.

Sua economia decorre de todo o sistema: um núcleo MoE de 284B ativando 13B por token, atenção de contexto longo comprimida, pesos FP4/FP8, janela de contexto de um milhão de tokens, capacidade de serviço eficiente e decodificação especulativa DSpark. A atualização 0731 preserva a arquitetura de pré-visualização e melhora o comportamento do agente com novo pós-treinamento.

A evidência oficial mais forte está nos ganhos de benchmark. O Terminal Bench 2.1 subiu de 61,8 para 82,7, o Toolathlon-Verified de 49,7 para 70,3, mantendo o modelo no nível de preço Flash.

A vantagem do V4 Flash não é vencer todas as comparações — é seu custo marginal extremamente baixo que torna

viável na prática realizar experimentos de agente repetidamente em uma escala difícil de alcançar com muitos modelos de preço de ponta.

DeepSeek V4 Flash 用 0.07 美元打造了一款 3D 射击游戏——这就是该模型如此便宜的原因