DeepSeek V4 Flash 0731: A demonstração de jogo de \$0,07, preços da API, arquitetura e benchmarks de codificação
O DeepSeek V4 Flash 0731 gerou uma combinação incomum de reações. Os desenvolvedores estão impressionados com suas pontuações em agentes de codificação. As equipes de infraestrutura estão interessadas em sua capacidade de 1 milhão de tokens de contexto, enquanto analistas de preços observam atentamente sua estrutura de custos agressiva. Este guia reúne preços verificados, benchmarks públicos e arquitetura divulgada para ajudar você a decidir se este modelo é adequado para seus projetos de codificação e implantação.

DeepSeek V4 Flash 0731: Como um Modelo Re-Pós-Treinado Provocou uma Guerra Global de Preços
Introdução
O DeepSeek V4 Flash 0731 gerou uma combinação incomum de reações.
Desenvolvedores estão impressionados com suas pontuações em agentes de codificação.
Equipes de infraestrutura estão interessadas em seu contexto de 1 milhão de tokens e no baixo número de parâmetros ativos.
Plataformas de IA estão oferecendo uso gratuito e descontos agressivos.
E as redes sociais estão se enchendo de capturas de tela de protótipos cujas faturas de inferência relatadas são medidas em centavos, não em dólares.
Os exemplos mais amplamente compartilhados no artigo de origem incluíam:
- Um pequeno protótipo de jogo de tiro 3D supostamente gerado por cerca de RMB 0,07.
- Um protótipo estilo Counter-Strike supostamente produzido por aproximadamente RMB 0,50.
- Um painel de uso pessoal mostrando 87 milhões de tokens por RMB 31,57.
- OpenCode relatando 8 trilhões de tokens do DeepSeek Flash em 1º de agosto.
- Cline aumentando sua cota gratuita após descobrir que o modelo era mais barato de subsidiar do que o esperado.
- Nous Portal oferecendo temporariamente um desconto de 90% no V4 Flash 0731.
Esses exemplos capturam o entusiasmo, mas também podem confundir várias coisas distintas:
- O preço oficial da API do DeepSeek.
- Os preços de cache com acerto e cache com erro.
- Acesso gratuito ou subsidiado por terceiros.
- O número de chamadas de ferramentas que um agente faz.
- A quantidade de saída e raciocínio oculto gerado.
- O custo do modelo isoladamente versus o custo do produto completo.
O modelo é genuinamente barato.
Isso não significa que toda aplicação custará sete centavos.
A pergunta útil não é se um demo viral é reproduzível exatamente. É como o DeepSeek alcançou um salto tão grande de capacidade sem mudar a arquitetura base — e o que a nova economia significa para os desenvolvedores.
O Ciclo Global de Descontos
O preço oficial da API já era baixo antes da aplicação das promoções de terceiros.
O DeepSeek atualmente lista os seguintes preços por milhão de tokens:
| Tipo de uso | Preço do DeepSeek V4 Flash |
|---|---|
| Entrada, cache com acerto | $0,0028 |
| Entrada, cache com erro | $0,14 |
| Saída | $0,28 |
A API suporta:
- Uma janela de contexto de 1 milhão de tokens.
- Até 384 mil tokens de saída.
- Modos de pensamento e sem pensamento.
- Três níveis de esforço de raciocínio no card do modelo 0731:
low,highemax. - Chamadas de ferramentas.
- Saída em JSON.
- Conclusão de prefixo de chat em versão beta.
- Conclusão FIM no modo sem pensamento.
- Chat Completions compatível com OpenAI.
- A API Responses.
- Uma interface compatível com Anthropic.
- Um limite de concorrência publicado de 2.500 por conta para o V4 Flash.
Esses preços oficiais são a linha de base.
As plataformas podem então escolher:
- Repassar o preço.
- Adicionar uma margem.
- Subsidiar o uso.
- Oferecer um modelo gratuito limitado.
- Incluir o modelo em uma assinatura.
- Aplicar créditos promocionais.
- Roteirizar o tráfego por outro provedor de inferência.
É por isso que um desenvolvedor pode pagar o preço de tabela do DeepSeek enquanto outro não paga nada por um período limitado.
OpenCode Relata Oito Trilhões de Tokens em Um Dia
A OpenCode declarou publicamente que o DeepSeek Flash processou 8 trilhões de tokens em 1º de agosto por meio de sua plataforma.
A publicação detalha o número da seguinte forma:
5T tokens de uso gratuito
+
3T tokens por meio do OpenCode Go

A documentação Zen atual da OpenCode lista uma opção DeepSeek V4 Flash Free disponível por tempo limitado.
Essa é uma distinção importante.
O número de oito trilhões de tokens descreve o tráfego por meio da OpenCode, não o uso direto relatado pela DeepSeek em todas as plataformas.
Ainda assim, é um forte sinal de que modelos de baixo custo podem gerar uma demanda enorme quando são colocados dentro de um fluxo de trabalho popular de agente de codificação.
Nous Portal Reduz Temporariamente o Preço em 90%
A Nous Research anunciou uma promoção de sete dias oferecendo o DeepSeek V4 Flash 0731 com 90% de desconto por meio do Nous Portal, em parceria com a Novita Labs.

A publicação promocional comparou o custo com desconto ao do Claude Fable 5 e afirmou uma diferença de preço de mais de 1.000 vezes em tarefas comparáveis.
Essa comparação depende de várias escolhas:
- Qual preço de provedor é usado.
- Se a entrada ou a saída domina.
- Se o cache está disponível.
- Qual configuração de raciocínio é selecionada.
- Quantos tokens cada modelo precisa para concluir a tarefa.
- Qual benchmark ou fluxo de trabalho define "comparável".
Uma comparação de preço por token é útil, mas a métrica mais significativa é:
Custo total por tarefa aceita
Um modelo que usa menos tokens caros pode ser mais barato do que um modelo de baixo preço que tenta repetidamente.
Por outro lado, quando um modelo de baixo preço também é capaz o suficiente para concluir a tarefa rapidamente, a vantagem de custo pode se tornar enorme.
Cline Triplica Sua Cota Gratuita
A Cline anunciou inicialmente o uso gratuito do V4 Flash 0731 por meio de seu agente de codificação.
Uma publicação pública posterior afirmou que a cota gratuita foi triplicada porque a economia parecia sustentável.

O catálogo de modelos atual da Cline e os materiais do ClinePass incluem o DeepSeek V4 Flash como uma opção rápida e orientada a valor para tarefas de codificação focadas.
Cotas gratuitas e disponibilidade de modelos podem mudar, portanto, os usuários devem verificar a página do provedor ao vivo em vez de confiar em uma captura de tela antiga.
A lição mais ampla é mais duradoura.
Quando a inferência se torna barata o suficiente, uma plataforma de agentes pode usar o acesso gratuito como aquisição de clientes sem absorver
o mesmo custo que enfrentaria com um modelo premium de fronteira.
Capturas de Tela de Custos da Comunidade Precisam de Contexto
O artigo de origem inclui um painel mostrando:
- RMB 31,57 em gastos.
- 2.282 solicitações de API.
- 87.027.995 tokens.

A captura de tela é útil porque demonstra a ordem de grandeza que os desenvolvedores podem observar em padrões de uso favoráveis.
Ela não revela informações suficientes para reconstruir a fatura com exatidão.
As variáveis ausentes incluem:
- Proporção entre tokens de entrada e saída.
- Percentual de acerto de cache.
- Versão do modelo usada em cada data.
- Esforço de raciocínio.
- Número de chamadas de ferramentas.
- Solicitações com falha.
- Créditos promocionais.
- Descontos do provedor.
- Se todos os tokens foram cobrados à mesma tarifa.
Um prompt de sistema longo e repetido pode ser extremamente barato quando atinge o cache.
Um prompt longo e único enviado uma vez é cobrado pelo preço de entrada com ausência de cache.
A saída também é muito mais cara do que a entrada com cache.
Para sistemas de agentes, essas diferenças dominam a fatura final.
Flash Blitz: O Que Mudou em 31 de Julho
O DeepSeek V4 Preview foi lançado em 24 de abril de 2026.
A família continha:
- DeepSeek V4 Pro.
- DeepSeek V4 Flash.
O lançamento do Preview estabeleceu a arquitetura principal:
- Mistura Esparsa de Especialistas.
- Contexto de 1 milhão de tokens.
- Atenção eficiente para contexto longo.
- Baixa contagem de parâmetros ativos em relação à capacidade total.
- Modos de raciocínio e não raciocínio.
- Pesos abertos sob a Licença MIT.
O V4 Flash Preview foi posicionado como a alternativa menor, mais rápida e mais barata ao V4 Pro.
A atualização de 31 de julho mudou sua posição competitiva.
A DeepSeek afirma que o V4 Flash 0731 usa a mesma arquitetura e tamanho de modelo do V4 Flash Preview.
A atualização foi produzida pela execução de um novo processo de pós-treinamento.
Em forma simplificada:
Mesma arquitetura base pré-treinada
+
novo pós-treinamento e otimização de agentes
=
comportamento de agente de codificação muito mais forte
Isso é relevante porque mostra quanta capacidade pode permanecer latente em um modelo pré-treinado.
Arquitetura e contagem de parâmetros não são o produto inteiro.
O pós-treinamento determina a eficácia com que o modelo:
- Usa ferramentas.
- Planeja trabalhos de várias etapas.
- Lida com feedback do terminal.
- Recupera-se de erros.
- Escreve e edita arquivos.
- Segue um protocolo de agente.
- Aloca esforço de raciocínio.
- Trabalha dentro de um ambiente de execução.
Arquitetura Base e Detalhes do Checkpoint
O cartão do modelo V4 Flash original descreve o modelo base como:
| Especificação | DeepSeek V4 Flash |
|---|---|
| Parâmetros MoE base totais | 284B |
| Parâmetros ativados | 13B |
| Comprimento do contexto | 1M |
| Licença | MIT |
| Modalidade principal | Texto |
| Precisão base | FP8 / precisão mista baixa dependendo do checkpoint |
O cartão do modelo 0731 afirma que o novo lançamento tem a mesma estrutura da variante DSpark e inclui um módulo anexo de decodificação especulativa.
Isso explica por que alguns metadados de arquivos do modelo podem mostrar
contagem total de checkpoints maior do que o valor base de 284B do MoE.
A descrição mais clara é:
O modelo MoE subjacente do V4 Flash permanece com aproximadamente 284B no total e 13B de parâmetros ativos, enquanto o lançamento 0731 inclui o componente adicional de decodificação especulativa DSpark no checkpoint publicado.
Decodificação Especulativa DSpark
A decodificação especulativa usa um processo de rascunho rápido para propor vários tokens futuros.
O modelo principal então verifica essas propostas.
Quando as previsões são aceitas, o sistema pode produzir múltiplos tokens com menos trabalho sequencial.
O card do modelo 0731 da DeepSeek fornece suporte explícito ao DSpark para vLLM e SGLang.
Para vLLM, a configuração relevante é:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Para SGLang, o card do modelo usa:
--speculative-algorithm DSPARK
O DSpark não melhora o raciocínio do modelo por si só.
É uma otimização de inferência destinada a reduzir a latência de decodificação ou aumentar a taxa de transferência, preservando a distribuição de saída do modelo alvo sob a configuração suportada.
O Salto nos Benchmarks
A DeepSeek publica a seguinte comparação para o V4 Flash 0731:
| Benchmark | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
O aumento mais drástico é no DeepSWE:
7.3 → 54.4
O CyberGym quase dobra:
38.7 → 76.7
O Terminal Bench 2.1 sobe mais de vinte pontos:
61.8 → 82.7
O novo modelo Flash também supera o V4 Pro Preview em todos os benchmarks da tabela publicada pela DeepSeek.
Isso é uma mudança importante para um modelo originalmente posicionado principalmente como a opção mais barata e rápida.
A Metodologia dos Benchmarks Importa
A tabela não deve ser lida como uma comparação pura de checkpoints brutos.
O card do modelo da DeepSeek inclui várias notas importantes.
Para tarefas públicas de agentes de código, a empresa usou:
DeepSeek Harness modo mínimo
Esforço de raciocínio: máximo
Temperatura: 1.0
Top-p: 0.95
O DeepSeek Harness não havia sido lançado publicamente no momento da verificação.
Isso significa que pesquisadores externos podem ainda não ser capazes de reproduzir o ambiente de software exato usado para os resultados publicados de agentes de código.
Dois testes também são internos:
- DSBench-FullStack.
- DSBench-Hard.
Benchmarks internos podem ser úteis para o desenvolvimento de produtos, mas equipes independentes não podem inspecionar suas tarefas ocultas ou controles de contaminação.
A interpretação correta é:
A DeepSeek relata uma grande melhoria sob sua pilha de agentes e configuração de avaliação escolhidas. A reprodutibilidade pública melhorará quando o harness, prompts, logs e a configuração completa de avaliação estiverem disponíveis.
A Qualidade do Harness Pode Mudar a Pontuação
Um benchmark de código frequentemente mede um sistema completo:
Modelo
+
prompt do sistema
+
ferramentas de repositório
+
terminal
execução
+
gerenciamento de contexto
+
política de repetição
+
feedback de teste
+
lógica de envio de patch
O mesmo modelo pode pontuar de forma diferente quando um componente muda.
Um harness melhor pode:
- Selecionar arquivos mais relevantes.
- Preservar saída útil do terminal.
- Evitar estouro de contexto.
- Repetir comandos com falha de forma inteligente.
- Interromper loops improdutivos.
- Aplicar patches de forma mais confiável.
- Dar ao modelo resultados de teste mais claros.
Isso não torna o modelo irrelevante.
Significa que o resultado do benchmark pertence à combinação modelo-e-harness.
Os fortes números de 0731 sugerem que a DeepSeek melhorou tanto o comportamento de agente do modelo quanto o processo de avaliação ao redor.
A Artificial Analysis Pontua-o em 50
A Artificial Analysis reporta uma pontuação de Índice de Inteligência de aproximadamente 50 para o DeepSeek V4 Flash 0731, cerca de dez pontos acima da versão Flash anterior.
A empresa independente de análise de modelos também descreve o V4 Flash como excepcionalmente barato em relação a outros sistemas de fronteira bem conhecidos.
A Reuters resumiu as descobertas da Artificial Analysis ao relatar um custo médio de teste de benchmark de aproximadamente três centavos de dólar americano sob sua metodologia.
Essa comparação apoia o argumento de valor.
Não significa que toda tarefa de produção custa três centavos.
A Artificial Analysis também relata resultados mais fracos em algumas medidas de confiabilidade do conhecimento.
Seu artigo sobre o V4 Flash 0731 observa:
- A precisão de omnisciência permaneceu em torno de 37%.
- A taxa de alucinação caiu, mas permaneceu alta, em aproximadamente 84% sob essa avaliação.
Esses números são um lembrete útil.
Um modelo pode ser:
- Muito forte em agentes de codificação.
- Extremamente barato.
- Competitivo em um índice composto.
- Ainda não confiável em algumas perguntas factuais de mundo aberto.
"Melhor valor" não é o mesmo que "melhor para toda tarefa."
Preço Oficial da API
O preço direto da API DeepSeek é:
| Categoria de cobrança | Preço por 1M de tokens |
|---|---|
| Entrada com cache hit | $0,0028 |
| Entrada com cache miss | $0,14 |
| Saída | $0,28 |
A diferença de preço entre cache hit e cache miss é enorme:
$0,14 ÷ $0,0028 = 50
Entrada em cache é cinquenta vezes mais barata que entrada sem cache.
Para agentes de longa duração, a estrutura do prompt torna-se arquitetura de custo.
Exemplo de Cálculo de Custo
Suponha que uma solicitação use:
100.000 tokens de entrada sem cache
20.000 tokens de saída
O custo direto do modelo é:
Entrada:
100.000 / 1.000.000 × $0,14
= $0,014
Saída:
20.000 / 1.000.000 × $0,28
= $0,0056
Total:
$0,0196
Isso é menos de dois centavos de dólar americano.
Agora suponha que o mesmo prefixo de 100.000 tokens esteja em cache:
Entrada em cache:
100.000 / 1.000.000 × $0,0028
= $0,00028
Saída:
20.000 / 1.000.000 × $0,28
= $0,0056
Total:
$0,00588
A saída agora domina a conta.
Esses exemplos explicam por que protótipos de codificação de baixo custo são plausíveis.
Eles não incluem:
- Margem do provedor.
- Cobranças da API de ferramentas.
- Custos de navegador ou pesquisa.
- Computação em sandbox.
- Armazenamento.
- Tentativas falhas repetidas.
- Tempo de desenvolvimento humano.
Por Que as Contas de Agentes Ainda Podem Crescer
Codificação agêntica raramente é uma única solicitação.
Um fluxo de trabalho típico pode incluir:
- Ler o repositório.
- Buscar código relevante.
- Planejar a mudança.
- Editar vários arquivos.
- Executar testes.
- Inspecionar o
falha.
7. Edite novamente.
8. Execute os testes novamente.
9. Revise o diff.
10. Produza a resposta final.
Cada etapa pode gerar outra chamada de modelo.
Uma tarefa aparentemente pequena pode se tornar cara quando:
- O contexto do repositório é repetidamente não armazenado em cache.
- O modelo gera longos raciocínios.
- Os testes falham muitas vezes.
- O agente lê arquivos grandes desnecessariamente.
- Vários agentes paralelos duplicam trabalho.
- A compactação de contexto faz com que informações importantes sejam reenviadas.
- O modelo não para após atingir uma boa solução.
O V4 Flash reduz o preço desses erros.
Ele não os elimina.
Cache de Contexto é o Principal Fator de Custo
A DeepSeek usa cache de contexto baseado em disco.
Quando o mesmo prefixo é reutilizado, os tokens de entrada correspondentes podem receber o preço menor de cache hit.
Bons candidatos para um prefixo estável incluem:
- Instruções do sistema.
- Políticas do repositório.
- Definições de ferramentas.
- Documentos de referência longos.
- Um snapshot inalterado do projeto.
- Contexto empresarial repetido.
Um design simplificado de prompt é:
Prefixo estável reutilizável
+
nova solicitação do usuário
+
resultado mais recente da ferramenta
Um design menos favorável ao cache é:
Instruções reordenadas
+
resumo reescrito do repositório
+
carimbos de data/hora variáveis
+
metadados aleatórios de solicitação
+
nova solicitação do usuário
Pequenas alterações no prefixo podem reduzir a reutilização do cache.
Os desenvolvedores devem inspecionar os campos de uso de tokens, em vez de assumir que um prompt longo foi armazenado em cache.
A DeepSeek também oferece isolamento por user_id para privacidade e agendamento. A reutilização de cache e o isolamento de usuário devem ser projetados juntos para que o contexto de um cliente não seja acidentalmente misturado com o de outro.
Início Rápido da API
A URL base oficial permanece:
https://api.deepseek.com
O ID do modelo é:
deepseek-v4-flash
A DeepSeek afirma que o ID estável da API serve automaticamente a versão Flash oficial mais recente.
Isso é conveniente, mas as equipes de produção devem registrar a impressão digital do modelo retornada e testar alterações, pois o comportamento por trás de um ID estável pode ser atualizado.
Exemplo em Python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Revise esta função e proponha uma refatoração segura.",
}
],
)
print(response.choices[0].message.content)
Exemplo com cURL
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "Escreva um pequeno CLI em Python que valide arquivos JSON."
}
]
}'
Os desenvolvedores devem verificar a referência da API ao vivo para os campos exatos de esforço de raciocínio e modo de pensamento suportados pelo seu endpoint e versão do SDK.
O Histórico de Pensamento Deve Ser Preservado
A documentação do modo de pensamento da DeepSeek afirma que, quando uma rodada inclui chamadas de ferramenta, o reasoning_content da mensagem do assistente deve ser passado de volta em solicitações subsequentes.
Um agente de múltiplas rodadas deve preservar:
content
reasoning_content
tool_calls
Descartar o estado de raciocínio pode reduzir a continuidade ou causar problemas de validação de solicitação.
Isso é especialmente relevante ao integrar por meio de um cliente compatível com OpenAI que normalmente ignora campos de raciocínio específicos do provedor.
Compatibilidade com OpenAI, Anthropic e Responses
A DeepSeek oferece mais de uma interface.
OpenAI Chat Completions
Use o URL base padrão da DeepSeek e o ID do modelo:
deepseek-v4-flash
API Compatível com Anthropic
A DeepSeek também documenta uma interface no formato Anthropic.
Isso pode ajudar softwares construídos em torno de mensagens no estilo Claude a se conectarem à DeepSeek com menos alterações no aplicativo.
A compatibilidade não garante comportamento idêntico.
Campos específicos do provedor, histórico de raciocínio, esquemas de ferramentas, comportamento de segurança e tratamento de erros ainda exigem testes.
Responses API
A DeepSeek afirma que o lançamento 0731 suporta nativamente o formato Responses API e foi adaptado para uso no estilo Codex.
Isso é importante para produtos de agentes de codificação que dependem cada vez mais de objetos de resposta com estado, chamadas de ferramentas e loops estruturados de agentes.
Pesos Abertos sob a Licença MIT
A DeepSeek lançou os pesos do V4 Flash 0731 no Hugging Face sob a Licença MIT.
Isso permite que desenvolvedores inspecionem, modifiquem, implantem e redistribuam o modelo sujeitos aos termos da licença.
O lançamento de pesos abertos oferece mais controle do que um modelo apenas por API.
As equipes podem:
- Executar o modelo em infraestrutura privada.
- Estudar sua arquitetura.
- Criar variantes quantizadas.
- Adaptar kernels de inferência.
- Ajustar fino ou especializá-lo.
- Integrá-lo em sistemas internos.
- Evitar enviar código sensível a uma API de terceiros.
A barreira prática é o hardware.
"Pesos abertos" não significa "roda em um notebook comum".
Implantação com vLLM
O card oficial do modelo 0731 fornece um exemplo de vLLM para um único nó 4×GB300:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Este exemplo demonstra a classe de infraestrutura esperada para servir com qualidade total.
Não deve ser interpretado como a única configuração suportada.
A receita do vLLM pode adicionar suporte a outras topologias de GPU ao longo do tempo.
Implantação com SGLang
O exemplo oficial do SGLang é:
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
Os pesos alvo e de rascunho vêm do mesmo checkpoint, então a documentação diz para não definir um caminho separado de modelo de rascunho especulativo.
Os mecanismos de inferência evoluem rapidamente.
Use o card do modelo atual e a receita do mecanismo de serviço, em vez de copiar um comando antigo de inicialização da versão Preview.
Implantação Local Ainda É um Projeto de Infraestrutura
Mesmo que apenas cerca de
13B parâmetros estão ativos para um token, os pesos completos do modelo devem permanecer disponíveis em todo o sistema de serviço.
O planejamento de implantação deve considerar:
- Armazenamento total do modelo.
- Memória da GPU.
- Paralelismo de especialistas.
- Largura de banda de interconexão.
- Cache KV de contexto longo.
- Suporte a quantização.
- Kernels DSpark.
- Tamanho do lote.
- Concorrência.
- Latência de prefill.
- Throughput de decodificação.
Quantizações menores podem tornar a experimentação possível em diferentes hardwares, mas podem alterar a qualidade, a velocidade ou o comprimento do contexto suportado.
Para a maioria dos desenvolvedores individuais, a API direta ou um provedor hospedado será mais fácil e mais barato do que o auto-hospedagem.
API Oficial Versus Provedores de Terceiros
Existem três maneiras comuns de usar o V4 Flash.
| Rota | Principal vantagem | Principal desvantagem |
|---|---|---|
| API DeepSeek | Preço oficial e modelo oficial atual | Os dados saem do seu ambiente; o ID estável pode ser atualizado |
| Plataforma de terceiros | Cotas gratuitas, agentes integrados, faturamento mais fácil | Promoções e roteamento podem mudar |
| Pesos auto-hospedados | Controle máximo e privacidade | Requisitos significativos de hardware e engenharia |
A rota mais barata depende da carga de trabalho.
Uma cota gratuita do Cline ou OpenCode pode ser melhor para experimentação.
A API direta pode ser melhor para uso previsível em pequena escala.
O auto-hospedagem pode se tornar atraente apenas em volumes suficientemente altos e sustentados ou quando os requisitos de privacidade dominam.
A Melhor Era para Prototipagem
O artigo de origem compara IA barata com a produção em massa de automóveis.
A analogia é imperfeita, mas útil.
Quando uma tecnologia se torna drasticamente mais barata, o mercado não compra simplesmente a mesma quantidade por menos dinheiro.
Novos usos se tornam possíveis.
Modelos de agentes de baixo custo podem suportar experimentos que anteriormente seriam rejeitados antes dos testes.
Exemplos incluem:
- Um estudante construindo um primeiro protótipo de software.
- Um fundador solo gerando e testando várias ideias de páginas de destino.
- Uma pequena equipe executando revisão de código em cada pull request.
- Um projeto de código aberto oferecendo triagem de problemas gratuita.
- Um pesquisador processando uma grande coleção de código ou documentos.
- Uma empresa criando agentes internos para trabalhos repetitivos.
- Um desenvolvedor de jogos testando mecânicas e níveis gerados.
O valor não é que o modelo substitua toda a engenharia de software.
Ele reduz o custo de perguntar:
Vale a pena desenvolver esta ideia?
Um Protótipo Não É um Produto
Geração barata pode produzir uma primeira demonstração convincente.
Um produto de produção ainda precisa de:
- Design de produto.
- Segurança.
- Testes.
- Acessibilidade.
- Desempenho.
- Monitoramento.
- Implantação.
- Proteção de dados.
- Revisão legal.
- Manutenção.
- Suporte ao cliente.
Uma conta de modelo de sete centavos não significa um negócio de sete centavos.
Significa que o primeiro experimento computacional pode ser barato o suficiente para ser tentado.
Isso muda quem pode participar e quantas ideias podem ser testadas.
Um Exemplo de Espaço de Trabalho Construído pela Comunidade
O artigo de origem inclui um espaço de trabalho documental leve mostrado como um exemplo do que os desenvolvedores estavam construindo com agentes de codificação baratos.

Uma captura de tela não pode estabelecer quanto do aplicativo foi produzido pelo modelo, quanto de edição humana foi necessária ou se o produto é seguro e sustentável.
Ela mostra o tipo de projeto que modelos de codificação de baixo custo tornam mais fácil de prototipar.
Onde o V4 Flash se Encaixa Melhor
O V4 Flash 0731 é especialmente atraente quando:
- A tarefa é fortemente baseada em código ou ferramentas.
- O custo é um fator importante.
- Contexto extenso é útil.
- Espera-se um alto volume de solicitações.
- O fluxo de trabalho pode validar as saídas.
- Tentativas ocasionais são aceitáveis.
- Um modelo de fallback maior está disponível para casos difíceis.
Pode ser menos adequado quando:
- A precisão factual em um mundo aberto é crítica.
- Uma primeira resposta refinada importa mais do que o custo.
- A tarefa exige compreensão de imagens.
- A organização não pode validar o código gerado.
- É necessária uma garantia de conformidade gerenciada.
- O fluxo de trabalho depende de um comportamento de API estável e com versão fixada.
Um roteador de modelos pode combinar o Flash com um sistema mais forte ou mais especializado.
Por exemplo:
Edições rotineiras de repositório
→ V4 Flash
Decisões de arquitetura ou segurança de alto risco
→ modelo mais forte + revisão humana
Modelos Baratos Mudam a Arquitetura de Agentes
Quando as chamadas de modelo são caras, os desenvolvedores tentam minimizar cada solicitação.
Quando as chamadas se tornam baratas, um agente pode se dar ao luxo de:
- Pedir a outro modelo que revise o patch.
- Executar uma análise de teste separada.
- Gerar várias soluções candidatas.
- Comparar implementações alternativas.
- Usar um modelo para planejamento e outro para execução.
- Reverificar seu trabalho antes da submissão.
Isso pode aumentar a confiabilidade.
Também pode desperdiçar tokens.
O objetivo certo não é o uso mínimo de tokens.
É:
Menor custo total que atinge a qualidade exigida
Os Principais Riscos Por Trás da História do Preço
1. A Versão Beta Pública Pode Mudar
A DeepSeek descreve a API oficial do Flash como uma versão beta pública.
Preços, comportamento, limites e versões do modelo podem mudar.
Equipes de produção devem manter testes de regressão.
2. As Pontuações de Benchmark Dependem da Estrutura da DeepSeek
Os melhores resultados com agentes de código usam uma configuração de estrutura não publicada.
A reprodução independente exata ainda não é simples.
3. Entrada Barata Não Garante um Agente Barato
Saída, tentativas, ferramentas e contexto não armazenado em cache podem dominar o custo final.
4. Contexto Longo Não É Grátis
Uma janela de 1 milhão de tokens é um limite de capacidade, não uma recomendação para enviar um milhão de tokens em cada solicitação.
Cargas de trabalho com preenchimento grande aumentam a latência e o custo.
5. A Confiabilidade em Mundo Aberto Ainda Precisa de Trabalho
A avaliação independente mostra que o valor e a força em codificação podem coexistir com uma alta taxa de alucinação em testes factuais.
Fatos críticos devem ser verificados em relação às fontes.
6. O Código Gerado Exige Revisão
Modelos de baixo custo podem gerar mais código do que uma equipe pode inspecionar com segurança.
Testes automatizados, análise estática, verificação de dependências e revisão humana continuam sendo necessários.
7. O Acesso Promocional é Temporário
Modelos gratuitos de terceiros e descontos podem desaparecer.
Não construa um modelo de negócios permanente em torno de um subsídio de sete dias ou por tempo limitado.
8. IDs de API Estáveis Podem Ocultar Atualizações
O ID do modelo deepseek-v4-flash aponta para a versão atual.
Uma atualização por trás desse ID pode alterar as saídas sem que haja mudança de código no seu aplicativo.
Lista Prática de Controle de Custos
1. Estabilize Prefixos Reutilizáveis
Mantenha instruções de sistema e definições de ferramentas consistentes para melhorar a reutilização de cache.
2. Monitore Tokens de Cache-Hit Separadamente
Não dependa apenas do total de tokens de entrada.
3. Limite Saídas Desnecessárias
Defina um orçamento de saída realista para a tarefa.
4. Use Menor Esforço de Raciocínio para Tarefas Rotineiras
Reserve max para tarefas que se beneficiam de deliberação mais longa.
5. Limite as Etapas do Agente
Interrompa loops que não estão progredindo.
6. Execute Validações Baratas Antes de Outra Chamada de Modelo
Use linters, testes, validadores de esquema e verificações determinísticas.
7. Roteie Casos Difíceis
Escale somente quando a tarefa falhar em um teste ou exceder um limite de risco.
8. Meça o Custo por Resultado Aceito
Inclua tentativas falhas e revisão humana.
Mais Uma Coisa: DeepSeek Harness
O artigo de origem termina com um possível próximo passo no ecossistema de desenvolvedores da DeepSeek.
Tianyi Cui, identificado na fonte como o responsável pelo DeepSeek Harness, publicou uma mensagem de recrutamento para desenvolvedores de projetos open-source de agent-harness.
A mensagem convidava desenvolvedores interessados a compartilhar uma conta do GitHub e trabalhos open-source representativos para participar de testes internos.

O changelog da DeepSeek de 31 de julho também afirma que o modo mínimo do DeepSeek Harness usado para avaliação de benchmarks está "a ser lançado em breve".
Até a verificação, não localizei:
- Um repositório público oficial do DeepSeek Harness.
- Uma página de produto estável para "DeepSeek Code".
- Instruções públicas de instalação.
- Preços.
- Uma data de lançamento.
- Uma especificação completa de recursos.
As evidências apoiam esta conclusão mais restrita:
A DeepSeek está testando um agent harness e pretende lançar pelo menos parte do framework, mas o nome final do produto, o escopo público e o cronograma de lançamento permanecem não confirmados.
O modelo, a API e os pesos abertos estão disponíveis agora.
O harness ainda é um componente futuro do ecossistema.
Por que um DeepSeek Harness Pode Ser Importante
Um harness de primeira parte poderia ajudar a DeepSeek a controlar toda a stack de agentes de codificação.
Ele poderia fornecer:
- Tratamento nativo do histórico de raciocínio.
- Formatos de prompt específicos do modelo.
- Análise de chamadas de ferramentas.
- Gerenciamento de contexto.
- Busca no repositório.
- Execução no terminal.
- Reprodutibilidade de benchmarks.
- Integração com a API Responses.
- Fluxos de trabalho compatíveis com Codex.
- Controles de custo.
- Roteamento automático entre Flash e Pro.
A DeepSeek já documenta integrações com harnesses externos e agentes de codificação.
Uma ferramenta de primeira parte poderia transformar otimizações específicas de benchmarks em um produto que desenvolvedores comuns possam usar.
Ela também poderia revelar quanto do salto nos benchmarks do V4 Flash 0731 vem do checkpoint e quanto vem do runtime do agente.
O Que Observar em Seguida
Vários desdobramentos determinarão se o momento do V4 Flash se tornará uma mudança duradoura no ecossistema.
Lançamento Oficial do V4 Pro
A DeepSeek afirma que o lançamento oficial do V4 Pro seguirá a atualização do Flash.
A diferença de desempenho e preço entre Pro e Flash afetará as decisões de roteamento.
Disponibilidade do DeepSeek Harness
Um lançamento público melhoraria a reprodutibilidade dos benchmarks e daria aos desenvolvedores um framework de agente nativo do modelo.
Estabilidade de Preços
O preço direto já é baixo, mas as promoções de terceiros podem não permanecer.
Capacidade dos Provedores
Inferência barata atrai um tráfego muito alto.
Latência, limites de taxa e confiabilidade serão importantes à medida que o uso escala.
Suporte para Inferência de Código Aberto
vLLM, SGLang, fornecedores de hardware e projetos de quantização determinarão o quão acessível o self-hosting se tornará.
Avaliações Independentes
Mais avaliações públicas devem testar:
- Codificação.
- Segurança.
- Confiabilidade factual.
- Contexto longo.
- Uso de ferramentas.
- Custo por tarefa bem-sucedida.
- Desempenho sob diferentes harnesses.
Perguntas Frequentes
O que é o DeepSeek V4 Flash 0731?
O DeepSeek V4 Flash 0731 é o lançamento oficial de 31 de julho do V4 Flash, atualmente servido através da API deepseek-v4-flash em beta público. A DeepSeek afirma que ele mantém a arquitetura e o tamanho base do modelo Preview, enquanto melhora substancialmente as capacidades de agente por meio de novo pós-treinamento.
Quanto custa o DeepSeek V4 Flash?
A API oficial da DeepSeek lista US$ 0,14 por milhão de tokens de entrada sem cache, US$ 0,0028 por milhão de tokens de entrada com cache e US$ 0,28 por milhão de tokens de saída. Plataformas de terceiros podem oferecer preços diferentes, cotas gratuitas ou descontos temporários.
Um jogo 3D realmente custa apenas RMB 0,07 para gerar?
O artigo de origem cita um exemplo da comunidade com esse custo de modelo relatado. O exemplo não é acompanhado de prompts completos, logs de tokens, dados de cache, tentativas, custos de ferramentas ou registros de trabalho humano, portanto deve ser tratado como uma anedota, não como um orçamento garantido.
Quais são os principais resultados de benchmark do V4 Flash 0731?
A DeepSeek relata 82,7 no Terminal Bench 2.1, 76,7 no CyberGym, 54,4 no DeepSWE, 70,3 no Toolathlon-Verified e 54,2 no NL2Repo. As avaliações públicas de agentes de código usaram o modo mínimo não lançado do DeepSeek Harness com esforço máximo de raciocínio.
O DeepSeek V4 Flash 0731 é open source?
Os pesos do modelo e o repositório são lançados sob a Licença MIT, portanto "pesos abertos" e uso amplamente permissivo são descrições precisas. Executar o checkpoint completo ainda exige infraestrutura substancial de múltiplas GPUs.
O DeepSeek V4 Flash pode ser executado localmente?
Sim, a DeepSeek publica pesos e instruções de serviço para vLLM e SGLang. Os exemplos oficiais em escala completa usam hardware avançado de múltiplas GPUs, portanto um laptop normal não é o ambiente alvo para o modelo completo.
Qual é a janela de contexto?
A API oficial e a ficha do modelo especificam uma janela de contexto de 1 milhão de tokens. A API também lista um
comprimento máximo de saída de 384 mil tokens, mas usar o contexto ou a saída máximos pode aumentar significativamente a latência e o uso de recursos.
O DeepSeek Code ou o DeepSeek Harness foi lançado?
A DeepSeek referenciou publicamente um modo mínimo do Harness e recrutou desenvolvedores de harness de código aberto para testes internos. Um repositório público completo, a especificação final do produto e uma data de lançamento confirmada não foram localizados durante a verificação.
Ferramentas relacionadas
- DeepSeek API: A plataforma oficial para chaves de API, faturamento e acesso direto aos modelos DeepSeek.
- DeepSeek V4 Flash 0731 no Hugging Face: Checkpoint oficial de pesos abertos, ficha do modelo, tabela de benchmarks, licença e instruções de implantação.
- vLLM: Um mecanismo de serviço de código aberto de alto rendimento com suporte a DeepSeek V4 e DSpark.
- SGLang: Um framework de serviço de código aberto com um caminho de implantação publicado para o V4 Flash 0731.
- OpenCode: Um agente de codificação de código aberto cujo serviço Zen atualmente lista uma opção gratuita por tempo limitado do V4 Flash.
- Cline: Um agente de codificação e plataforma de modelos de código aberto que oferece o DeepSeek V4 Flash por meio de seu ecossistema de provedores.
- Nous Portal: Uma plataforma de inferência multimodelo que realizou uma promoção limitada do DeepSeek V4 Flash.
- Artificial Analysis: Uma plataforma independente de análise de modelos que cobre inteligência, velocidade, preço e custo de benchmark.
Links relacionados
- Log de alterações da DeepSeek de 31 de julho: Status oficial de lançamento, resultados de benchmarks, notas de metodologia, escopo da API e declaração de pós-treinamento.
- Modelos e preços da DeepSeek: Preços oficiais atuais, comprimento do contexto, limite de saída, recursos e concorrência.
- Ficha do modelo DeepSeek V4 Flash 0731: Notas de arquitetura, comparação de benchmarks, níveis de esforço de raciocínio, configuração DSpark e Licença MIT.
- Ficha técnica do modelo DeepSeek V4: Arquitetura original do V4, contagens de parâmetros, relatório técnico e avaliação da família de modelos.
- Guia do modo de pensamento da DeepSeek: Orientação oficial para saída de raciocínio e preservação de
reasoning_contentem chamadas de ferramentas. - Integrações de agente da DeepSeek: Exemplo oficial para conectar o V4 Flash a um harness de codificação de terminal.
- Modelos OpenCode Zen: Catálogo atual de modelos e informações sobre modelos gratuitos por tempo limitado.
- Avaliação Artificial Analysis V4 Flash 0731: Pontuação composta independente, preço, avaliação de agente e observações de confiabilidade.
Resumo
O DeepSeek V4 Flash 0731 mantém a base do modelo Preview
a arquitetura e o tamanho, mas usa novo pós-treinamento para produzir um grande salto no desempenho de agentes de codificação. A DeepSeek relata 82,7 no Terminal Bench 2.1, 76,7 no CyberGym e 54,4 no DeepSWE, embora os resultados públicos mais fortes de agentes de código dependam de uma configuração não publicada do DeepSeek Harness.
O preço oficial da API é excepcionalmente baixo: US$ 0,14 por milhão de tokens de entrada não armazenados em cache, US$ 0,0028 por milhão de tokens de entrada em cache e US$ 0,28 por milhão de tokens de saída. Cotas gratuitas e descontos de terceiros podem tornar o acesso ainda mais barato, mas essas promoções são temporárias e não devem ser confundidas com o preço permanente.
O lançamento de pesos abertos sob licença MIT, o contexto de 1 milhão de tokens, as APIs compatíveis com Responses e Anthropic, e o suporte em vLLM e SGLang tornam o modelo acessível tanto por rotas hospedadas quanto autogerenciadas. A implantação local completa continua sendo um projeto sério de infraestrutura com múltiplas GPUs.
Os protótipos virais de sete e cinquenta centavos são exemplos plausíveis de quão baixa a conta marginal do modelo pode chegar, mas não são estudos completos de custo do produto. Loops de agentes, tamanho da saída, falhas de cache, ferramentas, testes e trabalho humano ainda importam.
O DeepSeek V4 Flash 0731 é importante não porque todo aplicativo agora custa alguns centavos, mas porque a codificação agêntica capaz se tornou barata o suficiente para que muito mais desenvolvedores experimentem em escala significativa.