DeepSeek V4 Flash 0731: La demo de juego de $0.07, precios de API, arquitectura y puntos de referencia de codificación

DeepSeek V4 Flash 0731 ha generado una combinación inusual de reacciones. Los desarrolladores están impresionados por sus puntuaciones en agentes de codificación. Los equipos de infraestructura están interesados en su millón a...

发布于 2026年8月6日generalGEO 评分: 04 次阅读
Esta imagen es la portada de la guía de DeepSeek V4 Flash 0731, con un estilo tecnológico oscuro general, fondo negro y elementos luminosos azules en distintos tonos. El texto principal de la portada dice "Guía de DeepSeek V4 Flash 0731", y debajo se indican los temas centrales: precios, puntos de referencia, API e implementación local. En la parte inferior hay cuatro iconos tecnológicos que representan el contenido relacionado: un gráfico estadístico de dólares para precios, un gráfico de líneas de rendimiento para puntos de referencia, un identificador de interfaz de código para API y un patrón de servidores y chips para implementación local. El fondo también incluye el logotipo de DeepSeek difuminado, en línea con el tema central del artículo que presenta DeepSeek V4 Flash 0731.

DeepSeek V4 Flash 0731: Cómo un Modelo Re-Entrenado Provocó una Guerra Mundial de Precios

Introducción

DeepSeek V4 Flash 0731 ha generado una combinación inusual de reacciones.

Los desarrolladores están impresionados por sus puntuaciones en agentes de codificación.

Los equipos de infraestructura están interesados en su contexto de 1 millón de tokens y su bajo número de parámetros activos.

Las plataformas de IA están ofreciendo uso gratuito y descuentos agresivos.

Y las redes sociales se llenan de capturas de pantalla de prototipos cuyas facturas de inferencia reportadas se miden en céntimos en lugar de dólares.

Los ejemplos más compartidos en el artículo fuente incluyeron:

  • Un pequeño prototipo de shooter espacial 3D supuestamente generado por unos 0,07 RMB.
  • Un prototipo estilo Counter-Strike supuestamente producido por aproximadamente 0,50 RMB.
  • Un panel de uso personal que muestra 87 millones de tokens por 31,57 RMB.
  • OpenCode informando 8 billones de tokens de DeepSeek Flash el 1 de agosto.
  • Cline aumentando su cuota gratuita tras descubrir que el modelo era más barato de subsidiar de lo esperado.
  • Nous Portal ofreciendo temporalmente un 90% de descuento en V4 Flash 0731.

Estos ejemplos capturan la emoción, pero también pueden difuminar varias cosas distintas:

  1. El precio oficial de la API de DeepSeek.
  2. Los precios con acierto de caché y con fallo de caché.
  3. El acceso gratuito o subsidiado de terceros.
  4. El número de llamadas a herramientas que realiza un agente.
  5. La cantidad de salida y razonamiento oculto generado.
  6. El costo del modelo solo frente al costo del producto completo.

El modelo es genuinamente económico.

Eso no significa que cada aplicación cueste siete céntimos.

La pregunta útil no es si una demo viral es reproducible exactamente. Es cómo DeepSeek logró un salto de capacidad tan grande sin cambiar la arquitectura base—y qué significan las nuevas economías para los desarrolladores.

El Ciclo Global de Descuentos

El precio oficial de la API ya era bajo antes de aplicar las promociones de terceros.

DeepSeek actualmente lista los siguientes precios por millón de tokens:

Tipo de uso Precio de DeepSeek V4 Flash
Entrada, acierto de caché $0,0028
Entrada, fallo de caché $0,14
Salida $0,28

La API admite:

  • Una ventana de contexto de 1 millón de tokens.
  • Hasta 384K tokens de salida.
  • Modos de pensamiento y no pensamiento.
  • Tres niveles de esfuerzo de razonamiento en la ficha del modelo 0731: low, high y max.
  • Llamadas a herramientas.
  • Salida JSON.
  • Completado de prefijo de chat en versión beta.
  • Completado FIM en modo no pensamiento.
  • Completado de Chat compatible con OpenAI.
  • La API de Responses.
  • Una interfaz compatible con Anthropic.
  • Un límite de concurrencia publicado de 2.500 por cuenta para V4 Flash.

Esos precios oficiales son la línea base.

Las plataformas pueden entonces elegir:

  • Transmitir el precio tal cual.
  • Añadir un margen.
  • Subsidiar el uso.
  • Ofrecer un modelo gratuito limitado.
  • Incluir el modelo en una suscripción.
  • Aplicar créditos promocionales.
  • Enrutar el tráfico a través de otro proveedor de inferencia.

Por eso un desarrollador puede pagar el precio de lista de DeepSeek mientras otro no paga nada durante un período limitado.

OpenCode Informa Ocho Billones de Tokens en un Día

OpenCode declaró públicamente que DeepSeek Flash procesó 8 billones de tokens el 1 de agosto a través de su plataforma.

La publicación desglosa la cifra de la siguiente manera:

5 billones de tokens de uso gratuito
+
3 billones de tokens a través de OpenCode Go

图片为OpenCode于8月3日发布的推文,内容为“DeepSeek Flash在8月1日处理了8万亿个token,其中5万亿为免费使用,3万亿在OpenCode Go上使用”。该推文与文档中OpenCode公开称DeepSeek Flash在8月1日处理8万亿token的内容相关,是对该数据的官方说明,还进一步拆解了免费和付费使用情况,为上下文对DeepSeek Flash处理token量的讨论提供了数据支持。

La documentación actual de Zen de OpenCode enumera una opción DeepSeek V4 Flash Free disponible por tiempo limitado.

Esta es una distinción importante.

La cifra de ocho billones de tokens describe el tráfico a través de OpenCode, no el uso directo reportado por DeepSeek en todas las plataformas.

Sigue siendo una señal contundente de que los modelos de bajo costo pueden generar una demanda enorme cuando se integran en un flujo de trabajo popular de agentes de codificación.

Nous Portal Reduce Temporalmente el Precio en un 90%

Nous Research anunció una promoción de siete días que ofrece DeepSeek V4 Flash 0731 con un 90% de descuento a través de Nous Portal en colaboración con Novita Labs.

图片为Nous Research发布的推文,内容是关于DeepSeek V4 Flash 0731的促销信息。推文称在Nous Portal的促销期间,该模型可享受90%的折扣,与Novita Labs合作,适用于接下来7天。在折扣价格下,其在可比任务上超过1000倍于Fable 5,同时在Terminal-Bench 2.1上仍胜出。推文底部有Jovita和Nous Research的标志,还附有一段时长13秒的视频。该图片与上下文紧密相关,直观呈现了文中提到的DeepSeek V4 Flash 0731的促销内容。

La publicación promocional comparó el costo con descuento con Claude Fable 5 y afirmó una diferencia de precio de más de 1,000 veces en tareas comparables.

Esa comparación depende de varias elecciones:

  • Qué precio de proveedor se utiliza.
  • Si predominan las entradas o las salidas.
  • Si la caché está disponible.
  • Qué configuración de razonamiento se selecciona.
  • Cuántos tokens necesita cada modelo para completar la tarea.
  • Qué punto de referencia o flujo de trabajo define lo "comparable".

Una comparación de precio por token es útil, pero la métrica más significativa es:

Costo total por tarea aceptada

Un modelo que utiliza menos tokens costosos puede ser más barato que un modelo de bajo precio que reintenta repetidamente.

Por el contrario, cuando un modelo de bajo precio también es lo suficientemente capaz para completar la tarea rápidamente, la ventaja de costo puede volverse enorme.

Cline Triplica su Cuota Gratuita

Cline anunció inicialmente el uso gratuito de V4 Flash 0731 a través de su agente de codificación.

Una publicación pública posterior dijo que la cuota gratuita se había triplicado porque la economía parecía sostenible.

这张截图是社交平台上的两条关联推文,内容围绕Cline为DeepSeek V4-Flash提供免费额度的相关说明。上方推文发布22小时,提到Cline已将deepseek v4-flash的免费额度扩至原来的3倍,且该服务具备可持续的运营经济性;下方推文发布于8月1日,说明该平台正在将DeepSeek V4-Flash 0731模型整合到服务中,还提供了安装使用该模型的三步操作指引,同时展示了该模型的在线对话试用界面与相关使用数据。

El catálogo de modelos actual de Cline y el material de ClinePass incluyen DeepSeek V4 Flash como una opción rápida y orientada al valor para tareas de codificación enfocadas.

Las cuotas gratuitas y la disponibilidad de modelos pueden cambiar, por lo que los usuarios deben consultar la página del proveedor en vivo en lugar de confiar en una captura de pantalla antigua.

La lección más amplia es más duradera.

Cuando la inferencia se vuelve lo suficientemente barata, una plataforma de agentes puede usar el acceso gratuito como adquisición de clientes sin absorber

el mismo costo que enfrentaría con un modelo frontera premium.

Las capturas de pantalla de costos de la comunidad necesitan contexto

El artículo original incluye un panel que muestra:

  • 31,57 RMB en gastos.
  • 2.282 solicitudes de API.
  • 87.027.995 tokens.

La imagen muestra el monto de gasto, el número de solicitudes de API y los tokens de Claude Code. El monto de gasto es ¥31,57 CNY, el número de solicitudes de API es 2.282 y los tokens son 87.027.995. El gráfico inferior presenta el monto de gasto diario del 6 de julio al 4 de agosto, con un pico notable el 28 de julio. Esta imagen está relacionada con la sección "Community Cost Screenshots Need Context" del documento y sirve para ilustrar el orden de magnitud que los desarrolladores podrían ver bajo patrones de uso favorables, pero no es suficiente para reconstruir la factura con precisión, ya que faltan muchas variables.

La captura de pantalla es útil porque demuestra el orden de magnitud que los desarrolladores pueden ver bajo patrones de uso favorables.

No revela suficiente información para reconstruir la factura exactamente.

Las variables que faltan incluyen:

  • Proporción de tokens de entrada frente a salida.
  • Porcentaje de aciertos de caché.
  • Versión del modelo utilizada en cada fecha.
  • Esfuerzo de razonamiento.
  • Número de llamadas a herramientas.
  • Solicitudes fallidas.
  • Créditos promocionales.
  • Descuentos del proveedor.
  • Si todos los tokens se facturaron a la misma tarifa.

Un prompt de sistema largo y repetido puede ser extremadamente barato cuando se sirve desde la caché.

Un prompt único y largo enviado una sola vez se factura al precio de entrada sin acierto de caché.

La salida también es mucho más cara que la entrada con caché.

Para sistemas de agentes, estas diferencias dominan la factura final.

Flash Blitz: Qué cambió el 31 de julio

DeepSeek V4 Preview se lanzó el 24 de abril de 2026.

La familia incluía:

  • DeepSeek V4 Pro.
  • DeepSeek V4 Flash.

El lanzamiento de Preview estableció la arquitectura principal:

  • Mezcla dispersa de expertos.
  • Contexto de 1 millón de tokens.
  • Atención eficiente de contexto largo.
  • Bajo número de parámetros activos en relación con la capacidad total.
  • Modos de pensamiento y no pensamiento.
  • Pesos abiertos bajo la licencia MIT.

V4 Flash Preview se posicionó como la alternativa más pequeña, rápida y barata a V4 Pro.

La actualización del 31 de julio cambió su posición competitiva.

DeepSeek afirma que V4 Flash 0731 utiliza la misma arquitectura y tamaño de modelo que V4 Flash Preview.

La actualización se produjo ejecutando un nuevo proceso de post-entrenamiento.

En forma simplificada:

Misma arquitectura base preentrenada
+
nuevo post-entrenamiento y optimización de agentes
=
comportamiento de agente de código mucho más fuerte

Esto es importante porque muestra cuánta capacidad puede permanecer latente en un modelo preentrenado.

La arquitectura y el número de parámetros no son todo el producto.

El post-entrenamiento determina la eficacia con la que el modelo:

  • Utiliza herramientas.
  • Planifica trabajos de múltiples pasos.
  • Maneja la retroalimentación del terminal.
  • Se recupera de errores.
  • Escribe y edita archivos.
  • Sigue un protocolo de agente.
  • Asigna el esfuerzo de razonamiento.
  • Trabaja dentro de un entorno controlado.

Arquitectura base y detalles del checkpoint

La ficha técnica del modelo original V4 Flash describe el modelo base como:

Especificación DeepSeek V4 Flash
Parámetros MoE base totales 284B
Parámetros activados 13B
Longitud de contexto 1M
Licencia MIT
Modalidad principal Texto
Precisión base FP8 / precisión mixta baja según el checkpoint

La ficha técnica del modelo 0731 dice que el nuevo lanzamiento tiene la misma estructura que la variante DSpark e incluye un módulo adjunto de decodificación especulativa.

Esto explica por qué algunos metadatos de archivos del modelo pueden mostrar

un recuento total de puntos de control mayor que la cifra base de 284B del MoE.

La descripción más clara es:

El modelo MoE subyacente de V4 Flash sigue siendo de aproximadamente 284B en total con 13B de parámetros activos, mientras que la versión 0731 incluye el componente adicional de decodificación especulativa DSpark en el punto de control publicado.

Decodificación Especulativa DSpark

La decodificación especulativa utiliza un proceso de borrador rápido para proponer varios tokens futuros.

El modelo principal verifica entonces esas propuestas.

Cuando las predicciones se aceptan, el sistema puede producir múltiples tokens con menos trabajo secuencial.

La tarjeta del modelo 0731 de DeepSeek proporciona soporte explícito de DSpark para vLLM y SGLang.

Para vLLM, la configuración relevante es:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Para SGLang, la tarjeta del modelo utiliza:

--speculative-algorithm DSPARK

DSpark no mejora el razonamiento del modelo por sí mismo.

Es una optimización de inferencia destinada a reducir la latencia de decodificación o aumentar el rendimiento, preservando al mismo tiempo la distribución de salida del modelo objetivo bajo la configuración compatible.

El Salto en los Puntos de Referencia

DeepSeek publica la siguiente comparación para V4 Flash 0731:

Punto de Referencia V4 Flash 0731 V4 Flash Preview V4 Pro Preview
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3 12.8
Toolathlon-Verified 70.3 49.7 55.9
Agents’ Last Exam 25.2 15.8 16.5
AutomationBench Public 25.1 10.8 12.8
DSBench-FullStack 68.7 37.0 41.8
DSBench-Hard 59.6 25.8 31.1

El aumento más drástico es DeepSWE:

7.3 → 54.4

CyberGym casi se duplica:

38.7 → 76.7

Terminal Bench 2.1 sube más de veinte puntos:

61.8 → 82.7

El nuevo modelo Flash también supera a V4 Pro Preview en todos los puntos de referencia de la tabla publicada por DeepSeek.

Eso es un cambio importante para un modelo posicionado originalmente principalmente como la opción más barata y rápida.

La Metodología de los Puntos de Referencia Importa

La tabla no debe leerse como una comparación pura de puntos de control sin procesar.

La tarjeta del modelo de DeepSeek incluye varias notas importantes.

Para las tareas públicas de agentes de código, la empresa utilizó:

DeepSeek Harness modo mínimo
Esfuerzo de razonamiento: máximo
Temperatura: 1.0
Top-p: 0.95

DeepSeek Harness no había sido publicado públicamente en el momento de la verificación.

Esto significa que los investigadores externos pueden no ser capaces aún de reproducir el entorno de software exacto utilizado para los resultados publicados de agentes de código.

Dos pruebas también son internas:

  • DSBench-FullStack.
  • DSBench-Hard.

Los puntos de referencia internos pueden ser útiles para el desarrollo de productos, pero los equipos independientes no pueden inspeccionar sus tareas ocultas ni los controles de contaminación.

La interpretación correcta es:

DeepSeek reporta una gran mejora bajo su pila de agentes y configuración de evaluación elegidas. La reproducibilidad pública mejorará cuando el harness, los prompts, los registros y la configuración completa de evaluación estén disponibles.

La Calidad del Harness Puede Cambiar la Puntuación

Un punto de referencia de codificación a menudo mide un sistema completo:

Modelo
+
prompt del sistema
+
herramientas de repositorio
+
terminal

ejecución
+
gestión de contexto
+
política de reintentos
+
retroalimentación de pruebas
+
lógica de envío de parches

El mismo modelo puede puntuar de manera diferente cuando cambia un componente.

Un mejor entorno de ejecución puede:

- Seleccionar archivos más relevantes.
- Conservar salida útil de terminal.
- Evitar el desbordamiento de contexto.
- Reintentar comandos fallidos de forma inteligente.
- Detener bucles improductivos.
- Aplicar parches de forma más fiable.
- Dar al modelo resultados de prueba más claros.

Esto no hace que el modelo sea irrelevante.

Significa que el resultado del benchmark pertenece a la combinación modelo-entorno.

Los sólidos números de 0731 sugieren que DeepSeek mejoró tanto el comportamiento del agente del modelo como el proceso de evaluación circundante.

## Artificial Analysis lo puntúa en 50

Artificial Analysis reporta un puntaje de Índice de Inteligencia de aproximadamente **50** para DeepSeek V4 Flash 0731, unos diez puntos por encima de la versión Flash anterior.

La firma independiente de análisis de modelos también describe a V4 Flash como excepcionalmente económica en comparación con otros sistemas frontera conocidos.

Reuters resumió los hallazgos de Artificial Analysis al informar un costo promedio de prueba de benchmark de aproximadamente tres centavos de dólar estadounidense bajo su metodología.

Esa comparación respalda el argumento de valor.

No significa que cada tarea de producción cueste tres centavos.

Artificial Analysis también reporta resultados más débiles en algunas medidas de confiabilidad del conocimiento.

Su artículo sobre V4 Flash 0731 señala:

- La precisión de omnisciencia se mantuvo alrededor del 37%.
- La tasa de alucinaciones disminuyó pero siguió siendo alta, aproximadamente al 84% bajo esa evaluación.

Esas cifras son un recordatorio útil.

Un modelo puede ser:

- Muy fuerte en agentes de codificación.
- Extremadamente económico.
- Competitivo en un índice compuesto.
- Aún poco confiable en algunas preguntas fácticas de mundo abierto.

"Mejor valor" no es lo mismo que "mejor para cada tarea".

## Precios oficiales de la API

El precio directo de la API de DeepSeek es:

| Categoría de facturación | Precio por 1M de tokens |
|-|-|
| Entrada con acierto de caché | \$0.0028 |
| Entrada sin acierto de caché | \$0.14 |
| Salida | \$0.28 |

La diferencia de precio entre un acierto de caché y un fallo de caché es enorme:

```Plaintext
\$0.14 ÷ \$0.0028 = 50

La entrada en caché es cincuenta veces más barata que la entrada sin caché.

Para agentes de larga duración, la estructura del prompt se convierte en arquitectura de costos.

Ejemplo de cálculo de costos

Supongamos que una solicitud utiliza:

100,000 tokens de entrada sin caché
20,000 tokens de salida

El costo directo del modelo es:

Entrada:
100,000 / 1,000,000 × \$0.14
= \$0.014

Salida:
20,000 / 1,000,000 × \$0.28
= \$0.0056

Total:
\$0.0196

Eso es menos de dos centavos de dólar estadounidense.

Ahora supongamos que el mismo prefijo de 100,000 tokens está en caché:

Entrada en caché:
100,000 / 1,000,000 × \$0.0028
= \$0.00028

Salida:
20,000 / 1,000,000 × \$0.28
= \$0.0056

Total:
\$0.00588

La salida ahora domina la factura.

Estos ejemplos explican por qué los prototipos de codificación de bajo costo son plausibles.

No incluyen:

  • Margen del proveedor.
  • Cargos de API de herramientas.
  • Costos de navegador o búsqueda.
  • Cómputo en entorno aislado.
  • Almacenamiento.
  • Intentos fallidos repetidos.
  • Tiempo humano de desarrollo.

Por qué las facturas de agentes aún pueden crecer

La codificación agéntica rara vez es una sola solicitud.

Un flujo de trabajo típico puede incluir:

  1. Leer el repositorio.
  2. Buscar código relevante.
  3. Planificar el cambio.
  4. Editar varios archivos.
  5. Ejecutar pruebas.
  6. Inspeccionar la

fallo.
7. Editar de nuevo.
8. Ejecutar las pruebas otra vez.
9. Revisar el diff.
10. Producir la respuesta final.

Cada paso puede generar otra llamada al modelo.

Una tarea aparentemente pequeña puede resultar costosa cuando:

  • El contexto del repositorio se descarga repetidamente sin caché.
  • El modelo genera razonamientos largos.
  • Las pruebas fallan muchas veces.
  • El agente lee archivos grandes innecesariamente.
  • Varios agentes paralelos duplican trabajo.
  • La compactación del contexto provoca que información importante se reenvíe.
  • El modelo no se detiene después de alcanzar una buena solución.

V4 Flash reduce el precio de estos errores.

No los elimina.

El Caché de Contexto Es la Principal Palanca de Costo

DeepSeek utiliza caché de contexto basado en disco.

Cuando se reutiliza el mismo prefijo, los tokens de entrada coincidentes pueden recibir el precio más bajo de caché.

Buenos candidatos para un prefijo estable incluyen:

  • Instrucciones del sistema.
  • Políticas del repositorio.
  • Definiciones de herramientas.
  • Documentos de referencia largos.
  • Una instantánea del proyecto sin cambios.
  • Contexto empresarial repetido.

Un diseño de prompt simplificado es:

Prefijo estable reutilizable
+
nueva solicitud del usuario
+
último resultado de la herramienta

Un diseño menos compatible con caché es:

Instrucciones reordenadas
+
resumen del repositorio reescrito
+
marcas de tiempo cambiantes
+
metadatos aleatorios de la solicitud
+
nueva solicitud del usuario

Pequeños cambios en el prefijo pueden reducir la reutilización de caché.

Los desarrolladores deben inspeccionar los campos de uso de tokens en lugar de asumir que un prompt largo fue almacenado en caché.

DeepSeek también ofrece aislamiento por user_id para privacidad y programación. La reutilización de caché y el aislamiento de usuarios deben diseñarse juntos para que el contexto de un cliente no se mezcle accidentalmente con el de otro.

Inicio Rápido con la API

La URL base oficial sigue siendo:

https://api.deepseek.com

El ID del modelo es:

deepseek-v4-flash

DeepSeek afirma que el ID de API estable sirve automáticamente la última versión oficial de Flash.

Eso es conveniente, pero los equipos de producción deberían registrar la huella digital del modelo devuelto y probar los cambios, porque el comportamiento detrás de un ID estable puede actualizarse.

Ejemplo en Python

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Revisa esta función y propón un refactor seguro.",
        }
    ],
)

print(response.choices[0].message.content)

Ejemplo con cURL

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "user",
        "content": "Escribe una pequeña CLI en Python que valide archivos JSON."
      }
    ]
  }'

Los desarrolladores deberían consultar la referencia de API en vivo para conocer los campos exactos de esfuerzo de razonamiento y modo de pensamiento compatibles con su endpoint y versión del SDK.

El Historial de Pensamiento Debe Conservarse

La documentación del modo de pensamiento de DeepSeek dice que cuando un turno incluye llamadas a herramientas, el reasoning_content del mensaje del asistente debe pasarse de vuelta en solicitudes posteriores.

Un agente multi-turno debe conservar:

  • content

reasoning_content

  • tool_calls

Eliminar el estado de razonamiento puede reducir la continuidad o causar problemas de validación de solicitudes.

Esto es especialmente relevante al integrarse mediante un cliente compatible con OpenAI que normalmente ignora los campos de razonamiento específicos del proveedor.

Compatibilidad con OpenAI, Anthropic y Responses

DeepSeek ofrece más de una interfaz.

Chat Completions de OpenAI

Utilice la URL base estándar de DeepSeek y el ID del modelo:

deepseek-v4-flash

API compatible con Anthropic

DeepSeek también documenta una interfaz en formato Anthropic.

Esto puede ayudar a que el software creado en torno a los mensajes estilo Claude se conecte a DeepSeek con menos cambios en la aplicación.

La compatibilidad no garantiza un comportamiento idéntico.

Los campos específicos del proveedor, el historial de razonamiento, los esquemas de herramientas, el comportamiento de seguridad y el manejo de errores aún requieren pruebas.

API Responses

DeepSeek afirma que la versión 0731 es compatible de forma nativa con el formato de la API Responses y se ha adaptado para su uso estilo Codex.

Esto es importante para los productos de agentes de codificación que dependen cada vez más de objetos de respuesta con estado, llamadas a herramientas y bucles de agente estructurados.

Pesos abiertos bajo la licencia MIT

DeepSeek ha publicado los pesos de V4 Flash 0731 en Hugging Face bajo la licencia MIT.

Esto permite a los desarrolladores inspeccionar, modificar, implementar y redistribuir el modelo sujeto a los términos de la licencia.

La publicación de pesos abiertos ofrece más control que un modelo solo de API.

Los equipos pueden:

  • Ejecutar el modelo en infraestructura privada.
  • Estudiar su arquitectura.
  • Crear variantes cuantizadas.
  • Adaptar los núcleos de inferencia.
  • Ajustarlo o especializarlo.
  • Integrarlo en sistemas internos.
  • Evitar enviar código sensible a una API de terceros.

La barrera práctica es el hardware.

"Pesos abiertos" no significa "se ejecuta en una computadora portátil normal".

Implementación con vLLM

La tarjeta oficial del modelo 0731 proporciona un ejemplo de vLLM para un solo nodo 4×GB300:

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code \
  --kv-cache-dtype fp8 \
  --block-size 256 \
  --data-parallel-size 4 \
  --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Este ejemplo demuestra la clase de infraestructura esperada para un servicio de calidad completa.

No debe interpretarse como la única configuración admitida.

La receta de vLLM puede agregar soporte para otras topologías de GPU con el tiempo.

Implementación con SGLang

El ejemplo oficial de SGLang es:

sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1

Los pesos objetivo y de borrador provienen del mismo punto de control, por lo que la documentación indica no configurar una ruta separada para el modelo de borrador especulativo.

Los motores de inferencia evolucionan rápidamente.

Utilice la tarjeta de modelo y la receta del motor de servicio actuales en lugar de copiar un comando de lanzamiento antiguo de la versión Preview.

La implementación local sigue siendo un proyecto de infraestructura

Aunque solo alrededor de

13B parámetros están activos para un token, los pesos completos del modelo deben permanecer disponibles en todo el sistema de servicio.

La planificación del despliegue debe considerar:

  • Almacenamiento total del modelo.
  • Memoria de la GPU.
  • Paralelismo de expertos.
  • Ancho de banda de interconexión.
  • Caché KV de contexto largo.
  • Soporte de cuantificación.
  • Kernels de DSpark.
  • Tamaño de lote.
  • Concurrencia.
  • Latencia de prefill.
  • Rendimiento de decodificación.

Cuantificaciones más pequeñas pueden hacer posible la experimentación en diferentes hardware, pero pueden cambiar la calidad, la velocidad o la longitud de contexto admitida.

Para la mayoría de los desarrolladores individuales, la API directa o un proveedor alojado será más fácil y más barato que el autoalojamiento.

API Oficial Versus Proveedores de Terceros

Hay tres formas comunes de usar V4 Flash.

Ruta Ventaja principal Compensación principal
API de DeepSeek Precio oficial y modelo oficial actual Los datos salen de tu entorno; la ID estable puede actualizarse
Plataforma de terceros Cuotas gratuitas, agentes integrados, facturación más fácil Las promociones y el enrutamiento pueden cambiar
Pesos autoalojados Máximo control y privacidad Requisitos significativos de hardware e ingeniería

La ruta más económica depende de la carga de trabajo.

Una cuota gratuita de Cline u OpenCode puede ser la mejor para experimentación.

La API directa puede ser la mejor para uso predecible a pequeña escala.

El autoalojamiento puede volverse atractivo solo con un volumen suficientemente alto y sostenido o cuando los requisitos de privacidad dominan.

La Mejor Era para Prototipar

El artículo fuente compara la IA económica con la producción en masa de automóviles.

La analogía es imperfecta pero útil.

Cuando una tecnología se vuelve drásticamente más barata, el mercado no simplemente compra la misma cantidad por menos dinero.

Se vuelven posibles nuevos usos.

Los modelos de agentes de bajo costo pueden respaldar experimentos que previamente habrían sido rechazados antes de las pruebas.

Ejemplos incluyen:

  • Un estudiante creando un primer prototipo de software.
  • Un fundador individual generando y probando varias ideas de páginas de aterrizaje.
  • Un pequeño equipo ejecutando revisión de código en cada solicitud de extracción.
  • Un proyecto de código abierto ofreciendo triaje gratuito de problemas.
  • Un investigador procesando una gran colección de código o documentos.
  • Una empresa creando agentes internos para trabajo repetitivo.
  • Un desarrollador de juegos probando mecánicas y niveles generados.

El valor no es que el modelo reemplace toda la ingeniería de software.

Reduce el costo de preguntar:

¿Vale la pena desarrollar esta idea más a fondo?

Un Prototipo No Es un Producto

La generación barata puede producir una primera demostración convincente.

Un producto de producción todavía necesita:

  • Diseño de producto.
  • Seguridad.
  • Pruebas.
  • Accesibilidad.
  • Rendimiento.
  • Monitoreo.
  • Despliegue.
  • Protección de datos.
  • Revisión legal.
  • Mantenimiento.
  • Soporte al cliente.

Una factura de modelo de siete centavos no significa un negocio de siete centavos.

Significa que el primer experimento computacional puede ser lo suficientemente barato como para intentarlo.

Eso cambia quién puede participar y cuántas ideas pueden probarse.

Un Ejemplo de Espacio de Trabajo Construido por la Comunidad

El artículo fuente incluye un espacio de trabajo de documentos ligero mostrado como un ejemplo de lo que los desarrolladores estaban construyendo con agentes de codificación económicos.

![La imagen muestra una interfaz de espacio de trabajo de documentos. A la izquierda hay una barra de navegación con opciones como "Todos los documentos", "Archivos", "Centro de tareas", etc. Arriba a la derecha se muestra "Espacio de trabajo contextual", y abajo hay secciones como "Centro de tareas", "Lista de tareas", "Detalles de tareas", etc. La parte central muestra "Silicon Valley 101 - GPU", "RonnieChatterji - AI agentización", "RadiArk -

Títulos de documentos como "Optimización de la utilización de la GPU" y parte de su contenido. En la parte inferior aparece la opción "Cuenta de archivo local". Esta imagen está relacionada con el contenido que presenta el espacio de trabajo de documentos en la documentación, y muestra de forma directa la disposición de la interfaz del espacio de trabajo y parte de la información de los documentos.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/ea723a10-dc29-41c2-9668-b104bd715b44-5355bdda-f7e2-4763-919d-43a90bf112fd.png)

Una captura de pantalla no puede establecer qué parte de la aplicación fue producida por el modelo, cuánta edición humana se requirió, ni si el producto es seguro y mantenible.

Sí muestra el tipo de proyecto que los modelos de codificación de bajo costo facilitan para crear prototipos.

Dónde encaja mejor V4 Flash

V4 Flash 0731 es especialmente atractivo cuando:

  • La tarea depende en gran medida de código o herramientas.
  • El costo es un factor importante.
  • Un contexto amplio resulta útil.
  • Se espera un alto volumen de solicitudes.
  • El flujo de trabajo puede validar los resultados.
  • Los reintentos ocasionales son aceptables.
  • Se dispone de un modelo alternativo más grande para casos difíciles.

Puede ser menos adecuado cuando:

  • La precisión factual en el mundo abierto es crítica.
  • Una primera respuesta pulida importa más que el costo.
  • La tarea requiere comprensión de imágenes.
  • La organización no puede validar el código generado.
  • Se requiere una garantía de cumplimiento gestionada.
  • El flujo de trabajo depende de un comportamiento de API estable y con versión fija.

Un enrutador de modelos puede combinar Flash con un sistema más potente o más especializado.

Por ejemplo:

Ediciones rutinarias de repositorio
→ V4 Flash

Decisiones de arquitectura o seguridad de alto riesgo
→ modelo más potente + revisión humana

Los modelos baratos cambian la arquitectura de los agentes

Cuando las llamadas a modelos son caras, los desarrolladores intentan minimizar cada solicitud.

Cuando las llamadas se vuelven baratas, un agente puede permitirse:

  • Pedir a otro modelo que revise el parche.
  • Ejecutar una pasada separada de análisis de pruebas.
  • Generar varias soluciones candidatas.
  • Comparar implementaciones alternativas.
  • Usar un modelo para la planificación y otro para la ejecución.
  • Revisar su propio trabajo antes de la entrega.

Esto puede aumentar la fiabilidad.

También puede desperdiciar tokens.

El objetivo correcto no es el uso mínimo de tokens.

Es:

El costo total más bajo que alcanza la calidad requerida

Los principales riesgos detrás de la historia del precio

1. La versión beta pública puede cambiar

DeepSeek describe la API oficial de Flash como una beta pública.

Los precios, el comportamiento, los límites y las versiones del modelo pueden cambiar.

Los equipos de producción deben mantener pruebas de regresión.

2. Las puntuaciones de referencia dependen del harness de DeepSeek

Los resultados más sólidos del agente de código utilizan una configuración de harness no publicada.

La reproducción independiente exacta aún no es sencilla.

3. Una entrada barata no garantiza un agente barato

La salida, los reintentos, las herramientas y el contexto no almacenado en caché pueden dominar el costo final.

4. El contexto largo no es gratuito

Una ventana de 1 millón de tokens es un límite de capacidad, no una recomendación para enviar un millón de tokens en cada solicitud.

Las cargas de trabajo grandes de prefill aumentan la latencia y el costo.

5. La fiabilidad en el mundo abierto aún necesita trabajo

La evaluación independiente muestra que el valor y la capacidad de codificación pueden coexistir con una alta tasa de alucinaciones en pruebas fácticas.

Los datos críticos deben verificarse contra las fuentes.

6. El código generado requiere revisión

Los modelos de bajo costo pueden generar más código del que un equipo puede inspeccionar de forma segura.

Las pruebas automatizadas, el análisis estático, el escaneo de dependencias y la revisión humana siguen siendo necesarios.

7. El acceso promocional es temporal

Los modelos gratuitos de terceros y los descuentos pueden desaparecer.

No construyas un modelo de negocio permanente basado en un subsidio de siete días o de tiempo limitado.

8. Los IDs de API estables pueden ocultar actualizaciones

El ID del modelo deepseek-v4-flash apunta a la versión actual.

Una actualización detrás de ese ID puede cambiar los resultados sin que haya un cambio de código en tu aplicación.

Lista práctica de control de costos

1. Estabiliza los prefijos reutilizables

Mantén las instrucciones del sistema y las definiciones de herramientas consistentes para mejorar la reutilización de la caché.

2. Realiza un seguimiento separado de los tokens de acierto de caché

No te bases únicamente en el total de tokens de entrada.

3. Limita la salida innecesaria

Establece un presupuesto de salida realista para la tarea.

4. Usa un menor esfuerzo de razonamiento para tareas rutinarias

Reserva max para tareas que se beneficien de una deliberación más larga.

5. Limita los pasos del agente

Detén los bucles que no están progresando.

6. Ejecuta validaciones económicas antes de otra llamada al modelo

Usa linters, pruebas, validadores de esquemas y comprobaciones deterministas.

7. Enruta los casos difíciles

Escala solo cuando la tarea falle una prueba o supere un umbral de riesgo.

8. Mide el costo por resultado aceptado

Incluye los intentos fallidos y la revisión humana.

Una cosa más: DeepSeek Harness

El artículo original termina con un posible siguiente paso en el ecosistema de desarrolladores de DeepSeek.

Tianyi Cui, identificado en la fuente como el responsable de DeepSeek Harness, publicó un mensaje de reclutamiento para desarrolladores de proyectos de código abierto de agent-harness.

El mensaje invitaba a los desarrolladores interesados a compartir una cuenta de GitHub y trabajo de código abierto representativo para participar en pruebas internas.

La imagen es un tweet de Twitter, publicado por Tianyi Cui, que invita a los desarrolladores interesados en proyectos de código abierto relacionados con Agent Harness a participar en las pruebas internas de DeepSeek Harness. Pueden responder o enviar un mensaje privado, adjuntando su ID de GitHub y trabajos representativos de código abierto. El tweet fue editado por última vez el 1 de agosto de 2026 a las 7:46 PM, con 1K comentarios, 496 retweets, 2.9K me gusta y 1.8K guardados, y 879.7K vistas. Este tweet está relacionado con la información de invitación a pruebas internas de desarrolladores de DeepSeek Harness en el documento, y es el mensaje de reclutamiento publicado por Tianyi Cui mencionado en el documento para reclutar desarrolladores para las pruebas internas.

El registro de cambios del 31 de julio de DeepSeek también dice que el modo mínimo de DeepSeek Harness utilizado para la evaluación de benchmarks "se lanzará pronto".

Al momento de la verificación, no pude localizar:

  • Un repositorio público oficial de DeepSeek Harness.
  • Una página de producto estable para "DeepSeek Code".
  • Instrucciones públicas de instalación.
  • Precios.
  • Una fecha de lanzamiento.
  • Una especificación completa de funciones.

La evidencia respalda esta conclusión más acotada:

DeepSeek está probando un agent harness y tiene la intención de lanzar al menos parte del marco, pero el nombre final del producto, el alcance público y el momento del lanzamiento siguen sin confirmarse.

El modelo, la API y los pesos abiertos están disponibles ahora.

El harness sigue siendo un componente futuro del ecosistema.

Por qué DeepSeek Harness podría ser importante

Un harness de primera parte podría ayudar a DeepSeek a controlar toda la pila del agente de codificación.

Podría proporcionar:

  • Manejo nativo del historial de razonamiento.
  • Formatos de prompt específicos del modelo.
  • Análisis de llamadas a herramientas.
  • Gestión de contexto.
  • Búsqueda en el repositorio.
  • Ejecución en terminal.
  • Reproducibilidad de benchmarks.
  • Integración con la API de respuestas.
  • Flujos de trabajo compatibles con Codex.
  • Controles de costos.
  • Enrutamiento automático entre Flash y Pro.

DeepSeek ya documenta integraciones con harnesses externos y agentes de codificación.

Una herramienta de primera parte podría convertir optimizaciones específicas de benchmarks en un producto que los desarrolladores ordinarios puedan usar.

También podría revelar cuánto del salto en benchmarks de V4 Flash 0731 proviene del checkpoint y cuánto del runtime del agente.

Qué Observar a Continuación

Varios desarrollos determinarán si el momento V4 Flash se convierte en un cambio duradero del ecosistema.

Lanzamiento Oficial de V4 Pro

DeepSeek dice que el lanzamiento oficial de V4 Pro seguirá a la actualización de Flash.

La brecha de rendimiento y precio entre Pro y Flash afectará las decisiones de enrutamiento.

Disponibilidad de DeepSeek Harness

Un lanzamiento público mejoraría la reproducibilidad de los benchmarks y daría a los desarrolladores un framework de agentes nativo del modelo.

Estabilidad de Precios

El precio directo ya es bajo, pero las promociones de terceros podrían no mantenerse.

Capacidad del Proveedor

La inferencia barata atrae tráfico muy alto.

La latencia, los límites de velocidad y la fiabilidad importarán a medida que el uso escale.

Soporte de Inferencia de Código Abierto

vLLM, SGLang, los proveedores de hardware y los proyectos de cuantización determinarán qué tan accesible se vuelve el autoalojamiento.

Evaluaciones Independientes

Más evaluaciones públicas deberían probar:

  • Codificación.
  • Seguridad.
  • Fiabilidad factual.
  • Contexto largo.
  • Uso de herramientas.
  • Costo por tarea exitosa.
  • Rendimiento bajo diferentes harnesses.

Preguntas Frecuentes

¿Qué es DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 es el lanzamiento oficial del 31 de julio de V4 Flash, actualmente servido a través de la API deepseek-v4-flash en beta pública. DeepSeek dice que mantiene la arquitectura base y el tamaño del modelo Preview mientras mejora sustancialmente las capacidades de agente mediante nuevo post-entrenamiento.

¿Cuánto cuesta DeepSeek V4 Flash?

La API oficial de DeepSeek lista $0.14 por millón de tokens de entrada sin caché, $0.0028 por millón de tokens de entrada con caché y $0.28 por millón de tokens de salida. Las plataformas de terceros pueden ofrecer precios diferentes, cuotas gratuitas o descuentos temporales.

¿Un juego 3D realmente cuesta solo RMB 0.07 para generar?

El artículo fuente cita un ejemplo comunitario con ese costo de modelo reportado. El ejemplo no está acompañado de prompts completos, registros de tokens, datos de caché, reintentos, costos de herramientas o registros de trabajo humano, por lo que debe tratarse como una anécdota más que como un presupuesto garantizado.

¿Cuáles son los principales puntajes de benchmark de V4 Flash 0731?

DeepSeek reporta 82.7 en Terminal Bench 2.1, 76.7 en CyberGym, 54.4 en DeepSWE, 70.3 en Toolathlon-Verified y 54.2 en NL2Repo. Las evaluaciones públicas de agentes de código usaron el modo mínimo no lanzado de DeepSeek Harness con máximo esfuerzo de razonamiento.

¿DeepSeek V4 Flash 0731 es de código abierto?

Los pesos del modelo y el repositorio se lanzan bajo la Licencia MIT, por lo que "pesos abiertos" y uso ampliamente permisivo son descripciones precisas. Ejecutar el checkpoint completo aún requiere infraestructura sustancial de múltiples GPU.

¿Puede DeepSeek V4 Flash ejecutarse localmente?

Sí, DeepSeek publica pesos e instrucciones de servicio para vLLM y SGLang. Los ejemplos oficiales a escala completa usan hardware avanzado de múltiples GPU, por lo que una laptop normal no es el entorno objetivo para el modelo completo.

¿Cuál es la ventana de contexto?

La API oficial y la tarjeta del modelo especifican una ventana de contexto de 1 millón de tokens. La API también lista un

longitud máxima de salida de 384K tokens, pero usar el contexto o la salida máximos puede aumentar significativamente la latencia y el uso de recursos.

¿Se han lanzado DeepSeek Code o DeepSeek Harness?

DeepSeek ha hecho referencia pública a un modo mínimo de Harness y ha reclutado desarrolladores de harness de código abierto para pruebas internas. Durante la verificación no se localizó un repositorio público completo, una especificación final del producto ni una fecha de lanzamiento confirmada.

Herramientas relacionadas

  • API de DeepSeek: La plataforma oficial para claves de API, facturación y acceso directo a los modelos de DeepSeek.
  • DeepSeek V4 Flash 0731 en Hugging Face: Punto de control oficial de pesos abiertos, tarjeta del modelo, tabla de benchmarks, licencia e instrucciones de implementación.
  • vLLM: Un motor de servicio de alto rendimiento de código abierto con soporte para DeepSeek V4 y DSpark.
  • SGLang: Un framework de servicio de código abierto con una ruta de implementación publicada para V4 Flash 0731.
  • OpenCode: Un agente de codificación de código abierto cuyo servicio Zen ofrece actualmente una opción gratuita por tiempo limitado de V4 Flash.
  • Cline: Un agente de codificación y plataforma de modelos de código abierto que ofrece DeepSeek V4 Flash a través de su ecosistema de proveedores.
  • Nous Portal: Una plataforma de inferencia multimodelo que realizó una promoción limitada de DeepSeek V4 Flash.
  • Artificial Analysis: Una plataforma independiente de análisis de modelos que cubre inteligencia, velocidad, precio y costo de benchmarks.

Enlaces relacionados

Resumen

DeepSeek V4 Flash 0731 mantiene la base del modelo Preview

La arquitectura y el tamaño son similares, pero utiliza un nuevo post-entrenamiento que produce un gran salto en el rendimiento de agentes de codificación. DeepSeek reporta 82.7 en Terminal Bench 2.1, 76.7 en CyberGym y 54.4 en DeepSWE, aunque los resultados públicos más sólidos de agentes de código dependen de una configuración no publicada de DeepSeek Harness.

El precio oficial de la API es inusualmente bajo: $0.14 por millón de tokens de entrada no almacenados en caché, $0.0028 por millón de tokens de entrada en caché y $0.28 por millón de tokens de salida. Las cuotas gratuitas y descuentos de terceros pueden hacer que el acceso sea aún más barato, pero esas promociones son temporales y no deben confundirse con el precio de lista permanente.

El lanzamiento de pesos abiertos bajo licencia MIT, el contexto de 1 millón de tokens, las APIs compatibles con Responses y Anthropic, y el soporte en vLLM y SGLang hacen que el modelo sea accesible tanto en rutas alojadas como autogestionadas. La implementación local completa sigue siendo un proyecto serio de infraestructura multi-GPU.

Los prototipos virales de siete y cincuenta centavos son ejemplos plausibles de lo bajo que puede llegar a ser el costo marginal del modelo, pero no son estudios completos del costo del producto. Los bucles de agentes, la longitud de salida, las fallas de caché, las herramientas, las pruebas y el trabajo humano siguen siendo importantes.

DeepSeek V4 Flash 0731 es importante no porque cada aplicación ahora cueste unos centavos, sino porque la codificación agéntica capaz se ha vuelto lo suficientemente barata como para que muchos más desarrolladores experimenten a una escala significativa.