DeepSeek V4 Flash 0731: La demo de juego de $0.07, precios de API, arquitectura y puntos de referencia de codificación
DeepSeek V4 Flash 0731 ha generado una combinación inusual de reacciones. Los desarrolladores están impresionados por sus puntuaciones en agentes de codificación. Los equipos de infraestructura están interesados en su millón a...

DeepSeek V4 Flash 0731: Cómo un Modelo Re-Entrenado Provocó una Guerra Mundial de Precios
Introducción
DeepSeek V4 Flash 0731 ha generado una combinación inusual de reacciones.
Los desarrolladores están impresionados por sus puntuaciones en agentes de codificación.
Los equipos de infraestructura están interesados en su contexto de 1 millón de tokens y su bajo número de parámetros activos.
Las plataformas de IA están ofreciendo uso gratuito y descuentos agresivos.
Y las redes sociales se llenan de capturas de pantalla de prototipos cuyas facturas de inferencia reportadas se miden en céntimos en lugar de dólares.
Los ejemplos más compartidos en el artículo fuente incluyeron:
- Un pequeño prototipo de shooter espacial 3D supuestamente generado por unos 0,07 RMB.
- Un prototipo estilo Counter-Strike supuestamente producido por aproximadamente 0,50 RMB.
- Un panel de uso personal que muestra 87 millones de tokens por 31,57 RMB.
- OpenCode informando 8 billones de tokens de DeepSeek Flash el 1 de agosto.
- Cline aumentando su cuota gratuita tras descubrir que el modelo era más barato de subsidiar de lo esperado.
- Nous Portal ofreciendo temporalmente un 90% de descuento en V4 Flash 0731.
Estos ejemplos capturan la emoción, pero también pueden difuminar varias cosas distintas:
- El precio oficial de la API de DeepSeek.
- Los precios con acierto de caché y con fallo de caché.
- El acceso gratuito o subsidiado de terceros.
- El número de llamadas a herramientas que realiza un agente.
- La cantidad de salida y razonamiento oculto generado.
- El costo del modelo solo frente al costo del producto completo.
El modelo es genuinamente económico.
Eso no significa que cada aplicación cueste siete céntimos.
La pregunta útil no es si una demo viral es reproducible exactamente. Es cómo DeepSeek logró un salto de capacidad tan grande sin cambiar la arquitectura base—y qué significan las nuevas economías para los desarrolladores.
El Ciclo Global de Descuentos
El precio oficial de la API ya era bajo antes de aplicar las promociones de terceros.
DeepSeek actualmente lista los siguientes precios por millón de tokens:
| Tipo de uso | Precio de DeepSeek V4 Flash |
|---|---|
| Entrada, acierto de caché | $0,0028 |
| Entrada, fallo de caché | $0,14 |
| Salida | $0,28 |
La API admite:
- Una ventana de contexto de 1 millón de tokens.
- Hasta 384K tokens de salida.
- Modos de pensamiento y no pensamiento.
- Tres niveles de esfuerzo de razonamiento en la ficha del modelo 0731:
low,highymax. - Llamadas a herramientas.
- Salida JSON.
- Completado de prefijo de chat en versión beta.
- Completado FIM en modo no pensamiento.
- Completado de Chat compatible con OpenAI.
- La API de Responses.
- Una interfaz compatible con Anthropic.
- Un límite de concurrencia publicado de 2.500 por cuenta para V4 Flash.
Esos precios oficiales son la línea base.
Las plataformas pueden entonces elegir:
- Transmitir el precio tal cual.
- Añadir un margen.
- Subsidiar el uso.
- Ofrecer un modelo gratuito limitado.
- Incluir el modelo en una suscripción.
- Aplicar créditos promocionales.
- Enrutar el tráfico a través de otro proveedor de inferencia.
Por eso un desarrollador puede pagar el precio de lista de DeepSeek mientras otro no paga nada durante un período limitado.
OpenCode Informa Ocho Billones de Tokens en un Día
OpenCode declaró públicamente que DeepSeek Flash procesó 8 billones de tokens el 1 de agosto a través de su plataforma.
La publicación desglosa la cifra de la siguiente manera:
5 billones de tokens de uso gratuito
+
3 billones de tokens a través de OpenCode Go

La documentación actual de Zen de OpenCode enumera una opción DeepSeek V4 Flash Free disponible por tiempo limitado.
Esta es una distinción importante.
La cifra de ocho billones de tokens describe el tráfico a través de OpenCode, no el uso directo reportado por DeepSeek en todas las plataformas.
Sigue siendo una señal contundente de que los modelos de bajo costo pueden generar una demanda enorme cuando se integran en un flujo de trabajo popular de agentes de codificación.
Nous Portal Reduce Temporalmente el Precio en un 90%
Nous Research anunció una promoción de siete días que ofrece DeepSeek V4 Flash 0731 con un 90% de descuento a través de Nous Portal en colaboración con Novita Labs.

La publicación promocional comparó el costo con descuento con Claude Fable 5 y afirmó una diferencia de precio de más de 1,000 veces en tareas comparables.
Esa comparación depende de varias elecciones:
- Qué precio de proveedor se utiliza.
- Si predominan las entradas o las salidas.
- Si la caché está disponible.
- Qué configuración de razonamiento se selecciona.
- Cuántos tokens necesita cada modelo para completar la tarea.
- Qué punto de referencia o flujo de trabajo define lo "comparable".
Una comparación de precio por token es útil, pero la métrica más significativa es:
Costo total por tarea aceptada
Un modelo que utiliza menos tokens costosos puede ser más barato que un modelo de bajo precio que reintenta repetidamente.
Por el contrario, cuando un modelo de bajo precio también es lo suficientemente capaz para completar la tarea rápidamente, la ventaja de costo puede volverse enorme.
Cline Triplica su Cuota Gratuita
Cline anunció inicialmente el uso gratuito de V4 Flash 0731 a través de su agente de codificación.
Una publicación pública posterior dijo que la cuota gratuita se había triplicado porque la economía parecía sostenible.

El catálogo de modelos actual de Cline y el material de ClinePass incluyen DeepSeek V4 Flash como una opción rápida y orientada al valor para tareas de codificación enfocadas.
Las cuotas gratuitas y la disponibilidad de modelos pueden cambiar, por lo que los usuarios deben consultar la página del proveedor en vivo en lugar de confiar en una captura de pantalla antigua.
La lección más amplia es más duradera.
Cuando la inferencia se vuelve lo suficientemente barata, una plataforma de agentes puede usar el acceso gratuito como adquisición de clientes sin absorber
el mismo costo que enfrentaría con un modelo frontera premium.
Las capturas de pantalla de costos de la comunidad necesitan contexto
El artículo original incluye un panel que muestra:
- 31,57 RMB en gastos.
- 2.282 solicitudes de API.
- 87.027.995 tokens.

La captura de pantalla es útil porque demuestra el orden de magnitud que los desarrolladores pueden ver bajo patrones de uso favorables.
No revela suficiente información para reconstruir la factura exactamente.
Las variables que faltan incluyen:
- Proporción de tokens de entrada frente a salida.
- Porcentaje de aciertos de caché.
- Versión del modelo utilizada en cada fecha.
- Esfuerzo de razonamiento.
- Número de llamadas a herramientas.
- Solicitudes fallidas.
- Créditos promocionales.
- Descuentos del proveedor.
- Si todos los tokens se facturaron a la misma tarifa.
Un prompt de sistema largo y repetido puede ser extremadamente barato cuando se sirve desde la caché.
Un prompt único y largo enviado una sola vez se factura al precio de entrada sin acierto de caché.
La salida también es mucho más cara que la entrada con caché.
Para sistemas de agentes, estas diferencias dominan la factura final.
Flash Blitz: Qué cambió el 31 de julio
DeepSeek V4 Preview se lanzó el 24 de abril de 2026.
La familia incluía:
- DeepSeek V4 Pro.
- DeepSeek V4 Flash.
El lanzamiento de Preview estableció la arquitectura principal:
- Mezcla dispersa de expertos.
- Contexto de 1 millón de tokens.
- Atención eficiente de contexto largo.
- Bajo número de parámetros activos en relación con la capacidad total.
- Modos de pensamiento y no pensamiento.
- Pesos abiertos bajo la licencia MIT.
V4 Flash Preview se posicionó como la alternativa más pequeña, rápida y barata a V4 Pro.
La actualización del 31 de julio cambió su posición competitiva.
DeepSeek afirma que V4 Flash 0731 utiliza la misma arquitectura y tamaño de modelo que V4 Flash Preview.
La actualización se produjo ejecutando un nuevo proceso de post-entrenamiento.
En forma simplificada:
Misma arquitectura base preentrenada
+
nuevo post-entrenamiento y optimización de agentes
=
comportamiento de agente de código mucho más fuerte
Esto es importante porque muestra cuánta capacidad puede permanecer latente en un modelo preentrenado.
La arquitectura y el número de parámetros no son todo el producto.
El post-entrenamiento determina la eficacia con la que el modelo:
- Utiliza herramientas.
- Planifica trabajos de múltiples pasos.
- Maneja la retroalimentación del terminal.
- Se recupera de errores.
- Escribe y edita archivos.
- Sigue un protocolo de agente.
- Asigna el esfuerzo de razonamiento.
- Trabaja dentro de un entorno controlado.
Arquitectura base y detalles del checkpoint
La ficha técnica del modelo original V4 Flash describe el modelo base como:
| Especificación | DeepSeek V4 Flash |
|---|---|
| Parámetros MoE base totales | 284B |
| Parámetros activados | 13B |
| Longitud de contexto | 1M |
| Licencia | MIT |
| Modalidad principal | Texto |
| Precisión base | FP8 / precisión mixta baja según el checkpoint |
La ficha técnica del modelo 0731 dice que el nuevo lanzamiento tiene la misma estructura que la variante DSpark e incluye un módulo adjunto de decodificación especulativa.
Esto explica por qué algunos metadatos de archivos del modelo pueden mostrar
un recuento total de puntos de control mayor que la cifra base de 284B del MoE.
La descripción más clara es:
El modelo MoE subyacente de V4 Flash sigue siendo de aproximadamente 284B en total con 13B de parámetros activos, mientras que la versión 0731 incluye el componente adicional de decodificación especulativa DSpark en el punto de control publicado.
Decodificación Especulativa DSpark
La decodificación especulativa utiliza un proceso de borrador rápido para proponer varios tokens futuros.
El modelo principal verifica entonces esas propuestas.
Cuando las predicciones se aceptan, el sistema puede producir múltiples tokens con menos trabajo secuencial.
La tarjeta del modelo 0731 de DeepSeek proporciona soporte explícito de DSpark para vLLM y SGLang.
Para vLLM, la configuración relevante es:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Para SGLang, la tarjeta del modelo utiliza:
--speculative-algorithm DSPARK
DSpark no mejora el razonamiento del modelo por sí mismo.
Es una optimización de inferencia destinada a reducir la latencia de decodificación o aumentar el rendimiento, preservando al mismo tiempo la distribución de salida del modelo objetivo bajo la configuración compatible.
El Salto en los Puntos de Referencia
DeepSeek publica la siguiente comparación para V4 Flash 0731:
| Punto de Referencia | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
El aumento más drástico es DeepSWE:
7.3 → 54.4
CyberGym casi se duplica:
38.7 → 76.7
Terminal Bench 2.1 sube más de veinte puntos:
61.8 → 82.7
El nuevo modelo Flash también supera a V4 Pro Preview en todos los puntos de referencia de la tabla publicada por DeepSeek.
Eso es un cambio importante para un modelo posicionado originalmente principalmente como la opción más barata y rápida.
La Metodología de los Puntos de Referencia Importa
La tabla no debe leerse como una comparación pura de puntos de control sin procesar.
La tarjeta del modelo de DeepSeek incluye varias notas importantes.
Para las tareas públicas de agentes de código, la empresa utilizó:
DeepSeek Harness modo mínimo
Esfuerzo de razonamiento: máximo
Temperatura: 1.0
Top-p: 0.95
DeepSeek Harness no había sido publicado públicamente en el momento de la verificación.
Esto significa que los investigadores externos pueden no ser capaces aún de reproducir el entorno de software exacto utilizado para los resultados publicados de agentes de código.
Dos pruebas también son internas:
- DSBench-FullStack.
- DSBench-Hard.
Los puntos de referencia internos pueden ser útiles para el desarrollo de productos, pero los equipos independientes no pueden inspeccionar sus tareas ocultas ni los controles de contaminación.
La interpretación correcta es:
DeepSeek reporta una gran mejora bajo su pila de agentes y configuración de evaluación elegidas. La reproducibilidad pública mejorará cuando el harness, los prompts, los registros y la configuración completa de evaluación estén disponibles.
La Calidad del Harness Puede Cambiar la Puntuación
Un punto de referencia de codificación a menudo mide un sistema completo:
Modelo
+
prompt del sistema
+
herramientas de repositorio
+
terminal
ejecución
+
gestión de contexto
+
política de reintentos
+
retroalimentación de pruebas
+
lógica de envío de parches
El mismo modelo puede puntuar de manera diferente cuando cambia un componente.
Un mejor entorno de ejecución puede:
- Seleccionar archivos más relevantes.
- Conservar salida útil de terminal.
- Evitar el desbordamiento de contexto.
- Reintentar comandos fallidos de forma inteligente.
- Detener bucles improductivos.
- Aplicar parches de forma más fiable.
- Dar al modelo resultados de prueba más claros.
Esto no hace que el modelo sea irrelevante.
Significa que el resultado del benchmark pertenece a la combinación modelo-entorno.
Los sólidos números de 0731 sugieren que DeepSeek mejoró tanto el comportamiento del agente del modelo como el proceso de evaluación circundante.
## Artificial Analysis lo puntúa en 50
Artificial Analysis reporta un puntaje de Índice de Inteligencia de aproximadamente **50** para DeepSeek V4 Flash 0731, unos diez puntos por encima de la versión Flash anterior.
La firma independiente de análisis de modelos también describe a V4 Flash como excepcionalmente económica en comparación con otros sistemas frontera conocidos.
Reuters resumió los hallazgos de Artificial Analysis al informar un costo promedio de prueba de benchmark de aproximadamente tres centavos de dólar estadounidense bajo su metodología.
Esa comparación respalda el argumento de valor.
No significa que cada tarea de producción cueste tres centavos.
Artificial Analysis también reporta resultados más débiles en algunas medidas de confiabilidad del conocimiento.
Su artículo sobre V4 Flash 0731 señala:
- La precisión de omnisciencia se mantuvo alrededor del 37%.
- La tasa de alucinaciones disminuyó pero siguió siendo alta, aproximadamente al 84% bajo esa evaluación.
Esas cifras son un recordatorio útil.
Un modelo puede ser:
- Muy fuerte en agentes de codificación.
- Extremadamente económico.
- Competitivo en un índice compuesto.
- Aún poco confiable en algunas preguntas fácticas de mundo abierto.
"Mejor valor" no es lo mismo que "mejor para cada tarea".
## Precios oficiales de la API
El precio directo de la API de DeepSeek es:
| Categoría de facturación | Precio por 1M de tokens |
|-|-|
| Entrada con acierto de caché | \$0.0028 |
| Entrada sin acierto de caché | \$0.14 |
| Salida | \$0.28 |
La diferencia de precio entre un acierto de caché y un fallo de caché es enorme:
```Plaintext
\$0.14 ÷ \$0.0028 = 50
La entrada en caché es cincuenta veces más barata que la entrada sin caché.
Para agentes de larga duración, la estructura del prompt se convierte en arquitectura de costos.
Ejemplo de cálculo de costos
Supongamos que una solicitud utiliza:
100,000 tokens de entrada sin caché
20,000 tokens de salida
El costo directo del modelo es:
Entrada:
100,000 / 1,000,000 × \$0.14
= \$0.014
Salida:
20,000 / 1,000,000 × \$0.28
= \$0.0056
Total:
\$0.0196
Eso es menos de dos centavos de dólar estadounidense.
Ahora supongamos que el mismo prefijo de 100,000 tokens está en caché:
Entrada en caché:
100,000 / 1,000,000 × \$0.0028
= \$0.00028
Salida:
20,000 / 1,000,000 × \$0.28
= \$0.0056
Total:
\$0.00588
La salida ahora domina la factura.
Estos ejemplos explican por qué los prototipos de codificación de bajo costo son plausibles.
No incluyen:
- Margen del proveedor.
- Cargos de API de herramientas.
- Costos de navegador o búsqueda.
- Cómputo en entorno aislado.
- Almacenamiento.
- Intentos fallidos repetidos.
- Tiempo humano de desarrollo.
Por qué las facturas de agentes aún pueden crecer
La codificación agéntica rara vez es una sola solicitud.
Un flujo de trabajo típico puede incluir:
- Leer el repositorio.
- Buscar código relevante.
- Planificar el cambio.
- Editar varios archivos.
- Ejecutar pruebas.
- Inspeccionar la
fallo.
7. Editar de nuevo.
8. Ejecutar las pruebas otra vez.
9. Revisar el diff.
10. Producir la respuesta final.
Cada paso puede generar otra llamada al modelo.
Una tarea aparentemente pequeña puede resultar costosa cuando:
- El contexto del repositorio se descarga repetidamente sin caché.
- El modelo genera razonamientos largos.
- Las pruebas fallan muchas veces.
- El agente lee archivos grandes innecesariamente.
- Varios agentes paralelos duplican trabajo.
- La compactación del contexto provoca que información importante se reenvíe.
- El modelo no se detiene después de alcanzar una buena solución.
V4 Flash reduce el precio de estos errores.
No los elimina.
El Caché de Contexto Es la Principal Palanca de Costo
DeepSeek utiliza caché de contexto basado en disco.
Cuando se reutiliza el mismo prefijo, los tokens de entrada coincidentes pueden recibir el precio más bajo de caché.
Buenos candidatos para un prefijo estable incluyen:
- Instrucciones del sistema.
- Políticas del repositorio.
- Definiciones de herramientas.
- Documentos de referencia largos.
- Una instantánea del proyecto sin cambios.
- Contexto empresarial repetido.
Un diseño de prompt simplificado es:
Prefijo estable reutilizable
+
nueva solicitud del usuario
+
último resultado de la herramienta
Un diseño menos compatible con caché es:
Instrucciones reordenadas
+
resumen del repositorio reescrito
+
marcas de tiempo cambiantes
+
metadatos aleatorios de la solicitud
+
nueva solicitud del usuario
Pequeños cambios en el prefijo pueden reducir la reutilización de caché.
Los desarrolladores deben inspeccionar los campos de uso de tokens en lugar de asumir que un prompt largo fue almacenado en caché.
DeepSeek también ofrece aislamiento por user_id para privacidad y programación. La reutilización de caché y el aislamiento de usuarios deben diseñarse juntos para que el contexto de un cliente no se mezcle accidentalmente con el de otro.
Inicio Rápido con la API
La URL base oficial sigue siendo:
https://api.deepseek.com
El ID del modelo es:
deepseek-v4-flash
DeepSeek afirma que el ID de API estable sirve automáticamente la última versión oficial de Flash.
Eso es conveniente, pero los equipos de producción deberían registrar la huella digital del modelo devuelto y probar los cambios, porque el comportamiento detrás de un ID estable puede actualizarse.
Ejemplo en Python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Revisa esta función y propón un refactor seguro.",
}
],
)
print(response.choices[0].message.content)
Ejemplo con cURL
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "Escribe una pequeña CLI en Python que valide archivos JSON."
}
]
}'
Los desarrolladores deberían consultar la referencia de API en vivo para conocer los campos exactos de esfuerzo de razonamiento y modo de pensamiento compatibles con su endpoint y versión del SDK.
El Historial de Pensamiento Debe Conservarse
La documentación del modo de pensamiento de DeepSeek dice que cuando un turno incluye llamadas a herramientas, el reasoning_content del mensaje del asistente debe pasarse de vuelta en solicitudes posteriores.
Un agente multi-turno debe conservar:
content
reasoning_content
tool_calls
Eliminar el estado de razonamiento puede reducir la continuidad o causar problemas de validación de solicitudes.
Esto es especialmente relevante al integrarse mediante un cliente compatible con OpenAI que normalmente ignora los campos de razonamiento específicos del proveedor.
Compatibilidad con OpenAI, Anthropic y Responses
DeepSeek ofrece más de una interfaz.
Chat Completions de OpenAI
Utilice la URL base estándar de DeepSeek y el ID del modelo:
deepseek-v4-flash
API compatible con Anthropic
DeepSeek también documenta una interfaz en formato Anthropic.
Esto puede ayudar a que el software creado en torno a los mensajes estilo Claude se conecte a DeepSeek con menos cambios en la aplicación.
La compatibilidad no garantiza un comportamiento idéntico.
Los campos específicos del proveedor, el historial de razonamiento, los esquemas de herramientas, el comportamiento de seguridad y el manejo de errores aún requieren pruebas.
API Responses
DeepSeek afirma que la versión 0731 es compatible de forma nativa con el formato de la API Responses y se ha adaptado para su uso estilo Codex.
Esto es importante para los productos de agentes de codificación que dependen cada vez más de objetos de respuesta con estado, llamadas a herramientas y bucles de agente estructurados.
Pesos abiertos bajo la licencia MIT
DeepSeek ha publicado los pesos de V4 Flash 0731 en Hugging Face bajo la licencia MIT.
Esto permite a los desarrolladores inspeccionar, modificar, implementar y redistribuir el modelo sujeto a los términos de la licencia.
La publicación de pesos abiertos ofrece más control que un modelo solo de API.
Los equipos pueden:
- Ejecutar el modelo en infraestructura privada.
- Estudiar su arquitectura.
- Crear variantes cuantizadas.
- Adaptar los núcleos de inferencia.
- Ajustarlo o especializarlo.
- Integrarlo en sistemas internos.
- Evitar enviar código sensible a una API de terceros.
La barrera práctica es el hardware.
"Pesos abiertos" no significa "se ejecuta en una computadora portátil normal".
Implementación con vLLM
La tarjeta oficial del modelo 0731 proporciona un ejemplo de vLLM para un solo nodo 4×GB300:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Este ejemplo demuestra la clase de infraestructura esperada para un servicio de calidad completa.
No debe interpretarse como la única configuración admitida.
La receta de vLLM puede agregar soporte para otras topologías de GPU con el tiempo.
Implementación con SGLang
El ejemplo oficial de SGLang es:
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
Los pesos objetivo y de borrador provienen del mismo punto de control, por lo que la documentación indica no configurar una ruta separada para el modelo de borrador especulativo.
Los motores de inferencia evolucionan rápidamente.
Utilice la tarjeta de modelo y la receta del motor de servicio actuales en lugar de copiar un comando de lanzamiento antiguo de la versión Preview.
La implementación local sigue siendo un proyecto de infraestructura
Aunque solo alrededor de
13B parámetros están activos para un token, los pesos completos del modelo deben permanecer disponibles en todo el sistema de servicio.
La planificación del despliegue debe considerar:
- Almacenamiento total del modelo.
- Memoria de la GPU.
- Paralelismo de expertos.
- Ancho de banda de interconexión.
- Caché KV de contexto largo.
- Soporte de cuantificación.
- Kernels de DSpark.
- Tamaño de lote.
- Concurrencia.
- Latencia de prefill.
- Rendimiento de decodificación.
Cuantificaciones más pequeñas pueden hacer posible la experimentación en diferentes hardware, pero pueden cambiar la calidad, la velocidad o la longitud de contexto admitida.
Para la mayoría de los desarrolladores individuales, la API directa o un proveedor alojado será más fácil y más barato que el autoalojamiento.
API Oficial Versus Proveedores de Terceros
Hay tres formas comunes de usar V4 Flash.
| Ruta | Ventaja principal | Compensación principal |
|---|---|---|
| API de DeepSeek | Precio oficial y modelo oficial actual | Los datos salen de tu entorno; la ID estable puede actualizarse |
| Plataforma de terceros | Cuotas gratuitas, agentes integrados, facturación más fácil | Las promociones y el enrutamiento pueden cambiar |
| Pesos autoalojados | Máximo control y privacidad | Requisitos significativos de hardware e ingeniería |
La ruta más económica depende de la carga de trabajo.
Una cuota gratuita de Cline u OpenCode puede ser la mejor para experimentación.
La API directa puede ser la mejor para uso predecible a pequeña escala.
El autoalojamiento puede volverse atractivo solo con un volumen suficientemente alto y sostenido o cuando los requisitos de privacidad dominan.
La Mejor Era para Prototipar
El artículo fuente compara la IA económica con la producción en masa de automóviles.
La analogía es imperfecta pero útil.
Cuando una tecnología se vuelve drásticamente más barata, el mercado no simplemente compra la misma cantidad por menos dinero.
Se vuelven posibles nuevos usos.
Los modelos de agentes de bajo costo pueden respaldar experimentos que previamente habrían sido rechazados antes de las pruebas.
Ejemplos incluyen:
- Un estudiante creando un primer prototipo de software.
- Un fundador individual generando y probando varias ideas de páginas de aterrizaje.
- Un pequeño equipo ejecutando revisión de código en cada solicitud de extracción.
- Un proyecto de código abierto ofreciendo triaje gratuito de problemas.
- Un investigador procesando una gran colección de código o documentos.
- Una empresa creando agentes internos para trabajo repetitivo.
- Un desarrollador de juegos probando mecánicas y niveles generados.
El valor no es que el modelo reemplace toda la ingeniería de software.
Reduce el costo de preguntar:
¿Vale la pena desarrollar esta idea más a fondo?
Un Prototipo No Es un Producto
La generación barata puede producir una primera demostración convincente.
Un producto de producción todavía necesita:
- Diseño de producto.
- Seguridad.
- Pruebas.
- Accesibilidad.
- Rendimiento.
- Monitoreo.
- Despliegue.
- Protección de datos.
- Revisión legal.
- Mantenimiento.
- Soporte al cliente.
Una factura de modelo de siete centavos no significa un negocio de siete centavos.
Significa que el primer experimento computacional puede ser lo suficientemente barato como para intentarlo.
Eso cambia quién puede participar y cuántas ideas pueden probarse.
Un Ejemplo de Espacio de Trabajo Construido por la Comunidad
El artículo fuente incluye un espacio de trabajo de documentos ligero mostrado como un ejemplo de lo que los desarrolladores estaban construyendo con agentes de codificación económicos.

Una captura de pantalla no puede establecer qué parte de la aplicación fue producida por el modelo, cuánta edición humana se requirió, ni si el producto es seguro y mantenible.
Sí muestra el tipo de proyecto que los modelos de codificación de bajo costo facilitan para crear prototipos.
Dónde encaja mejor V4 Flash
V4 Flash 0731 es especialmente atractivo cuando:
- La tarea depende en gran medida de código o herramientas.
- El costo es un factor importante.
- Un contexto amplio resulta útil.
- Se espera un alto volumen de solicitudes.
- El flujo de trabajo puede validar los resultados.
- Los reintentos ocasionales son aceptables.
- Se dispone de un modelo alternativo más grande para casos difíciles.
Puede ser menos adecuado cuando:
- La precisión factual en el mundo abierto es crítica.
- Una primera respuesta pulida importa más que el costo.
- La tarea requiere comprensión de imágenes.
- La organización no puede validar el código generado.
- Se requiere una garantía de cumplimiento gestionada.
- El flujo de trabajo depende de un comportamiento de API estable y con versión fija.
Un enrutador de modelos puede combinar Flash con un sistema más potente o más especializado.
Por ejemplo:
Ediciones rutinarias de repositorio
→ V4 Flash
Decisiones de arquitectura o seguridad de alto riesgo
→ modelo más potente + revisión humana
Los modelos baratos cambian la arquitectura de los agentes
Cuando las llamadas a modelos son caras, los desarrolladores intentan minimizar cada solicitud.
Cuando las llamadas se vuelven baratas, un agente puede permitirse:
- Pedir a otro modelo que revise el parche.
- Ejecutar una pasada separada de análisis de pruebas.
- Generar varias soluciones candidatas.
- Comparar implementaciones alternativas.
- Usar un modelo para la planificación y otro para la ejecución.
- Revisar su propio trabajo antes de la entrega.
Esto puede aumentar la fiabilidad.
También puede desperdiciar tokens.
El objetivo correcto no es el uso mínimo de tokens.
Es:
El costo total más bajo que alcanza la calidad requerida
Los principales riesgos detrás de la historia del precio
1. La versión beta pública puede cambiar
DeepSeek describe la API oficial de Flash como una beta pública.
Los precios, el comportamiento, los límites y las versiones del modelo pueden cambiar.
Los equipos de producción deben mantener pruebas de regresión.
2. Las puntuaciones de referencia dependen del harness de DeepSeek
Los resultados más sólidos del agente de código utilizan una configuración de harness no publicada.
La reproducción independiente exacta aún no es sencilla.
3. Una entrada barata no garantiza un agente barato
La salida, los reintentos, las herramientas y el contexto no almacenado en caché pueden dominar el costo final.
4. El contexto largo no es gratuito
Una ventana de 1 millón de tokens es un límite de capacidad, no una recomendación para enviar un millón de tokens en cada solicitud.
Las cargas de trabajo grandes de prefill aumentan la latencia y el costo.
5. La fiabilidad en el mundo abierto aún necesita trabajo
La evaluación independiente muestra que el valor y la capacidad de codificación pueden coexistir con una alta tasa de alucinaciones en pruebas fácticas.
Los datos críticos deben verificarse contra las fuentes.
6. El código generado requiere revisión
Los modelos de bajo costo pueden generar más código del que un equipo puede inspeccionar de forma segura.
Las pruebas automatizadas, el análisis estático, el escaneo de dependencias y la revisión humana siguen siendo necesarios.
7. El acceso promocional es temporal
Los modelos gratuitos de terceros y los descuentos pueden desaparecer.
No construyas un modelo de negocio permanente basado en un subsidio de siete días o de tiempo limitado.
8. Los IDs de API estables pueden ocultar actualizaciones
El ID del modelo deepseek-v4-flash apunta a la versión actual.
Una actualización detrás de ese ID puede cambiar los resultados sin que haya un cambio de código en tu aplicación.
Lista práctica de control de costos
1. Estabiliza los prefijos reutilizables
Mantén las instrucciones del sistema y las definiciones de herramientas consistentes para mejorar la reutilización de la caché.
2. Realiza un seguimiento separado de los tokens de acierto de caché
No te bases únicamente en el total de tokens de entrada.
3. Limita la salida innecesaria
Establece un presupuesto de salida realista para la tarea.
4. Usa un menor esfuerzo de razonamiento para tareas rutinarias
Reserva max para tareas que se beneficien de una deliberación más larga.
5. Limita los pasos del agente
Detén los bucles que no están progresando.
6. Ejecuta validaciones económicas antes de otra llamada al modelo
Usa linters, pruebas, validadores de esquemas y comprobaciones deterministas.
7. Enruta los casos difíciles
Escala solo cuando la tarea falle una prueba o supere un umbral de riesgo.
8. Mide el costo por resultado aceptado
Incluye los intentos fallidos y la revisión humana.
Una cosa más: DeepSeek Harness
El artículo original termina con un posible siguiente paso en el ecosistema de desarrolladores de DeepSeek.
Tianyi Cui, identificado en la fuente como el responsable de DeepSeek Harness, publicó un mensaje de reclutamiento para desarrolladores de proyectos de código abierto de agent-harness.
El mensaje invitaba a los desarrolladores interesados a compartir una cuenta de GitHub y trabajo de código abierto representativo para participar en pruebas internas.

El registro de cambios del 31 de julio de DeepSeek también dice que el modo mínimo de DeepSeek Harness utilizado para la evaluación de benchmarks "se lanzará pronto".
Al momento de la verificación, no pude localizar:
- Un repositorio público oficial de DeepSeek Harness.
- Una página de producto estable para "DeepSeek Code".
- Instrucciones públicas de instalación.
- Precios.
- Una fecha de lanzamiento.
- Una especificación completa de funciones.
La evidencia respalda esta conclusión más acotada:
DeepSeek está probando un agent harness y tiene la intención de lanzar al menos parte del marco, pero el nombre final del producto, el alcance público y el momento del lanzamiento siguen sin confirmarse.
El modelo, la API y los pesos abiertos están disponibles ahora.
El harness sigue siendo un componente futuro del ecosistema.
Por qué DeepSeek Harness podría ser importante
Un harness de primera parte podría ayudar a DeepSeek a controlar toda la pila del agente de codificación.
Podría proporcionar:
- Manejo nativo del historial de razonamiento.
- Formatos de prompt específicos del modelo.
- Análisis de llamadas a herramientas.
- Gestión de contexto.
- Búsqueda en el repositorio.
- Ejecución en terminal.
- Reproducibilidad de benchmarks.
- Integración con la API de respuestas.
- Flujos de trabajo compatibles con Codex.
- Controles de costos.
- Enrutamiento automático entre Flash y Pro.
DeepSeek ya documenta integraciones con harnesses externos y agentes de codificación.
Una herramienta de primera parte podría convertir optimizaciones específicas de benchmarks en un producto que los desarrolladores ordinarios puedan usar.
También podría revelar cuánto del salto en benchmarks de V4 Flash 0731 proviene del checkpoint y cuánto del runtime del agente.
Qué Observar a Continuación
Varios desarrollos determinarán si el momento V4 Flash se convierte en un cambio duradero del ecosistema.
Lanzamiento Oficial de V4 Pro
DeepSeek dice que el lanzamiento oficial de V4 Pro seguirá a la actualización de Flash.
La brecha de rendimiento y precio entre Pro y Flash afectará las decisiones de enrutamiento.
Disponibilidad de DeepSeek Harness
Un lanzamiento público mejoraría la reproducibilidad de los benchmarks y daría a los desarrolladores un framework de agentes nativo del modelo.
Estabilidad de Precios
El precio directo ya es bajo, pero las promociones de terceros podrían no mantenerse.
Capacidad del Proveedor
La inferencia barata atrae tráfico muy alto.
La latencia, los límites de velocidad y la fiabilidad importarán a medida que el uso escale.
Soporte de Inferencia de Código Abierto
vLLM, SGLang, los proveedores de hardware y los proyectos de cuantización determinarán qué tan accesible se vuelve el autoalojamiento.
Evaluaciones Independientes
Más evaluaciones públicas deberían probar:
- Codificación.
- Seguridad.
- Fiabilidad factual.
- Contexto largo.
- Uso de herramientas.
- Costo por tarea exitosa.
- Rendimiento bajo diferentes harnesses.
Preguntas Frecuentes
¿Qué es DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 es el lanzamiento oficial del 31 de julio de V4 Flash, actualmente servido a través de la API deepseek-v4-flash en beta pública. DeepSeek dice que mantiene la arquitectura base y el tamaño del modelo Preview mientras mejora sustancialmente las capacidades de agente mediante nuevo post-entrenamiento.
¿Cuánto cuesta DeepSeek V4 Flash?
La API oficial de DeepSeek lista $0.14 por millón de tokens de entrada sin caché, $0.0028 por millón de tokens de entrada con caché y $0.28 por millón de tokens de salida. Las plataformas de terceros pueden ofrecer precios diferentes, cuotas gratuitas o descuentos temporales.
¿Un juego 3D realmente cuesta solo RMB 0.07 para generar?
El artículo fuente cita un ejemplo comunitario con ese costo de modelo reportado. El ejemplo no está acompañado de prompts completos, registros de tokens, datos de caché, reintentos, costos de herramientas o registros de trabajo humano, por lo que debe tratarse como una anécdota más que como un presupuesto garantizado.
¿Cuáles son los principales puntajes de benchmark de V4 Flash 0731?
DeepSeek reporta 82.7 en Terminal Bench 2.1, 76.7 en CyberGym, 54.4 en DeepSWE, 70.3 en Toolathlon-Verified y 54.2 en NL2Repo. Las evaluaciones públicas de agentes de código usaron el modo mínimo no lanzado de DeepSeek Harness con máximo esfuerzo de razonamiento.
¿DeepSeek V4 Flash 0731 es de código abierto?
Los pesos del modelo y el repositorio se lanzan bajo la Licencia MIT, por lo que "pesos abiertos" y uso ampliamente permisivo son descripciones precisas. Ejecutar el checkpoint completo aún requiere infraestructura sustancial de múltiples GPU.
¿Puede DeepSeek V4 Flash ejecutarse localmente?
Sí, DeepSeek publica pesos e instrucciones de servicio para vLLM y SGLang. Los ejemplos oficiales a escala completa usan hardware avanzado de múltiples GPU, por lo que una laptop normal no es el entorno objetivo para el modelo completo.
¿Cuál es la ventana de contexto?
La API oficial y la tarjeta del modelo especifican una ventana de contexto de 1 millón de tokens. La API también lista un
longitud máxima de salida de 384K tokens, pero usar el contexto o la salida máximos puede aumentar significativamente la latencia y el uso de recursos.
¿Se han lanzado DeepSeek Code o DeepSeek Harness?
DeepSeek ha hecho referencia pública a un modo mínimo de Harness y ha reclutado desarrolladores de harness de código abierto para pruebas internas. Durante la verificación no se localizó un repositorio público completo, una especificación final del producto ni una fecha de lanzamiento confirmada.
Herramientas relacionadas
- API de DeepSeek: La plataforma oficial para claves de API, facturación y acceso directo a los modelos de DeepSeek.
- DeepSeek V4 Flash 0731 en Hugging Face: Punto de control oficial de pesos abiertos, tarjeta del modelo, tabla de benchmarks, licencia e instrucciones de implementación.
- vLLM: Un motor de servicio de alto rendimiento de código abierto con soporte para DeepSeek V4 y DSpark.
- SGLang: Un framework de servicio de código abierto con una ruta de implementación publicada para V4 Flash 0731.
- OpenCode: Un agente de codificación de código abierto cuyo servicio Zen ofrece actualmente una opción gratuita por tiempo limitado de V4 Flash.
- Cline: Un agente de codificación y plataforma de modelos de código abierto que ofrece DeepSeek V4 Flash a través de su ecosistema de proveedores.
- Nous Portal: Una plataforma de inferencia multimodelo que realizó una promoción limitada de DeepSeek V4 Flash.
- Artificial Analysis: Una plataforma independiente de análisis de modelos que cubre inteligencia, velocidad, precio y costo de benchmarks.
Enlaces relacionados
- Registro de cambios del 31 de julio de DeepSeek: Estado oficial del lanzamiento, resultados de benchmarks, notas de metodología, alcance de la API y declaración de post-entrenamiento.
- Modelos y precios de DeepSeek: Precios oficiales actuales, longitud de contexto, límite de salida, funciones y concurrencia.
- Tarjeta del modelo DeepSeek V4 Flash 0731: Notas de arquitectura, comparación de benchmarks, niveles de esfuerzo de razonamiento, configuración de DSpark y licencia MIT.
- Tarjeta técnica del modelo DeepSeek V4: Arquitectura original de V4, cantidades de parámetros, informe técnico y evaluación de la familia de modelos.
- Guía del modo de pensamiento de DeepSeek: Guía oficial para la salida de razonamiento y la preservación de
reasoning_contententre llamadas de herramientas. - Integraciones de agentes de DeepSeek: Ejemplo oficial para conectar V4 Flash a un harness de codificación de terminal.
- Modelos de OpenCode Zen: Catálogo de modelos actual e información sobre modelos gratuitos por tiempo limitado.
- Evaluación de Artificial Analysis de V4 Flash 0731: Puntuación compuesta independiente, precio, evaluación de agentes y observaciones de fiabilidad.
Resumen
DeepSeek V4 Flash 0731 mantiene la base del modelo Preview
La arquitectura y el tamaño son similares, pero utiliza un nuevo post-entrenamiento que produce un gran salto en el rendimiento de agentes de codificación. DeepSeek reporta 82.7 en Terminal Bench 2.1, 76.7 en CyberGym y 54.4 en DeepSWE, aunque los resultados públicos más sólidos de agentes de código dependen de una configuración no publicada de DeepSeek Harness.
El precio oficial de la API es inusualmente bajo: $0.14 por millón de tokens de entrada no almacenados en caché, $0.0028 por millón de tokens de entrada en caché y $0.28 por millón de tokens de salida. Las cuotas gratuitas y descuentos de terceros pueden hacer que el acceso sea aún más barato, pero esas promociones son temporales y no deben confundirse con el precio de lista permanente.
El lanzamiento de pesos abiertos bajo licencia MIT, el contexto de 1 millón de tokens, las APIs compatibles con Responses y Anthropic, y el soporte en vLLM y SGLang hacen que el modelo sea accesible tanto en rutas alojadas como autogestionadas. La implementación local completa sigue siendo un proyecto serio de infraestructura multi-GPU.
Los prototipos virales de siete y cincuenta centavos son ejemplos plausibles de lo bajo que puede llegar a ser el costo marginal del modelo, pero no son estudios completos del costo del producto. Los bucles de agentes, la longitud de salida, las fallas de caché, las herramientas, las pruebas y el trabajo humano siguen siendo importantes.
DeepSeek V4 Flash 0731 es importante no porque cada aplicación ahora cueste unos centavos, sino porque la codificación agéntica capaz se ha vuelto lo suficientemente barata como para que muchos más desarrolladores experimenten a una escala significativa.