DeepSeek V4 Flash crea un juego de disparos en 3D por 0,07 dólares: así de barato es este modelo
DeepSeek V4 Flash 0731 entra en versión beta pública y trae consigo una promesa conocida: capacidades mejoradas de codificación y agente a precios de API extremadamente bajos. Los desarrolladores no tardaron en poner a prueba esta afirmación.

DeepSeek V4 Flash construyó un juego de disparos en 3D por solo $0.07 — ¿Por qué este modelo es tan barato?
Introducción
DeepSeek V4 Flash 0731 ha entrado en versión beta pública con una promesa familiar: mayores capacidades de codificación y agentes a un precio de API extremadamente bajo.
Los desarrolladores rápidamente pusieron a prueba esta afirmación con experimentos reales.
Uno de los casos más difundidos proviene de una ejecución de Hermes Agent, en la que DeepSeek V4 Flash generó un juego de disparos en primera persona en 3D jugable con una sola indicación inicial. Según los informes, el proyecto tomó 32 minutos y el costo de uso del modelo fue de solo $0.07 USD.
El resultado final incluyó:
- Movimiento en primera persona.
- Salto.
- Disparos.
- Colisión física con el entorno.
- Objetos de cobertura y objetivos.
- Contador de munición en la interfaz.

CSA y HCA reducen el costo del contexto largo
DeepSeek V4 admite una ventana de contexto de 1 millón de tokens.
Los sistemas de atención tradicionales se vuelven extremadamente costosos a esta escala, porque cada token nuevo puede necesitar revisar una gran cantidad de contexto previo y mantener una caché KV grande.
El informe técnico de DeepSeek describe un diseño de atención híbrida que combina:
- Atención dispersa comprimida (CSA)
- Atención de compresión intensa (HCA)
La estrategia general es evitar realizar un cálculo de atención completo y costoso sobre todo el historial en cada paso.
El sistema comprime y filtra el contexto, permitiendo que el modelo enfoque la computación en la información más útil.
DeepSeek informa que, en un entorno de contexto de 1 millón de tokens, V4 Pro requiere:
El 27% de los FLOPs de inferencia por token de DeepSeek V3.2.
- El 10% de la capacidad de caché KV.
Estos porcentajes exactos son los reportados para V4 Pro en el artículo técnico, no son datos de auditoría independientes para Flash.
V4 Flash utiliza la misma familia de arquitectura, por lo que se beneficia de los mismos principios de diseño para contextos largos.
Los efectos reales incluyen la reducción de:
- Memoria de caché KV.
- Presión sobre la memoria de la GPU.
- Volumen de movimiento de datos.
- Cómputo por token.
- Costo de servicio de contextos largos.
FP4 y FP8 reducen el almacenamiento
y el tráfico de memoria
El modelo V4 Flash publicado utiliza pesos de precisión mixta baja.
DeepSeek enumera:
Precisión mixta FP4 + FP8
La menor precisión reduce la cantidad de datos que deben almacenarse, cargarse desde la memoria, transferirse entre dispositivos y procesarse durante la inferencia.
Esto es importante porque la inferencia de los modelos de lenguaje modernos suele estar limitada por el ancho de banda de la memoria, no solo por la capacidad aritmética bruta.
Si el hardware y el kernel están diseñados para ejecutar esta formato de manera eficiente, las representaciones de datos más pequeñas pueden aumentar el rendimiento.
La baja precisión no es gratuita por naturaleza.
Una cuantización deficiente degrada la calidad del modelo.
El lanzamiento de DeepSeek fue diseñado y entrenado alrededor del esquema de precisión elegido, y no depende únicamente de una cuantización comunitaria posterior.
La arquitectura no cambió entre la vista previa y la versión 0731
DeepSeek afirmó que la versión oficial 0731 mantiene la misma arquitectura y escala de modelo que la vista previa de V4 Flash.
La empresa no realizó un preentrenamiento completo nuevamente para esta actualización.
En su lugar, rehizo el proceso de post-entrenamiento.
El artículo fuente resume los cambios como:
- Nuevo ajuste fino supervisado.
- Nuevo aprendizaje por refuerzo GRPO.
- Decodificación especulativa DSpark.
- Mejor comportamiento de agentes.
- Mayor rendimiento de servicio.
El informe técnico de DeepSeek describe el proceso de post-entrenamiento más amplio de V4 de la siguiente manera:
- Desarrollo independiente de módulos expertos por dominio.
- Ajuste fino supervisado y aprendizaje por refuerzo con GRPO.
- Destilación de políticas en línea.
- Integración de capacidades de expertos en un único modelo.
La actualización 0731 se centra en mejorar cómo estas capacidades se desempeñan en flujos de trabajo de agentes reales.
DSpark acelera la generación de tokens
DeepSeek-V4-Flash-0731 incluye un módulo de decodificación especulativa DSpark.
La decodificación especulativa utiliza una ruta de borrador más pequeña o más económica para proponer múltiples tokens futuros.
El modelo principal valida estas propuestas en lote.
El flujo simplificado es el siguiente:
El módulo borrador propone tokens
→ El modelo principal valida simultáneamente
→ Los tokens aceptados se emiten
→ Las rutas rechazadas se corrigen
Cuando las predicciones del borrador son precisas, el sistema puede generar múltiples tokens aceptados con menos razonamiento secuencial costoso del modelo principal.
DeepSeek ofrece soporte DSpark tanto para vLLM como para SGLang.
Para vLLM, la tarjeta oficial del modelo utiliza:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Para SGLang, la opción correspondiente es:
--speculative-algorithm DSPARK
DeepSeek indica que los pesos del modelo objetivo y del modelo borrador están almacenados en el mismo punto de control, por lo que SGLang no requiere una ruta separada para el modelo borrador.
La decodificación especulativa mejora principalmente la velocidad de servicio y el rendimiento.
Por sí misma no explica la mejora en las capacidades de razonamiento del modelo.
Esas mejoras provienen del proceso de post-entrenamiento actualizado.
El lanzamiento oficial muestra mejoras en los benchmarks de agentes
DeepSeek reportó mejoras significativas en varias pruebas centradas en agentes en comparación con la vista previa de V4 Flash.
| Benchmark | V4 Flash 0731 | V4 Flash Vista Previa | V4 Pro Vista Previa |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 |
12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

DeepSeek afirmó que los benchmarks públicos de agentes de código se ejecutaron con la siguiente configuración:
Modo mínimo de DeepSeek Harness
reasoning_effort = max
top_p = 0.95
temperature = 1.0
Hasta la fecha de la actualización oficial, este marco de pruebas no se había publicado públicamente.
DSBench-FullStack y DSBench-Hard son benchmarks internos de DeepSeek.
Esto significa que sus puntuaciones pueden servir como evidencia de referencia según lo reportado por la empresa, pero no pueden verificarse de forma independiente como una suite de benchmarks completamente pública.
Qué miden Terminal Bench y Toolathlon
Terminal Bench 2.1
Terminal Bench evalúa la capacidad de un agente para completar tareas en un entorno de terminal.
El modelo puede necesitar inspeccionar archivos, ejecutar comandos, instalar dependencias, depurar fallos, modificar código y verificar la finalización.
Una puntuación alta refleja el desempeño combinado del modelo, el marco del agente, la estrategia de herramientas, el presupuesto de razonamiento y el entorno de ejecución.
Toolathlon-Verified
Toolathlon evalúa tareas de ciclo largo a través de múltiples aplicaciones de software y herramientas.
El benchmark incluye escenarios que involucran calendarios, sistemas de archivos, Notion, WooCommerce, Kubernetes y BigQuery.
Las tareas requieren múltiples interacciones con herramientas y se verifican mediante evaluadores basados en ejecución.
La puntuación de 70.3 reportada por DeepSeek es una gran mejora con respecto al modelo de vista previa.
Pero esto no debe interpretarse como una garantía de éxito del 70.3% en cada automatización de negocio real.
Las mejoras en benchmarks no garantizan el éxito de un juego con un solo prompt
Los ejemplos de juegos en la fuente revelan una diferencia importante entre el rendimiento en benchmarks y la codificación creativa.
V4 Flash se desempeña fuertemente en las evaluaciones oficiales de agentes, pero una comparación de juegos aún requirió tres iteraciones.
Los benchmarks pueden medir la tasa de éxito en un conjunto de tareas bien definidas y con reglas de evaluación conocidas.
Los proyectos creativos pueden incluir requisitos visuales ambiguos, problemas de compatibilidad del navegador, errores del motor de física, recursos faltantes, juicios de calidad subjetivos y ningún conjunto de pruebas único que defina el éxito.
En este escenario, los modelos de bajo costo son especialmente útiles porque el flujo de trabajo puede tolerar múltiples iteraciones.
Su valor no radica necesariamente en que la primera generación sea perfecta.
Podría ser:
Calidad aceptable
×
Gran cantidad de intentos asequibles
V4 Flash admite múltiples formatos de API
DeepSeek abre sus modelos mediante:
- Interfaz de Chat Completions compatible con OpenAI.
- API de Responses compatible con OpenAI.
- API compatible con Anthropic.
- Salida JSON.
- Llamada a herramientas.
- Relleno de prefijo de chat.
- Relleno de mitad de secuencia en modo sin razonamiento.
La URL base compatible con OpenAI es:
https://api.deepseek.com
La URL base compatible con Anthropic es:
https://api.deepseek.com/anthropic
DeepSeek afirma que V4 Flash es actualmente el único modelo de la API V4 compatible con la API de Responses.
El soporte para V4 Pro se planificará por separado.
La compatibilidad con la API de Responses también permite que el modelo se utilice en Codex mediante la configuración documentada de DeepSeek.
El modo de razonamiento está habilitado por defecto
DeepSeek V4 Flash admite modos de razonamiento y sin razonamiento.
El modo de razonamiento es el modo predeterminado.
Para la inferencia local, la tarjeta oficial del modelo admite tres niveles de esfuerzo de razonamiento:
bajo
alto
máximo
DeepSeek recomienda:
temperatura = 1.0
top_p = 0.95
para escenarios de agentes.
Para los niveles de esfuerzo de razonamiento alto y máximo, la compañía sugiere permitir una longitud máxima de salida de hasta 384K tokens.
Una configuración de razonamiento más alta puede mejorar el rendimiento en tareas difíciles, pero también puede aumentar la latencia, el volumen de salida, el costo de la API y el tiempo del bucle del agente.
Los sistemas de producción deben evaluar el nivel de esfuerzo más bajo que pueda satisfacer de manera confiable los requisitos de la tarea.
Los pesos se publican bajo la licencia MIT
DeepSeek publicó los pesos de V4 Flash 0731 en Hugging Face bajo la licencia MIT.
Esto hace que el modelo tenga una licencia inusualmente permisiva en comparación con muchos lanzamientos comerciales importantes.
Los desarrolladores pueden usar el repositorio oficial del modelo con motores compatibles, incluidos:
- vLLM.
- SGLang.
- Transformers.
- Docker Model Runner.
- Versiones cuantizadas compatibles con llama.cpp.
- Versiones comunitarias compatibles con LM Studio.
Este modelo es de gran tamaño.
El modelo central tiene 284 mil millones de parámetros, y el checkpoint 0731 incluye además un componente DSpark.
Ejecutarlo a una velocidad útil requiere grandes cantidades de memoria y recursos de hardware.
Que los pesos se puedan descargar no significa que el modelo completo pueda ejecutarse sin problemas en una computadora portátil de consumo común.
Las versiones cuantizadas de la comunidad pueden reducir los requisitos de memoria, pero pueden alterar la precisión, el rendimiento, la capacidad de contexto, el comportamiento de DSpark y la confiabilidad de la llamada a herramientas.
¿Es V4 Flash siempre la opción más rentable?
Las fuentes concluyen que V4 Flash no siempre produce los mejores resultados en cada comparación, pero es difícil de superar en términos de relación calidad-precio.
Este es un resumen razonable de los ejemplos, pero con una advertencia importante:
La rentabilidad depende del flujo de trabajo completo.
V4 Flash es especialmente atractivo cuando:
- El volumen de solicitudes es alto.
- Los errores son fáciles de detectar.
- Las tareas pueden reintentarse automáticamente.
- El almacenamiento en caché de contexto funciona bien.
- El costo de revisión humana es bajo.
- Un código compacto es aceptable.
- La aplicación puede usar modelos de pesos abiertos.
En los siguientes casos, los modelos frontera más caros pueden seguir siendo más económicos en general:
- Un resultado fallido causa una pérdida significativa.
- La confiabilidad del primer intento es crucial.
- La tarea requiere conocimiento más profundo.
- El agente no puede reintentar de manera segura.
- El costo de revisión humana es alto.
- Los modelos más pequeños producen resultados difíciles de mantener.
La comparación correcta no es:
precio por token
sino:
costo por tarea exitosa verificada
Cómo evaluar V4 Flash para proyectos reales
Paso 1: Elegir tareas representativas
No pruebe solo demostraciones pulidas.
Use tareas que coincidan con la carga de trabajo de producción, incluidos escenarios difíciles y complejos.
Paso 2: Fijar el entorno del agente
Mantenga la coherencia en indicaciones, herramientas, límites de tiempo, estrategias de reintento, marcos de trabajo, sandboxes, conjuntos de pruebas y configuración de razonamiento entre diferentes modelos.
Paso 3: Registrar los costos completos
Realice un seguimiento de entradas sin acierto de caché, entradas con acierto de caché, tokens de salida, llamadas a herramientas, reintentos, tiempo de ejecución, revisión humana e intentos fallidos.
Paso 4: Medir la aceptabilidad, no solo la similitud visual
Para código, ejecute pruebas y verifique la mantenibilidad.
Para juegos, verifique controles, colisiones, rendimiento y compatibilidad con el navegador.
Paso 5: Probar el comportamiento de caché
Cuando un contexto estable se reutiliza repetidamente en múltiples pasos de un agente, los modelos con precios de acierto de caché extremadamente bajos se vuelven más valiosos.
Paso 6: Comparar el primer intento con el éxito final
Un modelo que logra el éxito después de tres intentos económicos puede ser más rentable que uno que tiene éxito a la primera con un precio alto.
Cuando los reintentos son lentos o riesgosos, la situación también puede ser la contraria.
Preguntas frecuentes
¿Qué es DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 es la versión oficial post-entrenamiento del modelo V4 de mezcla de expertos de menor escala de DeepSeek. Reemplaza la versión preliminar, añade el módulo de decodificación especulativa DSpark y se centra principalmente en tareas de agentes de codificación y uso de herramientas.
¿Cuánto cuesta la API de DeepSeek V4 Flash?
Los precios regulares actuales publicados por DeepSeek son: 0,0028 USD por millón de tokens de entrada con acierto de caché, 0,14 USD por millón de tokens de entrada sin acierto de caché y 0,28 USD por millón de tokens de salida. La compañía ha anunciado que las políticas futuras duplicarán los precios durante las horas pico especificadas.
¿DeepSeek V4 Flash realmente creó un juego 3D por 0,07 USD?
Un desarrollador informó que una ejecución de Hermes Agent generó un shooter en primera persona jugable en 32 minutos con un costo de 0,07 USD. Esto es un estudio de caso en redes sociales, no una prueba de referencia estandarizada, por lo que los costos de otras tareas pueden ser mayores o menores.
¿Cuántos parámetros tiene DeepSeek V4 Flash?
El informe técnico de V4 enumera un total de 284 mil millones de parámetros para el modelo Flash central, con 13 mil millones de parámetros activados por token. El repositorio completo de la versión 0731 puede mostrar alrededor de 304 mil millones de parámetros porque incluye el componente de decodificación especulativa DSpark asociado.
¿Por qué DeepSeek V4 Flash es tan barato?
Su bajo costo proviene de la activación dispersa de mezcla de expertos, atención de contexto largo comprimido, precisión mixta FP4/FP8, caché de indicaciones, decodificación especulativa y servicio de alta concurrencia. Cada token activa solo una pequeña parte de los expertos totales.
¿Es DeepSeek V4 Flash mejor que Claude Opus 5 o GPT-5.6?
Con los precios de API actuales, es mucho más barato y ha mostrado un rendimiento competitivo en varias demostraciones comunitarias. Opus 5 y GPT-5.6 pueden seguir ofreciendo una mayor confiabilidad o calidad en el primer intento en algunas tareas, y esas comparaciones virales no son pruebas de referencia controladas.
¿Se puede ejecutar DeepSeek V4 Flash localmente?
Sí. DeepSeek publicó los pesos bajo la licencia MIT y proporciona guías de uso para vLLM y SGLang. El modelo completo es extremadamente grande, por lo que el despliegue local real requiere una gran cantidad de memoria de aceleradores o esquemas de cuantización comunitaria agresivos.
¿V4 Flash admite Codex y la API de Responses?
Sí. DeepSeek afirma que la versión Flash oficial admite nativamente la API de Responses y está adaptada para su uso en Codex. La API actual de V4 Pro aún no admite la API de Responses.
Herramientas relacionadas
- API de DeepSeek: punto final oficial alojado para DeepSeek V4 Flash y otros modelos compatibles.
- [DeepSeek V4 Flash
0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731): repositorio oficial del modelo, que contiene pesos, puntos de referencia, licencia y guía de implementación.
- vLLM: un motor de inferencia de alto rendimiento que ofrece recetas oficiales para V4 Flash y DSpark.
- SGLang: un marco de servicio para LLM con soporte documentado integrado para V4 Flash y DSpark.
- DeepSpec: el repositorio de DeepSeek para la investigación de decodificación especulativa y el método DSpark.
- Codex: un entorno de codificación inteligente que puede conectarse a V4 Flash a través de la interfaz compatible con la API de Respuestas de DeepSeek.
Enlaces relacionados
- Actualización oficial de DeepSeek V4 Flash: registro de cambios del 31 de julio, que incluye estado oficial de lanzamiento, puntos de referencia y alcance de la API.
- Modelos y precios de la API de DeepSeek: precios actuales por token, longitud de contexto, límites de salida, concurrencia y aviso de precios pico futuros.
- Informe técnico de DeepSeek V4: artículo principal que describe la arquitectura MoE, la atención CSA/HCA, la precisión, el entrenamiento y el contexto de un millón de tokens.
- Ficha del modelo DeepSeek V4 Flash: tabla oficial de puntos de referencia 0731, codificación de chat, configuración de DSpark y licencia MIT.
- Integración con DeepSeek Codex: guía oficial para usar V4 Flash con Codex y la API de Respuestas.
- Artículo de Toolathlon: artículo de investigación que describe el punto de referencia de múltiples herramientas de largo alcance utilizado en la evaluación oficial.
- Receta vLLM para V4 Flash: guía de hardware y servicio para la implementación de V4 Flash.
Resumen
DeepSeek V4 Flash 0731 ha generado gran atención porque los desarrolladores informan que pueden crear demostraciones interactivas completas por solo unos centavos. Se informa que un juego de disparos en primera persona costó solo 0,07 dólares, y otras comparaciones en redes sociales muestran costos de tareas decenas de veces menores que Claude Opus 5 o GPT-5.6.
Estos ejemplos no son puntos de referencia controlados, pero los precios oficiales de la API respaldan su idea central. V4 Flash cobra 0,14 dólares por millón de tokens de entrada no almacenados en caché, 0,28 dólares por millón de tokens de salida, y la tasa de aciertos de caché es sorprendentemente baja, de solo 0,0028 dólares.
Su economía proviene de todo el sistema: un núcleo MoE de 284B con 13B de parámetros activados por token, atención de contexto largo comprimida, pesos FP4/FP8, ventana de contexto de un millón de tokens, capacidad de servicio eficiente y decodificación especulativa DSpark. La actualización 0731 conserva la arquitectura de vista previa y mejora el comportamiento de los agentes mediante nuevo post-entrenamiento.
La evidencia oficial más sólida es la mejora en los puntos de referencia. Terminal Bench 2.1 subió de 61,8 a 82,7, y Toolathlon-Verified de 49,7 a 70,3, mientras que el modelo mantiene el nivel de precios Flash.
La ventaja de V4 Flash no es que gane en todas las comparaciones, sino que su costo marginal extremadamente bajo hace que
sea factible en la práctica realizar experimentos con agentes de forma repetida a una escala que muchos modelos con precios de vanguardia difícilmente pueden permitir.