DeepSeek V4 Pro ocupa el segundo lugar en el benchmark de programación terminal SuperCLUE, con un costo de solo una fracción del de Kimi K3

DeepSeek-V4-Pro-0813 ocupa el segundo lugar en el último benchmark SuperCLUE-Terminal de programación para terminales inteligentes en chino, con una puntuación de 51.52, solo superado por Kimi K3.

发布于 2026年8月14日generalGEO 评分: 04 次阅读
DeepSeek V4 Pro ocupa el segundo lugar en el benchmark de programación terminal SuperCLUE, con un costo de solo una fracción del de Kimi K3

DeepSeek V4 Pro obtiene el segundo puesto en la prueba de referencia de programación de terminal SuperCLUE con una fracción del costo de Kimi K3

Introducción

DeepSeek-V4-Pro-0813 obtuvo el segundo puesto en la más reciente prueba de referencia de programación de terminal de agente inteligente en chino SuperCLUE-Terminal, con una puntuación de 51.52 puntos. Solo queda detrás de Kimi K3, que lidera la clasificación con 60.61 puntos.

Lo que hace especialmente notable este resultado es su ventaja en costos. Durante la ejecución de la prueba de referencia, DeepSeek-V4-Pro-0813 gastó en promedio aproximadamente 1.42 RMB por tarea, demostrando una sólida relación calidad-precio entre los modelos de alta puntuación.

SuperCLUE-Terminal está diseñado en torno a tareas de programación reales de desarrolladores chinos. El modelo se evalúa a través de un marco de agente general basado en Claude Code, lo que permite que la prueba compare el desempeño de los modelos en la comprensión de requisitos en chino, la planificación de trabajos de múltiples pasos, el uso de herramientas, la depuración de problemas y la modificación de código a través de flujos de trabajo de extremo a extremo.

DeepSeek V4 Pro ocupa el segundo lugar en la evaluación de programación más reciente

La prueba está diseñada para reflejar trabajos de desarrollo reales, no problemas de programación breves y aislados. Según los resultados publicados, una sola tarea puede requerir aproximadamente 50 a 110 rondas de interacción, y una ejecución completa de una tarea puede tomar aproximadamente 30 a 90 minutos.

En la clasificación actual, Kimi K3 mantiene el primer lugar con 60.61 puntos. DeepSeek-V4-Pro-0813 le sigue de cerca con 51.52 puntos, por delante de GLM-5.2 con 48.48 puntos y de la versión anterior DeepSeek-V4-Flash-0731 con 46.46 puntos.

Modelo Puntuación SuperCLUE-Terminal Costo promedio reportado por tarea
Kimi K3 (máximo) 60.61 19.63 RMB
DeepSeek-V4-Pro-0813 (máximo) 51.52 1.42 RMB
GLM-5.2 (máximo) 48.48 23.30 RMB
DeepSeek-V4-Flash-0731 (máximo) 46.46 0.64 RMB

Los datos anteriores provienen del entorno de la prueba de referencia SuperCLUE-Terminal y deben entenderse como costos de ejecución de la prueba de referencia, no como precios fijos por tarea del proveedor del modelo.

DeepSeek ha confirmado por separado que el modelo API de producción deepseek-v4-pro ahora apunta a DeepSeek-V4-Pro-0813. Este modelo está disponible a través de la aplicación web, la aplicación móvil y la API de DeepSeek.

Solo 1.42 RMB por tarea: una ventaja de costos destacada

La parte más llamativa de este resultado es el costo reportado de DeepSeek-V4-Pro-0813.

En la prueba de referencia, su costo promedio fue de aproximadamente 1.42 RMB por tarea, lo que en la misma comparación de SuperCLUE equivale aproximadamente a una catorceava parte del costo de Kimi K3 (19.63 RMB) y alrededor de una dieciseisava parte del de GLM-5.2 (23.30 RMB).

Esta diferencia es importante porque las brechas de puntuación entre modelos de programación de alto rendimiento pueden ser relativamente pequeñas, mientras que los costos de ejecutar tareas de agente de larga duración pueden variar enormemente. Para pequeñas empresas, desarrolladores independientes y equipos que necesitan ejecutar agentes de programación de forma repetida, el costo de ejecución puede ser tan importante como las puntuaciones principales de la prueba de referencia.

La evaluación cubre escenarios de desarrollo reales, incluyendo páginas frontend, juegos 3D y modificación de scripts de ingeniería. En las pruebas reportadas, DeepSeek-V4-Pro-0813 pudo completar lógicas de desarrollo de juegos que involucran manejo de colisiones, puntuación y estados de finalización.

Comportamiento de rendimiento, mientras que el estilo de interfaz y la retroalimentación de interacción producidos también superan los efectos de plantilla básicos.

Algunas tareas creativas de dibujo aún presentan problemas estructurales leves, pero la calidad general de finalización se mantiene al mismo nivel que el grupo líder.

Para equipos de desarrollo sensibles al presupuesto, este resultado le da a DeepSeek-V4-Pro-0813 un posicionamiento claro: rendimiento cercano al de los agentes de programación de vanguardia, con costos de ejecución de prueba de referencia mucho más bajos que varios competidores con precios más altos.

Preguntas frecuentes

¿Qué es DeepSeek-V4-Pro-0813?

DeepSeek-V4-Pro-0813 es la versión de producción actual detrás del nombre del modelo API deepseek-v4-pro. DeepSeek lanzó oficialmente la versión GA el 13 de agosto de 2026, con capacidades de agente mejoradas y soporte para su aplicación web, aplicación móvil y API.

¿Qué es SuperCLUE-Terminal?

SuperCLUE-Terminal es una prueba de referencia para tareas de terminal de agentes, centrada en flujos de trabajo de programación e ingeniería en chino en escenarios reales. Evalúa el rendimiento de extremo a extremo, como la comprensión de requisitos, la planificación, la ejecución de comandos, la modificación de archivos, la depuración y la finalización de tareas.

¿Por qué la prueba de referencia usa Claude Code?

La prueba de referencia utiliza un marco de agente general para que los modelos participantes sean evaluados en un entorno de ejecución más comparable. Claude Code proporciona un entorno de agente tipo terminal para ejecutar tareas, mientras que el modelo subyacente se cambia en cada evaluación.

¿Es 1.42 RMB el precio oficial por tarea de DeepSeek V4 Pro?

No. 1.42 RMB es el costo promedio por tarea observado en esta ejecución de la prueba de referencia SuperCLUE-Terminal, calculado según el uso de tokens y la metodología de precios de la prueba. El costo real de la API depende de los tokens de entrada, los tokens de salida, el uso de caché, la configuración de razonamiento y los precios actuales del proveedor.

¿Cómo se compara DeepSeek V4 Pro con Kimi K3 en esta prueba de referencia?

Kimi K3 obtuvo una puntuación más alta, 60.61 puntos, en comparación con los 51.52 puntos de DeepSeek-V4-Pro-0813. Sin embargo, el informe de la prueba muestra que el costo promedio por tarea de Kimi K3 fue de 19.63 RMB, mientras que el de DeepSeek-V4-Pro-0813 fue de solo 1.42 RMB, lo que le da a DeepSeek una ventaja de costos significativa en esta evaluación específica.

¿DeepSeek V4 Pro admite contextos largos y flujos de trabajo de agentes?

Sí. La documentación oficial de la API de DeepSeek indica que DeepSeek V4 Pro tiene una longitud de contexto de 1 millón de tokens y admite llamadas a herramientas, API de Responses, API compatible con Anthropic y múltiples configuraciones de intensidad de razonamiento. DeepSeek posiciona explícitamente la versión GA como una mejora para cargas de trabajo de agentes.

¿DeepSeek V4 Pro es siempre superior a GLM-5.2 en programación?

No necesariamente. En estos resultados de SuperCLUE-Terminal, DeepSeek-V4-Pro-0813 obtuvo 51.52 puntos frente a los 48.48 de GLM-5.2, pero una sola prueba de referencia no determina el rendimiento en todas las cargas de trabajo de programación. El tamaño del repositorio, el lenguaje, el entorno de herramientas, el comportamiento de contexto largo, la latencia y el costo influyen en la selección del modelo.

Herramientas relacionadas

Los puntos de referencia discutidos en este artículo para la comparación de programación de agentes terminales.

  • Claude Code: la herramienta de codificación de agentes de Anthropic, utilizada en los puntos de referencia como marco de ejecución general.
  • Kimi API: la plataforma oficial para desarrolladores de Moonshot AI Ltd. para Kimi K3 y otros modelos Kimi.
  • Z.AI GLM-5.2: descripción general oficial de GLM-5.2, un modelo que también obtuvo puntuaciones altas en los puntos de referencia.

Enlaces relacionados

Resumen

DeepSeek-V4-Pro-0813 obtuvo una puntuación de 51.52 en SuperCLUE-Terminal, ocupando el segundo lugar en este punto de referencia, solo detrás de Kimi K3, y superando a GLM-5.2 y DeepSeek-V4-Flash-0731.

Su principal ventaja radica en el costo: el costo promedio reportado por SuperCLUE es de aproximadamente 1,42 RMB por tarea, muy por debajo de los costos registrados de Kimi K3 y GLM-5.2 en la misma evaluación.

Este resultado no implica que DeepSeek V4 Pro sea el mejor modelo de codificación en términos generales, pero sí indica que, para tareas de programación prolongadas e intensivas en uso de herramientas, el modelo logra un buen equilibrio entre el rendimiento de codificación de agentes y el costo de ejecución.

Para equipos que prestan atención tanto a las capacidades de los agentes de codificación como a los costos operativos, DeepSeek-V4-Pro-0813 es una de las opciones más competitivas en esta comparación de SuperCLUE-Terminal.