DeepSeek V4 Pro frente a Grok 4.6: la primera prueba en el mundo real coloca a ambos modelos en la cima

El lanzamiento casi simultáneo de dos grandes modelos de IA ha puesto a DeepSeek V4 Pro y Grok 4.6 directamente en el centro de atención. DeepSeek V4 Pro destaca en agentes y

发布于 2026年8月14日generalGEO 评分: 04 次阅读
DeepSeek V4 Pro frente a Grok 4.6: la primera prueba en el mundo real coloca a ambos modelos en la cima

DeepSeek V4 Pro contra Grok 4.6: La primera prueba en el mundo real coloca a ambos modelos en la cima

Introducción

Dos modelos de IA de gran peso fueron lanzados casi al mismo tiempo, colocando directamente a DeepSeek V4 Pro y Grok 4.6 en el centro de atención.

DeepSeek V4 Pro logra un gran salto en rendimiento de agentes e ingeniería de software, mientras que Grok 4.6 irrumpe con fuerza en codificación, trabajo de conocimiento y capacidades integrales. El artículo original describe ambos lanzamientos como un desafío directo a los modelos de vanguardia actuales de OpenAI y Anthropic.

Lo que hace especialmente interesante esta comparación es que ambos modelos no solo se miden en tablas de referencia. Las primeras pruebas en el mundo real también les exigieron usar las mismas indicaciones para construir sitios web, crear juegos, replicar diseños visuales y generar experiencias 3D.

El resultado no fue tanto una competencia simple de ganador se lo lleva todo, sino un duelo parejo: cada modelo tiene su propio campo donde destaca.

DeepSeek V4 Pro hace su entrada, Grok 4.6 se une a la contienda

El artículo original destaca múltiples resultados de referencia de DeepSeek V4 Pro.

En la evaluación de agentes de ciberseguridad CyberGym, se informa que DeepSeek V4 Pro obtuvo 83,3, superando por poco a Fable 5 con 83,1 y a Opus 4.8 con 78,3.

En AutomationBench, alcanzó 31,8, por delante de Fable 5 con 29,1 y Opus 4.8 con 27,2.

El resultado más reñido fue en Terminal-Bench 2.1. DeepSeek V4 Pro obtuvo 87,9, mientras que Opus 4.8 alcanzó 85,0 y Fable 5 logró 88,0.

El artículo original también reporta un resultado de 60,0 en la configuración con herramientas del Examen Final de la Humanidad, con Opus 4.8 en 57,9 y Fable 5 en 63,0.

DeepSWE también fue otra mejora significativa en el informe. DeepSeek V4 Pro alcanzó 62,7, un gran avance frente al 12,8 de la versión preliminar, superando los 58,0 reportados por Opus 4.8, aunque aún por debajo del 70,0 de Fable 5.

Grok 4.6, por su parte, fue probado en múltiples áreas frente a GPT-5.6 y Fable 5.

El artículo original reporta un índice de inteligencia integral de 61, un punto por detrás de Fable 5 con 62.

En CursorBench, se informa que Grok 4.6 obtuvo 69,9%, superando el 67,2% de GPT-5.6 y acercándose al 70,5% de Fable 5.

En FrontierCode, alcanzó 61,3%, también ligeramente por delante del 60,6% de GPT-5.6, pero detrás del 63,6% de Fable 5.

El artículo original muestra un desempeño más fuerte en trabajo de conocimiento. Se informa que Grok 4.6 ocupó el primer lugar en las tres evaluaciones clave: 1.753 Elo en GDPval-AA v2, 1.577 Elo en AA-Briefcase, y 15,8% en el benchmark legal profesional Harvey LAB.

La conclusión principal que el artículo original extrae de estos datos es directa: ambos modelos ya forman parte de la conversación junto a los sistemas de vanguardia líderes.

La diferencia de precios también es parte de la historia

El rendimiento es solo la mitad de esta comparación.

El artículo original también destaca los costos de inferencia. Reporta los precios por millón de tokens de salida en el momento del lanzamiento:

Modelo Precio por millón de tokens de salida (según informe)
DeepSeek V4 Pro $0,87
Grok 4.6 $6
GPT-5.6 Sol $30
Claude Opus 5 $25
Fable 5 $50

En su vista actual de precios en dólares, el precio por millón de tokens de entrada es de 0,435 dólares con caché no disponible y 0,003625 dólares con caché disponible.

La documentación de DeepSeek también señala que su modelo V4 soporta una ventana de contexto de 1 millón de tokens, llamadas a herramientas, y acceso API tanto en formato OpenAI como en formato Anthropic.

Los precios específicos de otros modelos cambian con el tiempo, por lo que las comparaciones de precios entre modelos en el artículo original deben considerarse como una instantánea de su fecha de publicación, no como una lista de precios válida a largo plazo.

Primera prueba real: DeepSeek V4 Pro construye un globo terráqueo 3D

La primera prueba práctica descrita en el artículo plantea una exigencia bastante alta para DeepSeek V4 Pro.

Con una sola indicación, el modelo generó una experiencia completa e interactiva de un globo terráqueo 3D en el navegador.

Según el informe, el resultado admite interacciones básicas como arrastrar, rotar y hacer zoom, e incluye flujos de datos globales, rutas dinámicas y marcadores geográficos distribuidos por todo el mundo.

Los detalles visuales van más allá. Dispersión atmosférica, nubes, iluminación día-noche y la interfaz circundante están incluidos en la experiencia generada.

El punto clave de esta prueba no es solo que el modelo generó una página web, sino que demuestra hasta dónde puede llegar un modelo de programación con IA cuando se le pide coordinar diseño visual, renderizado 3D, interacción y estructura de aplicación en una sola tarea.

DeepSeek V4 Pro y Grok 4.6 se enfrentan en tres tareas de aplicación

A continuación, el artículo original compara ambos modelos utilizando indicaciones iguales o muy similares.

El creador de IA Xiangyang Qiaomu ejecutó primero tres tareas pequeñas con DeepSeek V4 Pro y luego entregó dos de esas mismas indicaciones a Grok 4.6.

Construir y desplegar un sitio web con tres habilidades

La primera tarea requería que el modelo usara tres habilidades para desarrollar y desplegar un sitio web.

Según el informe, DeepSeek V4 Pro completó con éxito todo el flujo de trabajo. El artículo afirma que el diseño de la página y la integridad general fueron estables.

Este tipo de prueba es especialmente importante para la programación con agentes, ya que el modelo necesita coordinar múltiples herramientas o capacidades, no solo generar un fragmento de código.

Reproducir 60 estilos de diseño en tarjetas Bento

La segunda tarea requería que el modelo reprodujera 60 estilos de diseño diferentes y los presentara como un conjunto de tarjetas Bento.

Según el informe, DeepSeek V4 Pro distinguió la tipografía, las combinaciones de colores y el diseño entre los diferentes estilos.

Cuando la misma indicación se entregó a Grok 4.6, este tomó la delantera. El artículo afirma que algunas de las páginas de Grok eran más maduras en diseño, color y jerarquía visual, con un resultado final más refinado.

Construir un juego 3D de romper ladrillos

La tercera tarea era crear desde cero un juego 3D de romper ladrillos.

DeepSeek V4 Pro generó un juego jugable con entorno 3D, música de fondo, efectos de sonido dinámicos y retroalimentación interactiva.

Grok 4.6 rindió a la par en esta ronda. El artículo describe los resultados de ambos como prácticamente empatados en calidad visual, integridad de escena y jugabilidad.

La prueba de Flappy Bird revela otra disyuntiva

Una prueba más matizada proviene del desarrollador Jun Song, quien dio a DeepSeek V4 Pro y Grok 4.6 exactamente la misma indicación para construir desde cero un juego estilo Flappy Bird.

Ambos modelos adoptaron enfoques completamente diferentes.

DeepSeek V4 Pro usó más de 20.000 tokens, pero según el informe el costo de API fue de 0 dólares—porque el precio de API de ese modelo (durante la oferta por tiempo limitado de DeepSeek) hizo que tanto los tokens de entrada como los de salida fueran completamente gratuitos.

Grok 4.6 usó aproximadamente 5.000 tokens, con un costo reportado de 0,03 dólares.

Por lo tanto, en esta ejecución específica, Grok fue más eficiente en tokens, pero según el artículo original, DeepSeek produjo un resultado final más sólido.

Según el informe, la versión de DeepSeek incluía un fondo de montañas en capas, nubes, gradientes y tuberías con efecto tridimensional, así como animaciones de "+1" flotando cuando el personaje atraviesa las tuberías.

La conclusión del artículo original es valiosa: un menor consumo de tokens no significa automáticamente mejores resultados de aplicación, y un mayor consumo de tokens tampoco implica necesariamente mayores costos.

Otra prueba de frontend también favorece a DeepSeek

El desarrollador Hamza ejecutó otra prueba de generación de frontend, y el artículo original informa que DeepSeek V4 Pro volvió a ganar.

La página generada se describe como superior en integridad general y calidad visual

Resultados de Grok 4.6.

Esto refuerza el patrón observado anteriormente en las tareas: los dos modelos están muy cerca, pero sus fortalezas varían según la aplicación y el prompt específicos.

V4 Pro todavía tiene debilidades

DeepSeek V4 Pro no ganó todas las pruebas de generación visual.

En una comparación que involucraba pelícanos, la versión V4 Pro supuestamente superó a la versión Flash en integridad visual general y generó una ilustración de elefante más atractiva, pero la dirección del movimiento del pelícano era incorrecta.

Es un pequeño ejemplo, pero resalta una limitación común de los sistemas de codificación generativa y visión: los resultados pueden verse refinados y aun así contener errores semánticos o de movimiento básicos.

Cerezo en Three.js: la diferencia es más evidente

El artículo fuente luego aumentó la dificultad, pidiendo a DeepSeek V4 Pro, GPT-5.6 Sol y Claude Opus 5 que generaran el mismo cerezo usando Three.js.

Esta vez, las diferencias fueron más marcadas.

El artículo informó que DeepSeek V4 Pro quedó por detrás de los otros dos modelos en detalles del tronco y las ramas, el follaje, la iluminación, la profundidad de campo y la atmósfera general.

Este resultado es importante porque evita que la comparación se convierta en una narrativa de victoria simple. DeepSeek V4 Pro puede ser muy potente en tareas de codificación de extremo a extremo, pero aún existen escenarios de generación visual especializados donde otros modelos frontera producen resultados más refinados.

En general: DeepSeek V4 Pro y Grok 4.6 están en un nivel similar

Tras múltiples rondas de pruebas, la evaluación general del artículo fuente es que DeepSeek V4 Pro y Grok 4.6 han alcanzado un nivel competitivo similar.

Ninguno de los dos modelos puede ganar todas las tareas.

DeepSeek V4 Pro parece particularmente fuerte en ciertas tareas de codificación de extremo a extremo y construcción de aplicaciones, mientras que Grok 4.6 puede ser más eficiente en tokens y muestra ventajas en algunas comparaciones de diseño visual y trabajo de conocimiento.

Esto hace que esta comparación sea más útil que una puntuación única en un ranking. Para los desarrolladores, el mejor modelo puede depender de si la prioridad es calidad de código, fiabilidad de agentes, refinamiento visual, eficiencia de tokens o coste de API.

Dos modelos de IA están reduciendo la brecha con la frontera

El artículo fuente describe el lanzamiento simultáneo de DeepSeek V4 Pro y Grok 4.6 como un momento inusual en el mercado de la IA.

La reacción de Rick De Oliveira, citada en el artículo,

La idea central del artículo original es que ambos modelos son potentes y asequibles al mismo tiempo.

Es esta combinación la que hace que sus lanzamientos sean tan destacados.

La documentación oficial de DeepSeek confirma que V4 Pro está diseñado para la invocación de herramientas, cargas de trabajo de contexto largo y modos de pensamiento y no pensamiento.

Los materiales oficiales de xAI sobre Grok posicionan de manera similar a su última generación de Grok en codificación, tareas de agentes y trabajo de conocimiento. Por ejemplo, el anuncio oficial de Grok 4.5 describe el modelo como construido específicamente para codificación, tareas de agentes y trabajo de conocimiento, e informa resultados de evaluaciones de ingeniería reales.

Incluso si los datos de puntos de referencia individuales varían, la tendencia más amplia es clara: la IA de nivel frontera se está volviendo cada vez más accesible para los desarrolladores, y la relación calidad-precio se está convirtiendo en una parte cada vez más importante de la competencia entre modelos.

¿Qué viene después?

El artículo fuente concluye señalando la dirección de la próxima ronda de competencia.

Menciona que xAI ya ha anticipado Grok 4.7, y se espera que OpenAI y Anthropic continúen respondiendo con sus propias actualizaciones de modelos.

Esto significa que los líderes actuales en puntos de referencia podrían no mantener su ventaja por mucho tiempo.

Para los desarrolladores, la lección más duradera es: evalúa los modelos según las tareas que realmente afectan a tu flujo de trabajo. Un modelo que obtiene una puntuación alta en puntos de referencia pero rinde mal en tu base de código, proceso de implementación, requisitos de interfaz o cadena de herramientas puede no ser la opción correcta.

Preguntas frecuentes

¿Qué es DeepSeek V4 Pro?

DeepSeek V4 Pro es el modelo insignia de la serie V4 de DeepSeek, orientado a razonamiento, codificación, uso de herramientas y cargas de trabajo de contexto largo. La documentación oficial de DeepSeek enumera una ventana de contexto de 1 millón de tokens y soporte para invocación de herramientas, ofreciendo acceso a la API tanto en formato OpenAI como en formato Anthropic.

¿Cómo se compara DeepSeek V4 Pro con Grok 4.6?

El artículo fuente informa que ambos modelos rinden de manera similar en varias pruebas de agentes y codificación, con victorias y derrotas para cada uno. DeepSeek V4 Pro destaca especialmente en varias pruebas de construcción de aplicaciones de extremo a extremo, mientras que Grok 4.6 muestra resultados sólidos en codificación, trabajo de conocimiento y algunas tareas de diseño visual.

¿Es DeepSeek V4 Pro más barato que Grok?

Según la comparación del artículo fuente del 14 de agosto de 2026, DeepSeek V4 Pro reporta un precio de salida de 0,87 USD por millón de tokens, mientras que Grok 4.6 cuesta 6 USD. La página oficial de precios de DeepSeek actualmente confirma 0,87 USD por millón de tokens de salida para V4 Pro, aunque los precios de la API pueden variar.

¿Puede DeepSeek V4 Pro crear sitios web y juegos?

El artículo fuente informa casos de prueba exitosos en los que DeepSeek V4 Pro generó una experiencia de globo terráqueo 3D, sitios web, una colección de diseños estilo Bento, un juego de rompebloques 3D y un juego estilo Flappy Bird. Estos son resultados de pruebas reales reportados, no una garantía de que cada prompt produzca una calidad equivalente.

¿Es DeepSeek V4 Pro adecuado para agentes de codificación de IA?

Está diseñado específicamente para invocación de herramientas y cargas de trabajo de agentes, y el artículo fuente informa un rendimiento sólido en varias evaluaciones de agentes e ingeniería de software. La documentación oficial de DeepSeek también enumera el soporte de invocación de herramientas de V4 Pro.

¿DeepSeek V4 Pro siempre supera a otros modelos frontera?

No. El artículo fuente incluye pruebas en las que GPT-5.6 Sol y Claude Opus 5 lograron mejores resultados,

especialmente en la comparación de generación de cerezos con Three.js. Los resultados varían considerablemente según la tarea.

¿Qué más deberían comparar los desarrolladores además de las puntuaciones de referencia?

Los desarrolladores también deberían comparar el coste de API, la latencia, la longitud de contexto, la invocación de herramientas, la fiabilidad de codificación, la calidad de salida y el grado de ajuste del modelo con sus flujos de trabajo de agentes existentes. Para sistemas de producción, la consistencia y el coste total pueden ser más importantes que pequeñas diferencias en los puntos de referencia.

Herramientas relacionadas

  • DeepSeek API: Punto de acceso oficial a la API para los modelos de DeepSeek.
  • Documentación de la API de DeepSeek: Documentación oficial sobre modelos, precios, invocación de herramientas e integración de API.
  • xAI API: Recursos oficiales para desarrolladores para crear con los modelos Grok.
  • Grok: El servicio de xAI orientado al usuario para interactuar con sus modelos.
  • Three.js: Biblioteca JavaScript 3D relacionada con las pruebas de generación de Three.js descritas en el artículo.

Enlaces relacionados

GitHub: la organización oficial de DeepSeek en GitHub.

Resumen

DeepSeek V4 Pro y Grok 4.6 están impulsando simultáneamente la IA de vanguardia desde dos frentes: agentes del mundo real más potentes y rendimiento de codificación, junto con una relación precio-rendimiento más agresiva.

Las pruebas iniciales no arrojaron un ganador absoluto. DeepSeek V4 Pro mostró un rendimiento sólido en múltiples tareas de construcción de aplicaciones de extremo a extremo, mientras que Grok 4.6 demostró capacidades competitivas en codificación, trabajo de conocimiento y diseño visual.

El cambio más significativo es que los desarrolladores ahora tienen más modelos capaces para elegir sin tener que pagar automáticamente precios de nivel avanzado.