Lanzamiento de Gemini 3.6 Flash enfrenta críticas tempranas, Gemini 3.5 Pro se retrasa

Google DeepMind ha lanzado tres nuevos modelos Gemini: **Gemini 3.6 Flash**, **Gemini 3.5 Flash-Lite** y **Gemini 3.5 Flash Cyber**. Sin embargo, el esperado **Gemini 3.5 Pro** no llegó como se esperaba. Google indicó que 3.5 Pro aún está en pruebas con socios y se lanzará ampliamente cuando esté listo. Al mismo tiempo, la compañía confirmó que ya ha comenzado el desarrollo de Gemini 4 a través de lo que denomina su "plan de preentrenamiento más ambicioso hasta la fecha".

发布于 2026年7月25日generalGEO 评分: 04 次阅读
Imagen con fondo oscuro, con un patrón de estrella azul a la izquierda y el texto "Gemini" en mayúsculas a la derecha. En el centro destaca "Gemini 3.6 Flash" junto con las palabras "Reviews · Benchmarks · Pricing". Debajo, un gráfico muestra valores de 3.6 Flash, 3.5 Pro, Competitor 1 y Competitor 2, siendo 3.6 Flash el más alto. A la derecha, un icono de etiqueta de precio azul con un símbolo "$" debajo. En la parte inferior, aparece "3.5 Pro Delay" con un icono de reloj morado. La imagen complementa el contenido del documento sobre Gemini 3.6 Flash, destacando sus aspectos.

El lanzamiento de Gemini 3.6 Flash enfrenta duras críticas, mientras Gemini 3.5 Pro se retrasa

Introducción

Google DeepMind ha lanzado tres nuevos modelos Gemini: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite y Gemini 3.5 Flash Cyber.

Sin embargo, el esperado Gemini 3.5 Pro no llegó como muchos desarrolladores anticipaban.

Google afirmó que 3.5 Pro aún está en fase de pruebas con socios y se lanzará ampliamente cuando esté listo. Mientras tanto, la compañía confirmó que ha iniciado el trabajo en Gemini 4 mediante lo que denominan "la ejecución de preentrenamiento más ambiciosa hasta la fecha".

La imagen muestra un tuit oficial de Google DeepMind que presenta los tres nuevos modelos lanzados. Gemini 3.6 Flash utiliza menos tokens que 3.5 Flash y ofrece resultados de mayor calidad al mismo costo; Gemini 3.5 Flash-Lite proporciona opciones rápidas y rentables para tareas cotidianas como procesamiento de documentos y búsqueda inteligente; Gemini 3.5 Flash Cyber es un modelo de ciberseguridad diseñado para detectar y corregir vulnerabilidades críticas de software. Esta imagen está estrechamente relacionada con el contexto y constituye la explicación oficial del lanzamiento de los tres nuevos modelos por parte de Google DeepMind, proporcionando información específica a los lectores.

Google ha lanzado Gemini 3.6 Flash, Gemini 3.5 Flash-Lite y Gemini 3.5 Flash Cyber.

Este lanzamiento generó rápidamente controversia en la comunidad de desarrolladores. Varios usuarios iniciales criticaron a Gemini 3.6 Flash por su débil salida en frontend, inconsistencia en razonamiento espacial y resultados decepcionantes en codificación en comparación con modelos de vanguardia competidores.

La intensidad de estas críticas supera lo que la evidencia disponible puede respaldar. Si bien existen quejas legítimas sobre el uso temprano, los propios resultados de evaluaciones comparativas de Google y las pruebas independientes de Artificial Analysis muestran un panorama más complejo: Gemini 3.6 Flash presenta mejoras respecto a 3.5 Flash en múltiples evaluaciones de codificación, uso de computadoras, contexto largo y trabajo de conocimiento, manteniendo al mismo tiempo la misma puntuación general en el Índice de Inteligencia de Artificial Analysis.

Este artículo sigue la estructura del informe original, diferenciando los datos oficiales de evaluación comparativa de las reacciones de la comunidad.

Gemini 3.6 Flash enfrenta críticas desde su lanzamiento

Google posiciona a Gemini 3.6 Flash como el modelo principal para agentes de IA en entornos de producción.

El modelo ya está ampliamente disponible, admitiendo entrada de texto, imágenes, video, audio y PDF, con una ventana de contexto de 1,048,576 tokens de entrada y hasta 65,536 tokens de salida. Las funciones compatibles incluyen ejecución de código, uso de computadora, llamadas a funciones, búsqueda de archivos, salida estructurada, fundamentación de búsqueda, contexto de URL y razonamiento reflexivo.

Google indicó que su objetivo principal no es solo lograr mayor inteligencia en evaluaciones comparativas. El énfasis está en completar tareas con menos tokens de salida, menos pasos de razonamiento, menor latencia y un precio por token de salida más bajo que Gemini 3.5 Flash.

A pesar de esto, algunos resultados iniciales de pruebas públicas distan de ser positivos.

Generación de frontend recibe duras críticas tempranas

El informe original destacó una prueba de desarrollador en la que se solicitó a Gemini 3.6 Flash completar una tarea de generación de frontend en dos intentos.

El desarrollador describió el resultado como excepcionalmente malo, criticando la estructura fragmentada de los componentes de la aplicación generada, la lógica inconsistente y la interacción poco fiable.

Esta imagen muestra una escena 3D de estilo pixel art llamada Aetheria, un resultado típico de Gemini 3.6 Flash para generar frontends interactivos. La escena presenta un fondo estrellado oscuro con un castillo gris, montañas, agua, platillos voladores y objetos brillantes flotantes, junto con detalles como árboles morados y pequeñas estructuras coloridas. A la izquierda hay un panel de ajuste de parámetros de escena con tres categorías: tiempo e iluminación, perspectiva cinematográfica y efectos mundiales. Esta imagen corresponde al contenido de pruebas comunitarias mencionado en el documento, mostrando visualmente los resultados de frontend generados por Gemini 3.6 Flash para respaldar las evaluaciones de los desarrolladores sobre la calidad de generación de frontend del modelo.

Una prueba comunitaria temprana utilizó Gemini 3.6 Flash para generar una experiencia frontend interactiva.

Otros desarrolladores reportaron problemas similares al probar el modelo en bases de código existentes. Las quejas incluyeron ignorar restricciones del sistema de diseño, cambios inesperados en la interfaz de usuario y resultados visualmente inferiores a los generados por modelos Gemini Pro anteriores.

Estas observaciones son importantes porque la codificación de frontend combina múltiples capacidades:

  • Comprender bases de código existentes
  • Seguir restricciones de diseño
  • Generar código válido
  • Preservar comportamientos existentes
  • Crear diseños visualmente coherentes
  • Manejar ediciones de varios pasos sin romper componentes funcionales

Un modelo puede obtener puntuaciones altas en evaluaciones de programación pero aún sentirse poco fiable en trabajos prácticos de frontend.

Al mismo tiempo, las demostraciones individuales no son evaluaciones controladas. La calidad de los prompts, el marco del agente, la estructura del código base, el nivel de razonamiento, el acceso a herramientas y el número de iteraciones permitidas pueden alterar significativamente los resultados.

Los resultados del Frontend Arena no respaldan una conclusión simple de "mejor"

El informe fuente señala que, en codificación de frontend, Gemini 3.6 Flash no supera a modelos como Claude Fable 5, GPT-5.6 Sol y Meta Muse Spark 1.1.

El ranking en vivo de WebDev Arena se actualiza continuamente, por lo que las posiciones pueden cambiar a medida que lleguen más votos. Al momento de preparar este texto, Kimi K3 sigue liderando temporalmente, seguido de Claude Fable 5 y GPT-5.6 Sol.

Dado que Gemini 3.6 Flash se lanzó el 21 de julio, las capturas de pantalla estáticas y las instantáneas tempranas del ranking no deben considerarse clasificaciones permanentes.

La conclusión más útil es que, aunque Google afirma que el modelo es más fuerte en codificación, este nuevo modelo Flash no se ha establecido de inmediato como un líder claro en frontend.

El razonamiento espacial también genera reacciones negativas

El informe fuente luego aborda el razonamiento espacial.

Un desarrollador documentó pruebas de Gemini 3.6 Flash en relaciones básicas de posición y orientación, reportando más errores que con Gemini 3.5 Flash.

El usuario inicialmente sospechó que la salida más débil podría deberse a no seleccionar un nivel de razonamiento alto. Otros usuarios luego probaron con configuraciones de razonamiento más altas, pero aún reportaron impresiones iniciales mixtas.

Las quejas incluyeron relaciones espaciales incorrectas y escenas visualmente inconsistentes.

Nuevamente, estas pruebas representan observaciones comunitarias, no evaluaciones estandarizadas. Son útiles como casos de fricción en el mundo real, pero no deben generalizarse como una afirmación de retroceso general del modelo en razonamiento espacial.

La documentación oficial de Google describe a Gemini 3.6 Flash como diseñado para tareas multimodales y espaciales. Pruebas visuales independientes también encontraron ventajas en múltiples categorías de imágenes y video, aunque no en todas las tareas visuales supera a 3.5 Flash.

CursorBench muestra mejoras respecto a 3.5 Flash, pero sin alcanzar el liderazgo de vanguardia

El informe fuente también señala CursorBench, una evaluación para trabajo de ingeniería de software en el entorno real de Cursor.

Una captura de pantalla ampliamente difundida compara Gemini 3.6 Flash con modelos como Cursor Composer 2.5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5 y Claude Sonnet 5.

![La imagen es una captura de pantalla de un tuit que muestra un gráfico con puntuaciones de CursorBench 3.2. En el gráfico, las puntuaciones de diferentes modelos se representan con puntos de colores, como Grok 4.5, GPT-5.6 Sol, Opus 4.0, entre otros.](

Gemini 3.6 Flash se muestra en el gráfico con puntos azules, y su puntuación es inferior a la de otros modelos. Debajo del tuit, un usuario comenta: «O sea, Gemini 3.6 Flash es peor que Composer 2.5, y ni hablar de Grok 4.5», y señala que Gemini 3.6 Flash ya está disponible en Cursor. Esta imagen está relacionada con el contexto del documento, y se utiliza para ilustrar los resultados de CursorBench, indicando que Gemini 3.6 Flash rinde peor que algunos modelos en esta prueba.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/a0b9be2c-3d78-4695-949c-009046cb9b84-c5ae89ef-5997-469a-a228-6806788968da.png)

En la captura compartida por la fuente del mensaje, CursorBench sitúa a Gemini 3.6 Flash por detrás de varios modelos de codificación con puntuaciones más altas.

La página actual de CursorBench muestra varios niveles de razonamiento de Gemini 3.6 Flash. En los resultados publicados más recientes disponibles al momento de redactar este contenido:

  • Gemini 3.6 Flash Medium obtiene un 51,2%
  • Gemini 3.5 Flash obtiene un 48,8%
  • Gemini 3.6 Flash Low obtiene un 47,4%

Esto significa que, en esta prueba de referencia, la configuración de razonamiento medio ha mejorado respecto a Gemini 3.5 Flash, aunque sigue por detrás de muchos modelos de codificación más potentes.

Este es también un buen ejemplo de cómo la evaluación de modelos debe contextualizarse.

La afirmación de que «Gemini 3.6 Flash es peor que sus competidores» puede ser cierta para una prueba de referencia y un conjunto de comparación específicos; al mismo tiempo, también puede ser cierto que «Gemini 3.6 Flash ha mejorado con respecto a 3.5 Flash».

Las pruebas de referencia propias de Google muestran una mejora real

Los resultados de evaluación publicados por Google dibujan un panorama más positivo que las reacciones más duras de la comunidad.

La empresa informa mejoras en codificación, ingeniería de aprendizaje automático, uso de ordenadores, trabajo de conocimiento, razonamiento con gráficos y tareas de contexto largo, en comparación con Gemini 3.5 Flash.

Esta es una tabla comparativa de los resultados de referencia de Gemini 3.6 Flash de julio de 2026, utilizada para mostrar los indicadores de rendimiento del modelo frente a otros modelos de IA. La tabla compara principalmente Gemini 3.6 Flash con Gemini 3.5 Flash, mostrando claramente las diferencias en varios elementos de evaluación, incluidos precios de entrada y salida, SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1 y otras métricas multidimensionales, así como datos de otros modelos competidores como GPT-4o-Luma, Grok 1.5 y Claude Sonnet 5. En general, presenta visualmente el rendimiento de referencia publicado por Google para este modelo, en consonancia con la introducción de Gemini 3.6 Flash en el documento, y sirve de apoyo para la mejora de rendimiento mencionada.

Tabla de referencia publicada por Google en julio de 2026, que compara Gemini 3.6 Flash con varios modelos competidores.

Algunos resultados seleccionados reportados por Google incluyen:

Prueba de referencia Gemini 3.6 Flash Gemini 3.5 Flash
SWE-Bench Pro 58,7% 55,1%
DeepSWE v1.1 49% 37%
Terminal-Bench 2.1 78,0% 76,2%
MLE-Bench 63,9% 49,7%
GDPval-AA v2 1421 1349
OSWorld-Verified 83,0% 78,4%
CharXiv Razonamiento, sin herramientas 85,2% 84,2%
GDM-MRCR v2, 128K 91,8% 77,3%
GDM-MRCR v2, 1M 54,0% 26,6%

Google también afirma que, en el Artificial Analysis Index, Gemini 3.6 Flash consume un 17% menos de tokens de salida que Gemini 3.5 Flash, y que en ciertas cargas de trabajo de DeepSWE, el uso de tokens puede reducirse hasta en un 65%.

Los precios del nuevo modelo son:

  • 1,50 USD por cada millón de tokens de entrada
  • 7,50 USD por cada millón de tokens de salida

Gemini 3.5 Flash tiene el mismo precio de entrada indicado, pero un precio de salida más alto de 9,00 USD según la tarifa de Google.

Comienza la comparación.

Para cargas de trabajo de agentes, esta diferencia es importante, ya que el coste no solo depende de la calidad de la prueba de referencia, sino también de los tokens de razonamiento y el número de ciclos de herramientas que el modelo utiliza para completar la tarea.

Artificial Analysis otorga a 3.6 Flash la misma puntuación de inteligencia que a 3.5 Flash

Las pruebas de terceros arrojan una conclusión más moderada.

Artificial Analysis otorga a Gemini 3.6 Flash (modo de razonamiento alto) una puntuación de índice de inteligencia de 50.

Esta es la misma puntuación que obtuvo Gemini 3.5 Flash.

Imagen de un tuit del usuario de Twitter @synthwavedd sobre la puntuación de Gemini 3.6 Flash en Artificial Analysis. El texto sobre el tuit indica que Gemini 3.6 Flash obtuvo la misma puntuación que 3.5 Flash en Artificial Analysis, y que su rendimiento es inferior al de modelos como Meta Spark 1.1. El gráfico inferior muestra las puntuaciones de diferentes modelos en Artificial Analysis, con Gemini 3.6 Flash en una posición baja. Esta imagen está relacionada con el contenido del documento que dice «Artificial Analysis otorga a Gemini 3.6 Flash la misma puntuación de índice de inteligencia que a 3.5 Flash», y presenta visualmente la puntuación.

Artificial Analysis no encuentra ninguna mejora en la puntuación general del índice de inteligencia de 3.5 Flash a 3.6 Flash.

Este resultado explica parte de la decepción.

Los desarrolladores que solo miran el número del modelo podrían esperar un salto significativo en inteligencia general. Por el contrario, Artificial Analysis descubre que, al medir las mejoras en eficiencia y tiempo de finalización de tareas, la inteligencia general es aproximadamente la misma.

Sus pruebas muestran que Gemini 3.6 Flash tiene una velocidad de aproximadamente 251 tokens de salida por segundo, lo que lo convierte en uno de los modelos más rápidos de la comparación.

Artificial Analysis también informa que tanto Gemini 3.6 Flash como Gemini 3.5 Flash-Lite reducen a la mitad el tiempo por tarea en comparación con sus predecesores.

Por lo tanto, la mejora principal se describe con mayor precisión como:

Inteligencia general similar, velocidad de finalización más rápida, menos tokens de salida y menor coste por tarea completada en muchas cargas de trabajo.

Esto no es tan llamativo como un gran avance en inteligencia, pero sigue siendo importante para agentes de producción de alto volumen.

La relación costo-beneficio es más matizada de lo que sugieren las quejas en línea

Algunos usuarios critican que Gemini 3.6 Flash es más caro que ciertos modelos competidores con mejores puntuaciones en pruebas de inteligencia.

Imagen de una captura de pantalla de Twitter mostrando la pregunta de Jean P.D. Meijer sobre el precio y rendimiento de Gemini 3.6 Flash. El gráfico muestra el Índice de Inteligencia frente al Costo por Tarea del Índice de Inteligencia, con el costo por tarea (USD) en el eje horizontal y el Índice de Inteligencia en el vertical. Varios modelos están marcados con diferentes colores, como GPT 5.6 Sol High, Grok 4.5, etc. Gemini 3.6 Flash aparece en una posición alta en el gráfico, con un costo relativamente alto. Esta imagen está estrechamente relacionada con el contexto y muestra visualmente el rendimiento de Gemini 3.6 Flash en términos de costo y rendimiento, haciendo eco del debate sobre su precio y rendimiento en el documento.

Esta fuente señala las preocupaciones sobre el equilibrio entre costo e inteligencia de Gemini 3.6 Flash.

El precio por token inicial no cuenta toda la historia.

Un modelo que utiliza menos pasos de razonamiento o genera menos tokens de salida a veces puede completar tareas de manera más económica, incluso si su precio por token anunciado no es el más bajo.

Por el contrario, un modelo más barato que requiere reintentos repetidos o generaciones más largas puede volverse más caro en uso real.

Para los desarrolladores, una mejor métrica suele ser el costo por tarea exitosa medido en función de su propia carga de trabajo.

Acerca de

La fecha límite de conocimiento necesita más evidencia

El artículo original también cita a un usuario que afirma que Gemini 3.6 Flash desconoce muchos eventos de 2025 y 2026, a pesar de mostrar aparentemente una fecha de conocimiento actualizada.

El usuario concluye que el conocimiento real del modelo parece detenerse alrededor de enero de 2025.

Debemos tomar esta prueba con cautela.

El hecho de que un modelo de lenguaje no pueda recordar un evento no prueba por sí mismo que sus datos de entrenamiento tengan una fecha límite específica. Las razones pueden incluir: comportamiento de recuperación, errores de razonamiento, redacción de la instrucción, filtros de seguridad, cobertura de entrenamiento incompleta o incertidumbre.

La documentación pública del modelo de Google no proporciona suficiente información para confirmar de forma independiente la fecha límite específica que se afirma en las pruebas de redes sociales.

Para información actual, los desarrolladores deberían usar la búsqueda de Google como referencia u otras fuentes verificadas, en lugar de asumir que la memoria interna del modelo está completa hasta una fecha determinada.

Gemini 3.5 Flash-Lite se centra en la velocidad

Google también ha lanzado Gemini 3.5 Flash-Lite, diseñado para cargas de trabajo de agentes de alto rendimiento y baja latencia.

Una agencia de análisis de IA ha medido que este modelo genera aproximadamente 350 tokens por segundo.

Los precios de API listados por Google son:

  • 0,30 USD por cada millón de tokens de entrada
  • 2,50 USD por cada millón de tokens de salida

Esto lo hace significativamente más barato que Gemini 3.6 Flash.

El modelo es adecuado para las siguientes cargas de trabajo:

  • Búsqueda de agentes
  • Procesamiento de documentos
  • Extracción de datos de alto rendimiento
  • Traducción
  • Generación de resúmenes
  • Ejecución de subagentes

Google afirma que Flash-Lite también admite niveles de pensamiento configurables y funciones integradas de uso de computadora.

Su comparación oficial muestra mejoras significativas en comparación con Gemini 3.1 Flash-Lite, incluyendo:

  • Prueba de referencia terminal 2.1: 54% frente a 31%
  • GDM-MRCR v2: 72,2% frente a 60,1%
  • GDPval-AA v2: 1140 frente a 642

Incluso supera al antiguo Gemini 3 Flash en varias pruebas de referencia de agentes.

Los informes iniciales sugerían que la velocidad no sirve de nada si la respuesta es incorrecta. Como principio general, esto es justo, pero la evidencia de las pruebas de referencia no respalda considerar a Flash-Lite simplemente como un modelo "más rápido pero peor".

El objetivo declarado de Google es diferente: utilizar modelos más pequeños en cargas de trabajo de alto rendimiento que no requieren capacidades completas de inteligencia de vanguardia.

Gemini 3.5 Flash Cyber se centra en la investigación de vulnerabilidades

El tercer modelo nuevo es Gemini 3.5 Flash Cyber.

Está construido sobre Gemini 3.5 Flash y afinado para trabajos de ciberseguridad, como:

  • Encontrar vulnerabilidades de software
  • Verificar problemas de seguridad
  • Generar parches
  • Apoyar el análisis automatizado de defensa

Google afirma que el modelo se utiliza internamente en CodeMender, donde múltiples agentes Flash Cyber pueden trabajar juntos y fusionar sus hallazgos en un solo informe.

A diferencia de Gemini 3.6 Flash y Flash-Lite, Flash Cyber no se ha lanzado como un modelo público general.

Google dice que, debido al riesgo de doble uso derivado de la detección automatizada de vulnerabilidades, se pondrá a disposición de gobiernos y socios de confianza a través del programa piloto CodeMender con acceso restringido.

Un anuncio separado de Google DeepMind afirma que el modelo está diseñado para hacer que la detección y reparación de vulnerabilidades a gran escala sea más barata que usar modelos de vanguardia más grandes.

Gemini 3.5 Pro aún no está listo

Para muchos desarrolladores, la noticia más importante es el modelo que no se lanzó. Google dijo:

Gemini 3.5 Pro se encuentra actualmente en pruebas con socios y se abrirá al público en general cuando esté listo.

Esto confirma un retraso del modelo insignia en comparación con las expectativas anteriores. Medios como Reuters informaron que Gemini 3.5 Pro estaba programado para su lanzamiento en junio, y el rendimiento de codificación fue una de las áreas que causaron el retraso. En el anuncio del 21 de julio, Google no proporcionó una nueva fecha de lanzamiento público, enfatizando que quiere lanzar el modelo cuando cumpla con sus estándares de calidad.

Esto es crucial para el lanzamiento de 3.6 Flash. Este nuevo modelo Flash no es un reemplazo de Gemini 3.5 Pro; ocupa una posición diferente en la línea de productos: es un modelo orientado a la producción, optimizado para costo, velocidad, tareas multimodales y ejecución autónoma.

Gemini 4 ha iniciado su preentrenamiento más grande hasta la fecha

Mientras tanto, Google ha confirmado que ha comenzado a entrenar la próxima generación de Gemini. Google describe a Gemini 4 como el proyecto de preentrenamiento más ambicioso hasta la fecha.

Imagen de un tuit del usuario de Twitter Logan Kilpatrick, publicado el 21 de julio de 2026 a las 23:50. El tuit dice: "Hemos iniciado el proyecto de preentrenamiento más ambicioso hasta la fecha: Gemini 4, ¡y estamos emocionados con el progreso hasta ahora :)", acompañado de una marca de verificación azul y un icono de Google. Este tuit está relacionado con la confirmación de Google de que ha comenzado a entrenar la próxima generación de Gemini, reflejando su enfoque en el proyecto de preentrenamiento de Gemini 4.

Google indica que su trabajo de preentrenamiento de Gemini 4 ya está en marcha.

Esto crea una línea de tiempo de productos inusual:

  1. Gemini 3.6 Flash ya está disponible de forma general.
  2. Gemini 3.5 Flash-Lite ya está disponible de forma general.
  3. Gemini 3.5 Flash Cyber entra en despliegue limitado.
  4. Gemini 3.5 Pro sigue en pruebas con socios.
  5. El preentrenamiento de Gemini 4 ya ha comenzado.

El artículo fuente interpreta esto como que Google está acelerando los números de versión mientras su modelo Pro insignia aún no está completo. Esta interpretación es especulativa. Las grandes organizaciones de IA suelen comenzar a entrenar modelos de generaciones futuras antes de que todos los productos de la generación actual hayan completado su proceso de lanzamiento.

El preentrenamiento, el postentrenamiento, la evaluación de seguridad, la integración de productos y el despliegue de servicios pueden avanzar en paralelo.

Sin embargo, el retraso evidente en el lanzamiento de la versión Pro ha aumentado la presión sobre Google, ya que la codificación y los flujos de trabajo autónomos se han convertido en los principales campos de competencia para OpenAI, Anthropic, Moonshot, xAI, Meta y otros proveedores de modelos.

¿Es realmente Gemini 3.6 Flash el peor modelo de Google?

Las pruebas existentes no respaldan esta conclusión. Actualmente ocurren tres cosas independientes al mismo tiempo.

1. Algunos desarrolladores tempranos realmente no prefieren el modelo

Los resultados negativos en las pruebas de frontend y razonamiento espacial provienen de informes reales de usuarios. Estos informes merecen atención porque las evaluaciones de referencia no reflejan completamente la calidad en producción.

2. Los propios datos de Google muestran mejoras significativas en comparación con 3.5 Flash

El modelo ha mejorado en DeepSWE, MLE-Bench, OSWorld, GDPval y evaluaciones de contexto largo, mientras utiliza menos tokens de salida.

3. Los indicadores de inteligencia integral de terceros casi no han cambiado

Artificial Analysis otorga a 3.6 Flash una puntuación

cuyo índice de inteligencia es el mismo que el de 3.5 Flash. Esto respalda la opinión de que este lanzamiento se centra principalmente en mejoras de eficiencia, no en un gran salto en inteligencia bruta.

Para los desarrolladores, la pregunta correcta no es si el modelo merece una etiqueta llamativa.

La pregunta más adecuada es: si la combinación de velocidad, costo, calidad y confiabilidad es aplicable a un escenario de aplicación específico.

Gemini 3.6 Flash puede no ser adecuado para un flujo de trabajo de frontend, pero es una buena opción para agentes multimodales de alto rendimiento. Ambas situaciones no son contradictorias.

Preguntas frecuentes

¿Qué es Gemini 3.6 Flash?

Gemini 3.6 Flash es el modelo multimodal de Google orientado a entornos de producción, adecuado para programación, trabajo de conocimiento, uso de computadoras y flujos de trabajo de agentes. Admite una ventana de contexto de más de 1 millón de tokens de entrada y está disponible públicamente a través de la API de Gemini y otros productos de Google.

¿Es Gemini 3.6 Flash peor que Gemini 3.5 Flash?

En general, no. Artificial Analysis otorga a ambos la misma puntuación en el índice de inteligencia, pero Google informa que 3.6 Flash ha mejorado en múltiples evaluaciones de programación, uso de computadoras, trabajo de conocimiento y contexto largo, mientras utiliza menos tokens de salida.

¿Por qué los desarrolladores critican a Gemini 3.6 Flash?

Algunos usuarios tempranos informan que la capacidad de generación de frontend es débil, la edición de interfaz de usuario es propensa a errores y el razonamiento espacial es inconsistente. Estas son pruebas individuales, no evaluaciones de referencia controladas, por lo que los resultados pueden variar según los prompts, el código base, las herramientas y el nivel de razonamiento.

¿Cuál es el precio de Gemini 3.6 Flash?

Google fija el precio de Gemini 3.6 Flash en 1.50 USD por millón de tokens de entrada y 7.50 USD por millón de tokens de salida. Los precios pueden variar, y los desarrolladores deben consultar la documentación oficial de la API de Gemini para confirmar las tarifas actuales.

¿Qué tan rápido es Gemini 3.5 Flash-Lite?

Artificial Analysis mide que Gemini 3.5 Flash-Lite procesa aproximadamente 350 tokens de salida por segundo. Google lo diseñó para tareas de alto rendimiento y baja latencia, como procesamiento de documentos y búsqueda de agentes.

¿Qué es Gemini 3.5 Flash Cyber?

Gemini 3.5 Flash Cyber es un modelo especializado en ciberseguridad basado en Gemini 3.5 Flash. Google planea ofrecerlo a gobiernos y socios de confianza a través de CodeMender, no como un modelo de API pública general.

¿Cuándo se lanzará Gemini 3.5 Pro?

Google aún no ha anunciado una nueva fecha de lanzamiento público. La compañía indica que Gemini 3.5 Pro está en fase de pruebas con socios y se lanzará ampliamente cuando esté listo.

¿Ya está Google entrenando Gemini 4?

Sí. Google afirma haber iniciado el plan de preentrenamiento más ambicioso hasta la fecha para Gemini 4. La compañía aún no ha anunciado una fecha de lanzamiento público para Gemini 4.

Herramientas relacionadas

  • Google AI Studio: Entorno basado en navegador de Google para probar modelos Gemini y desarrollar a través de la API de Gemini.
  • API de Gemini: Documentación oficial para desarrolladores sobre las funciones, limitaciones e identificadores de modelo de Gemini 3.6 Flash.
  • Gemini: Interfaz de consumo de Google para usar los modelos Gemini actuales.
  • Vertex AI: Plataforma empresarial de Google Cloud para implementar y gestionar modelos Gemini.

CursorBench: Plataforma de evaluación de referencia de Cursor para tareas de comprensión de código, edición, depuración e ingeniería de software inteligente.

  • Artificial Analysis: Pruebas independientes de modelos que cubren nivel de inteligencia, velocidad, latencia, precios y uso de tokens.
  • CodeMender: Entorno de agente de seguridad de Google DeepMind basado en Gemini 3.5 Flash Cyber.

Enlaces relacionados

**Lanzamiento de Flash Cyber](https://deepmind.google/blog/introducing-gemini-3-5-flash-cyber/): Modelo de ciberseguridad, integración con CodeMender y especificaciones oficiales para despliegues restringidos.

Resumen

La serie Gemini que Google lanzó en julio incluye Gemini 3.6 Flash, Gemini 3.5 Flash-Lite y Gemini 3.5 Flash Cyber, mientras que Gemini 3.5 Pro aún se encuentra en fase de pruebas con socios.

Las reacciones iniciales de los desarrolladores ante Gemini 3.6 Flash en pruebas de frontend y razonamiento espacial fueron excepcionalmente negativas, y el modelo no lideró en los benchmarks de codificación más exigentes. Sin embargo, los resultados publicados por Google muestran mejoras significativas del modelo en varias tareas importantes en comparación con Gemini 3.5 Flash, y Artificial Analysis también confirmó que ofrece mejor velocidad y eficiencia manteniendo el mismo puntaje general de inteligencia.

Gemini 3.5 Flash-Lite está diseñado para tareas de alto rendimiento, mientras que Flash Cyber se enfoca en el ámbito de la seguridad defensiva, y Google ya ha iniciado el preentrenamiento de Gemini 4.

La interpretación más precisa no es que Gemini 3.6 Flash sea el "peor modelo" de Google, sino un lanzamiento centrado en la eficiencia — su recepción temprana en el mercado es mucho más compleja de lo que sugieren los benchmarks oficiales de Google.