Gemini 3.6 Flash apuesta por la eficiencia, pero pruebas independientes muestran una mejora intelectual modesta

Google ha lanzado tres nuevos modelos Gemini, dirigidos a diferentes áreas del mercado de agentes:

发布于 2026年7月22日generalGEO 评分: 05 次阅读
Imagen de portada del artículo «Gemini 3.6 Flash apuesta por la eficiencia, pero pruebas independientes muestran una mejora intelectual modesta»

Gemini 3.6 Flash apuesta por la eficiencia, pero pruebas independientes muestran una mejora intelectual modesta

Introducción

Google ha lanzado tres nuevos modelos Gemini, dirigidos a diferentes áreas del mercado de agentes:

  • Gemini 3.6 Flash, posicionado como el modelo principal para codificación, trabajo multimodal y flujos de agentes de varios pasos
  • Gemini 3.5 Flash-Lite, optimizado para cargas de trabajo de alto rendimiento y sensibles a la latencia
  • Gemini 3.5 Flash Cyber, un modelo de ciberseguridad restringido, diseñado para descubrir, verificar y reparar vulnerabilidades de software

El anuncio de Google se centra en la eficiencia. La empresa afirma que el nuevo modelo Flash puede completar tareas con menos tokens de salida, menos invocaciones de herramientas y menor sobrecarga en los bucles de ejecución. El precio también es inferior al de Gemini 3.5 Flash.

Esta afirmación está respaldada por los benchmarks internos de Google y las primeras pruebas independientes.

La cuestión más compleja es si Gemini 3.6 Flash ofrece una mejora sustancial en inteligencia en comparación con el modelo al que reemplaza.

Artificial Analysis, en su Índice de Inteligencia Integral, obtuvo la misma puntuación para el nuevo modelo que para Gemini 3.5 Flash. Los primeros usuarios también han reportado experiencias mixtas, especialmente en diseño visual, generación en chino, selección de herramientas y seguimiento de instrucciones.

El resultado no es un simple fracaso. Gemini 3.6 Flash parece ser más rápido, producir resultados más concisos y tener un menor costo por tarea completada en muchas cargas de trabajo. También ha mejorado en múltiples benchmarks de codificación, uso de ordenadores, aprendizaje automático y trabajo de conocimiento.

Pero este lanzamiento pone de manifiesto una distinción importante:

Un modelo puede volverse más eficiente sin que se produzca un aumento igualmente significativo en inteligencia general o calidad de salida subjetiva.

Esta imagen es el contenido de un tuit publicado por Google DeepMind, correspondiente a la información sobre los tres nuevos modelos Gemini mencionados en el documento, mostrando claramente el posicionamiento oficial de los tres nuevos modelos. El tuit presenta explícitamente tres modelos principales: Gemini 3.6 Flash, optimizado para eficiencia y que ofrece mayor calidad de trabajo al mismo coste; Gemini 3.5 Flash-Lite, centrado en alta relación calidad-precio y baja latencia para tareas cotidianas; y Gemini 3.5 Flash Cyber, un modelo de ciberseguridad para descubrir y reparar vulnerabilidades críticas de software. Esta imagen corrobora el contenido del documento sobre el lanzamiento por parte de Google de tres modelos Gemini dirigidos a diferentes mercados de agentes, y muestra visualmente la descripción funcional y el posicionamiento oficial de cada modelo.

Resumen de los tres nuevos modelos Gemini

Modelo Función principal Precio API por millón de tokens Nivel de pensamiento predeterminado Disponibilidad
Gemini 3.6 Flash Codificación, trabajo multimodal y flujos de trabajo complejos de agentes Entrada $1.50 / Salida $7.50 Medio Disponible de forma general
Gemini 3.5 Flash-Lite Extracción de alto volumen, búsqueda, traducción, enrutamiento y subagentes Entrada $0.30 / Salida $2.50 Mínimo Disponible de forma general
Gemini 3.5 Flash Cyber Descubrimiento, verificación y reparación de vulnerabilidades No publicado públicamente Especializado Programa piloto limitado para gobiernos y socios de confianza

Tanto Gemini 3.6 Flash como Gemini 3.5 Flash-Lite admiten:

  • Contexto de hasta 1 millón de tokens
  • Hasta 64,000 tokens de salida
  • Entrada de texto, imagen, audio y vídeo
  • Salida de texto
  • Niveles de pensamiento configurables
  • Herramientas integradas, incluido el uso de ordenador
  • Acceso a través de la API de Gemini y Google AI Studio

La ficha del modelo de Google indica que la fecha de corte de conocimiento de ambos modelos disponibles de forma general es marzo de 2026.

Gemini 3.6 Flash: Menos tokens y menor coste por tarea

Gemini 3.6 Flash se basa en

Gemini 3.5 Flash y está diseñado para reemplazarlo en muchas cargas de trabajo de codificación, trabajo de conocimiento, multimodal y de agentes.

La mejora más consistente es la eficiencia.

Google informa que, en el Índice de Análisis de Inteligencia Artificial, Gemini 3.6 Flash utiliza un 17% menos de tokens de salida que Gemini 3.5 Flash. En algunas evaluaciones de codificación de agentes (incluyendo DeepSWE), Google observó reducciones de tokens de salida de hasta el 65%.

El modelo también tiende a utilizar:

  • Menos pasos de razonamiento
  • Menos invocaciones de herramientas
  • Bucles de ejecución más cortos
  • Menos cambios de código innecesarios
  • Resultados finales más concisos

Estos cambios son importantes porque el coste de un agente no depende solo del precio por token publicado.

Un agente de larga duración puede invocar el modelo repetidamente, enviar grandes definiciones de herramientas, comprobar archivos, ejecutar código, recuperarse de fallos y generar grandes cantidades de salida de razonamiento. Incluso si el precio por token cambia poco, reducir el número de rondas de invocación y la cantidad de tokens reduce el coste total.

Precios de Gemini 3.6 Flash

Google enumera los siguientes precios de API:

Tipo de token Gemini 3.6 Flash Gemini 3.5 Flash
Entrada 1.50 USD por cada millón de tokens 1.50 USD por cada millón de tokens
Salida 7.50 USD por cada millón de tokens 9.00 USD por cada millón de tokens

El precio de entrada se mantiene sin cambios, mientras que el precio de salida ha bajado aproximadamente un 16.7%.

En su configuración de evaluación, Artificial Analysis midió un coste medio por tarea de aproximadamente 0.50 USD para Gemini 3.6 Flash, frente a 0.59 USD para Gemini 3.5 Flash. Esto representa una reducción de aproximadamente el 18%, debido a la reducción del precio de salida y a la menor generación de tokens.

Estas cifras deben considerarse específicas de cada carga de trabajo y no universalmente aplicables. El coste real depende de:

  • Tamaño del prompt
  • Nivel de pensamiento
  • Longitud de la salida
  • Rondas de invocación
  • Uso de herramientas
  • Caché de contexto
  • Comportamiento de reintento
  • Tipo de framework de agente
  • Si la aplicación envía la conversación completa en cada ronda

Velocidad de finalización más rápida, no solo generación de tokens más rápida

Artificial Analysis informa que el tiempo medio por tarea de Gemini 3.6 Flash es de aproximadamente 1.3 minutos, frente a los aproximadamente 2.7 minutos de Gemini 3.5 Flash.

Esta mejora proviene de una salida más rápida y un proceso de razonamiento más económico.

Un modelo que genera tokens rápidamente puede tardar mucho tiempo si se queda atrapado en bucles repetitivos de invocación de herramientas. Por el contrario, un modelo ligeramente más lento puede terminar antes si encuentra la solución correcta con menos invocaciones.

Para los desarrolladores de agentes, el tiempo necesario por tarea completada suele ser más útil que la velocidad bruta de tokens por segundo.

Codificación, aprendizaje automático, uso de ordenadores y trabajo de conocimiento

Google informa de mejoras en varias categorías de benchmarks.

Codificación e ingeniería de software

En DeepSWE, Gemini 3.6 Flash mejoró su resultado del 37% al 49% en comparación con Gemini 3.5 Flash.

Google afirma que el modelo:

  • Produce menos ediciones no deseadas
  • Utiliza bucles de depuración más cortos
  • Sigue más estrictamente el ámbito requerido
  • Genera código más cercano al nivel de producción
  • Tiende a verificar el proyecto mediante programación antes de realizar cambios

Existe un compromiso con este último punto.

La guía para desarrolladores de Google señala que Gemini 3.6 Flash puede ejecutar scripts de diagnóstico antes de editar, lo que puede mejorar la precisión en tareas complejas. Pero en trabajos frontend sencillos, esos pasos exploratorios adicionales

pueden aumentar la latencia sin mejorar siempre los resultados.

Google también ha indicado que, en ocasiones, los evaluadores humanos prefieren la disposición visual y el estilo de modelos anteriores, incluso cuando Gemini 3.6 Flash genera código más funcional. Por lo tanto, los desarrolladores que crean interfaces pueden necesitar proporcionar restricciones de diseño visual más claras.

Investigación en aprendizaje automático

En MLE-Bench, Google reporta una mejora del 49,7 % al 63,9 %.

Esta evaluación se centra en tareas reales de ingeniería e investigación en aprendizaje automático, no en problemas de codificación aislados. Esta mejora indica que el modelo rinde mejor en flujos de trabajo que requieren experimentación, procesamiento de datos, implementación y mejoras iterativas.

Capacidad de uso informático

En OSWorld-Verified, según la comparativa publicada por Google, Gemini 3.6 Flash pasa del 78,4 % al 83,0 %.

La capacidad de uso informático ya está disponible como herramienta cliente integrada a través de la API de Gemini y Gemini Enterprise. Permite que los sistemas agentes interactúen con interfaces gráficas, no solo mediante APIs directas.

Los resultados de las pruebas de referencia sobre capacidad de uso informático siguen viéndose afectados por el marco del agente, el entorno de pantalla, el diseño de las tareas y las estrategias de recuperación ante fallos. Una puntuación más alta es beneficiosa, pero los sistemas en producción aún requieren permisos estrictos y pasos de confirmación para operaciones importantes.

Trabajo de conocimiento

En GDPval-AA v2, Gemini 3.6 Flash pasa de 1349 a 1421.

Google destaca los siguientes escenarios de aplicación:

  • Análisis de documentos
  • Interpretación de gráficos
  • Análisis de datos financieros
  • Redacción de informes
  • Análisis de grabaciones
  • Migración de código
  • Flujos de trabajo de investigación multimodal

Clientes como Figma, Harvey, Hebbia y JetBrains han proporcionado valoraciones positivas para el anuncio de lanzamiento de Google. Estos testimonios reflejan la experiencia del cliente y no deben considerarse puntos de referencia independientes.

Fecha de corte de conocimiento y ventana de contexto

Gemini 3.6 Flash admite una ventana de contexto de hasta 1 millón de tokens y una salida máxima de 64 000 tokens.

Su ficha de modelo indica una fecha de corte de conocimiento de marzo de 2026, una mejora respecto a versiones anteriores de Gemini (cuyas fechas de corte eran significativamente más antiguas).

Una fecha de corte más reciente reduce la cantidad de información contextual reciente básica que los desarrolladores deben proporcionar manualmente. Sin embargo, esto no garantiza que el modelo pueda manejar de forma fiable noticias actuales, precios en tiempo real, leyes cambiantes, lanzamientos de software u otra información temporal.

Las aplicaciones que manejan información nueva deben seguir utilizando recuperación, búsqueda, bases de datos verificadas o llamadas a herramientas.

Una ventana de contexto grande tampoco garantiza que el modelo pueda utilizar eficazmente todas las partes de un documento extenso por igual. Los desarrolladores deben probar:

  • La precisión de la recuperación en partes distantes
  • La coherencia en conversaciones largas
  • Si las reglas clave se mantienen vigentes
  • El rendimiento cuando se incluye material irrelevante
  • El coste y la latencia con la longitud de contexto real

Actualizaciones de seguridad en Gemini 3.6 Flash

Google afirma que Gemini 3.6 Flash incluye medidas de seguridad fronteriza más sólidas contra:

  • Abusos químicos, biológicos, radiológicos y nucleares
  • Abusos de ciberseguridad
  • Resistencia a ataques de jailbreak

El informe de la ficha del modelo muestra una mejora en los resultados automáticos de seguridad multilingüe y de contenido en comparación con Gemini 3.5 Flash, manteniendo al mismo tiempo una tasa de rechazo injustificado relativamente baja.

Google también señala

varias limitaciones:

  • El modelo puede alucinar.
  • Ocasionalmente se producen respuestas lentas o tiempos de espera.
  • Algunas pruebas internas muestran un ligero retroceso en el tono.
  • La protección contra jailbreak sigue siendo un área de mejora continua.

La evaluación de seguridad fronteriza de Google concluye que Gemini 3.6 Flash aún se encuentra por debajo del nivel crítico de capacidad establecido por la empresa, incluido el umbral de ciberseguridad.

Esta conclusión se basa en el marco de evaluación de Google y debe interpretarse junto con los resultados de pruebas de seguridad independientes que puedan obtenerse posteriormente.

Gemini 3.5 Flash-Lite: Opción de alto rendimiento

Gemini 3.5 Flash-Lite está diseñado para tareas que priorizan la velocidad, el rendimiento y el coste sobre la máxima profundidad de razonamiento.

Los casos de uso típicos incluyen:

  • Extracción de documentos
  • Clasificación
  • Búsqueda
  • Traducción
  • Enrutamiento de datos
  • Generación de JSON estructurado
  • Procesamiento de recibos
  • Análisis de datos de comercio electrónico
  • Ejecución de subtareas de alto volumen

Google lo describe como el modelo más rápido y de menor coste de la serie Gemini 3.5.

Precios de Gemini 3.5 Flash-Lite

Tipo de token Precio por millón de tokens
Entrada 0,30 USD
Salida 2,50 USD

Su nivel de pensamiento predeterminado es mínimo, priorizando el rendimiento y la baja latencia.

Para subtareas autónomas, ejecución de código, llamadas a herramientas o planificación de varios pasos, Google recomienda aumentar el nivel de pensamiento a medio o alto cuando sea necesario. Una configuración más alta mejora la tasa de finalización de tareas, pero generalmente aumenta el uso de tokens y la latencia.

Velocidad

El anuncio de Google cita datos de Artificial Analysis, que en pruebas previas al lanzamiento midió aproximadamente 350 tokens de salida por segundo.

Posteriormente, Artificial Analysis registró velocidades de proveedor específicas que pueden variar con el tiempo. El rendimiento depende de:

  • La capacidad del proveedor
  • El tamaño de la solicitud
  • La configuración de inferencia
  • La longitud de la salida
  • El enrutamiento regional
  • La demanda actual
  • Si la prueba mide la salida visible o la inferencia oculta

La conclusión estable es que Flash-Lite está diseñado para ser significativamente más rápido que el modelo Flash más grande.

Mejoras en los puntos de referencia

Google reporta las siguientes mejoras en comparación con Gemini 3.1 Flash-Lite:

Punto de referencia Gemini 3.1 Flash-Lite Gemini 3.5 Flash-Lite
Terminal-Bench 2.1 31 % 54 %
GDM-MRCR v2 60,1 % 72,2 %
GDPval-AA v2 642 1140

Google también informa que Gemini 3.5 Flash-Lite supera a Gemini 3 Flash en varios puntos de referencia de agentes y codificación:

  • SWE-Bench Pro: 54,2 % frente a 49,6 %
  • OSWorld-Verified: 74,0 % frente a 65,1 %

Esto convierte a Flash-Lite en algo más que un modelo económico de baja calidad. Para ciertas tareas de agente de alto rendimiento y alcance limitado, puede ofrecer un mejor equilibrio que el antiguo Gemini 3 Flash.

Mejora intelectual independiente

Artificial Analysis otorga a Gemini 3.5 Flash-Lite una puntuación de 36 en su índice de inteligencia, superior a los 25 puntos de Gemini 3.1 Flash-Lite.

Esta mejora de 11 puntos es uno de los incrementos de inteligencia más notables de este lanzamiento.

Flash-Lite sigue estando por debajo de los modelos fronterizos más potentes, pero su objetivo no es competir con ellos en todas las tareas complejas de razonamiento. Su función es procesar grandes volúmenes de trabajo de forma rápida y económica.

Gemini 3.5 Flash Cyber: Modelo de seguridad restringido

El tercer lanzamiento, Gemini 3.5 Flash

Cyber, tiene un propósito diferente.

Es un modelo especializado basado en Gemini 3.5 Flash, ajustado para:

  • Encontrar vulnerabilidades de software
  • Verificar si las vulnerabilidades son reales
  • Rastrear las rutas de código relevantes
  • Proponer parches
  • Apoyar el escaneo iterativo
  • Analizar grandes bases de código a un coste menor que los modelos de ciberseguridad de gran tamaño

El modelo trabaja en conjunto con CodeMender, el agente de seguridad de código de Google DeepMind.

En CodeMender, múltiples agentes Flash Cyber pueden buscar en diferentes partes de la base de código y consolidar sus hallazgos en un solo informe.

Google considera que, en el ámbito de la ciberseguridad, el uso de modelos más pequeños y económicos tiene valor, ya que la investigación de vulnerabilidades a menudo requiere explorar muchas rutas de ejecución posibles. Llamar repetidamente a modelos grandes y costosos puede convertirse en un cuello de botella.

Rendimiento en CyberGym

Google afirma que, cuando se utiliza a través del sistema CodeMender, Gemini 3.5 Flash Cyber alcanza un rendimiento competitivo a nivel fronterizo en CyberGym.

Este resultado depende de la infraestructura completa del agente, no solo del modelo subyacente. La orquestación, las herramientas, la verificación y la agregación de informes contribuyen a la puntuación final.

Disponibilidad limitada

Gemini 3.5 Flash Cyber no estará disponible a través de canales públicos

La API de Gemini está ampliamente disponible.

Google planea ofrecerla a través de un programa piloto limitado llamado CodeMender a los siguientes destinatarios:

  • Agencias gubernamentales
  • Socios de confianza
  • Equipos de seguridad de primera línea de defensa

Este lanzamiento limitado refleja la naturaleza de doble uso del modelo. Un sistema capaz de encontrar y verificar vulnerabilidades puede ayudar a los defensores a parchear software, pero una capacidad similar también podría respaldar actividades ofensivas.

La imagen muestra la interfaz de Google Gemini 3.6 Flash. En la parte superior hay un cuadro de entrada "Pregunta a Gemini", con la etiqueta "Flash" a la derecha y un ícono de micrófono. Un menú desplegable debajo muestra tres opciones: 3.6 Flash (ayuda integral), 3.6 Thinking (resolver problemas complejos), 3.1 Pro (matemáticas avanzadas y código). Esta imagen está relacionada con el contenido del documento que presenta Gemini 3.6 Flash, mostrando visualmente su interfaz y las versiones del modelo disponibles, ayudando a los usuarios a comprender su posicionamiento funcional.

¿Dónde está Gemini 3.5 Pro?

Google afirma que Gemini 3.5 Pro está siendo probado con socios y se lanzará de manera más amplia cuando esté listo.

El artículo fuente de AIBase vincula este retraso con informes externos y rumores en línea sobre el rendimiento de codificación y un posible reentrenamiento.

Google no ha confirmado públicamente si el plan de entrenamiento original del modelo fue abandonado o si el sistema se reinició desde cero.

La información verificada es limitada:

  • Gemini 3.5 Pro aún se encuentra en fase de pruebas con socios.
  • Google no ha anunciado una fecha de lanzamiento general.
  • La compañía ha iniciado lo que llama la ejecución de preentrenamiento más ambiciosa de Gemini 4.
  • Google afirma sentirse alentada por el progreso del modelo de próxima generación.

La ausencia de la versión Pro insignia hace que el lanzamiento de Flash sea estratégicamente más importante. Hasta que el modelo de gama alta esté disponible, Gemini 3.6 Flash y Flash-Lite deben cubrir una mayor proporción de las necesidades de producción.

Esto no significa necesariamente que Google haya abandonado Gemini 3.5 Pro, o que Gemini 4 esté a punto de llegar.

Los cronogramas de desarrollo de modelos pueden cambiar, y el preentrenamiento es solo una fase. El post-entrenamiento, las pruebas de seguridad, la integración de herramientas, la optimización de latencia y la preparación para el despliegue pueden requerir mucho tiempo adicional.

Pruebas independientes:

Mejora de eficiencia mayor que salto de inteligencia

Las conclusiones del análisis humano son más comedidas que los anuncios de productos de Google.

Índice de inteligencia

Gemini 3.6 Flash obtuvo una puntuación de 50 puntos en el índice de inteligencia del análisis humano.

Gemini 3.5 Flash también obtuvo 50 puntos.

Por lo tanto, aunque la evaluación muestra mejoras en algunas categorías, la puntuación general de inteligencia del nuevo modelo no aumentó en esta prueba.

El informe del análisis humano señala:

  • Puntuación más alta en GDPval-AA v2
  • Ligero retroceso en el examen final humano
  • Nivel de inteligencia general similar
  • Menor uso de tokens de salida
  • Mayor velocidad de finalización de tareas
  • Menor costo por tarea

Se trata de una actualización de eficiencia creíble, pero no de un salto de inteligencia generalizado.

Tiempo por tarea

El análisis humano midió:

  • Gemini 3.5 Flash: aproximadamente 2.7 minutos
  • Gemini 3.6 Flash: aproximadamente 1.3 minutos

El modelo redujo a más de la mitad el tiempo para completar la carga de trabajo de evaluación.

Costo por tarea

Estimación del análisis humano:

  • Gemini 3.5 Flash: aproximadamente 0.59 USD por tarea
  • Gemini 3.6 Flash: aproximadamente 0.50 USD por tarea

Para agentes inteligentes a gran escala, esta reducción de costos es significativa, especialmente cuando el sistema ejecuta miles de tareas.

Los benchmarks no deben considerarse rankings universales

El análisis humano combina múltiples evaluaciones en un solo índice. La puntuación compuesta puede usarse para comparaciones aproximadas, pero podría ocultar diferencias significativas entre diferentes cargas de trabajo.

Modelos con la misma puntuación total pueden ser superiores en ciertos aspectos, como:

  • Programación
  • Procesamiento de documentos multimodales
  • Operaciones informáticas
  • Agentes sensibles a la velocidad
  • Extracción de contexto largo

Pero pueden ser más débiles en:

  • Razonamiento abstracto difícil
  • Diseño de estilo visual
  • Procesamiento de idiomas específicos
  • Generación creativa
  • Tareas que requieren planificación profunda

Elegir el modelo correcto depende del escenario de aplicación específico.

Por qué los primeros comentarios de usuarios son más negativos

El artículo original recopiló varias reacciones críticas de redes sociales.

Las quejas de los usuarios incluyen:

  • Elección de vocabulario en chino poco natural
  • Mala consistencia de la memoria
  • Errores en la selección de herramientas
  • Diseño de estilo visual deficiente
  • Disminución de la calidad de las texturas generadas en juegos
  • Desajuste entre instrucciones y salida visual
  • Limitaciones de uso
  • Sin mejora notable en la inteligencia general

Estos comentarios son importantes porque los benchmarks no pueden cubrir todos los aspectos de la calidad del producto.

Un modelo puede rendir excelentemente en tareas de repositorio de código, pero tener un rendimiento deficiente en la generación de diseños; puede usar menos tokens pero volverse demasiado conciso; puede ser más preciso en un benchmark de programación, pero menos confiable en un idioma específico.

Al mismo tiempo, las pruebas en redes sociales tienen limitaciones graves:

  • Los prompts no siempre son públicos
  • La configuración del modelo puede variar
  • Los usuarios pueden comparar diferentes interfaces de producto
  • Las versiones de vista previa y la API pueden usar configuraciones diferentes
  • La disponibilidad de herramientas puede afectar los resultados
  • Un solo caso de fallo no prueba una regresión general
  • Las críticas virales a menudo amplifican los peores casos de fallo

Por lo tanto, los comentarios de los primeros usuarios deben considerarse como señales para pruebas específicas, no como veredictos finales.

Marco de evaluación práctico

Los equipos que consideren adoptar Gemini 3.6 Flash no deberían hacerlo solo porque Google

reporte benchmarks más altos, ni rechazarlo solo porque algunas demostraciones en línea hayan sido decepcionantes.

Una prueba de migración útil debería comparar el modelo nuevo y el antiguo en la misma aplicación.

1. Usar tareas representativas

Construir un conjunto de evaluación a partir del trabajo real:

  • Repositorios de código reales
  • Documentos auténticos
  • Llamadas a herramientas típicas
  • Solicitudes de usuario comunes
  • Casos de fallo conocidos
  • Prompts multilingües
  • Ejemplos de contexto largo

2. Medir la finalización de tareas, no solo la calidad de la salida

Rastrear:

  • Tasa de éxito de tareas
  • Número de llamadas a herramientas
  • Número de reintentos
  • Cambios no deseados en archivos
  • Tiempo de corrección manual
  • Latencia
  • Número de tokens de salida
  • Costo total
  • Gravedad del fallo

3. Probar diferentes niveles de pensamiento

Gemini 3.6 Flash tiene por defecto un nivel de pensamiento medio.

Gemini 3.5 Flash-Lite tiene por defecto un nivel de pensamiento mínimo.

Un modelo puede parecer con poca capacidad simplemente porque la configuración de razonamiento es demasiado baja para la tarea actual. Por el contrario, usar un nivel de pensamiento alto para una tarea simple de extracción de información puede desperdiciar tiempo y dinero.

4. Evaluar la calidad visual y lingüística por separado

Los benchmarks de codificación no miden si un sitio web se ve bien o si la redacción en chino es natural.

Se debe usar revisión humana especializada para evaluar:

  • Jerarquía visual
  • Consistencia de marca
  • Tono y estilo
  • Calidad de traducción
  • Adecuación cultural
  • Seguimiento de instrucciones

5. Probar la pila de agente completa

El resultado de un agente no depende únicamente del modelo.

Comparar:

  • Definiciones de herramientas
  • Estructura de prompts
  • Estrategias de memoria
  • Caché de contexto
  • Reglas de reintento
  • Límites de aprobación
  • Entorno de navegador o computadora
  • Marco de orquestación

La migración de modelo puede requerir ajustes correspondientes en todo el entorno del sistema.

¿Qué modelo deberían elegir los desarrolladores?

Elige Gemini 3.6 Flash cuando:

  • La tarea requiere razonamiento de múltiples pasos.
  • La calidad del código es crucial.
  • El agente usa múltiples herramientas.
  • La carga de trabajo incluye imágenes, gráficos, videos o documentos grandes.
  • Se necesita la funcionalidad de control informático (Computer Use).
  • Menos rondas y menor latencia de tarea son valiosos.
  • Gemini 3.5 Flash está disponible actualmente pero es demasiado verboso o costoso.

Elige Gemini 3.5 Flash-Lite cuando:

  • El rendimiento es la prioridad principal.
  • El trabajo involucra extracción de información, clasificación, traducción o enrutamiento.
  • Muchos subagentes se ejecutan en paralelo.

La aplicación necesita procesar grandes volúmenes de documentos.

  • Busca un precio bajo por token.
  • Las tareas complejas pueden delegarse a un modelo principal más potente.

Solo para usar Gemini 3.5 Flash Cyber con acceso aprobado:

  • La organización forma parte del programa piloto limitado de Google.
  • La carga de trabajo corresponde a ciberseguridad defensiva.
  • Los hallazgos de vulnerabilidades se verifican antes de tomar medidas.
  • Los repositorios sensibles se gestionan con permisos estrictos.
  • La organización puede manejar riesgos de doble uso.

La gran lección del lanzamiento de la versión Flash

Es más fácil entender Gemini 3.6 Flash como una mejora operativa que como un avance drástico en inteligencia.

Está diseñado para reducir los desperdicios que encarecen los agentes:

  • Razonamiento excesivo
  • Llamadas repetitivas a herramientas
  • Salidas verbosas
  • Bucles de depuración
  • Ediciones de código innecesarias
  • Finalización lenta de tareas

Estas mejoras pueden tener más valor en entornos de producción que pequeños avances en benchmarks abstractos de razonamiento.

Sin embargo, la eficiencia no reemplaza la calidad en todas las aplicaciones.

Un modelo que realiza tareas a bajo costo es inútil si sus resultados requieren mucho trabajo manual de corrección. Un modelo con alta puntuación en programación puede decepcionar en diseño. Un modelo fuerte en inglés puede necesitar verificación adicional en chino u otros idiomas.

La nueva serie Flash de Google crea opciones más especializadas:

  • 3.6 Flash: para trabajos de agente más potentes
  • 3.5 Flash-Lite: para escalado masivo
  • Flash Cyber: para uso controlado en seguridad

Por lo tanto, este lanzamiento no se trata de que un modelo reemplace a todos los demás, sino de asignar el nivel adecuado de inteligencia y coste a cada parte del sistema de agentes.

Preguntas frecuentes

¿Qué es Gemini 3.6 Flash?

Gemini 3.6 Flash es el modelo generalista de Google para programación, tareas multimodales, trabajo de conocimiento y flujos de trabajo con agentes. Se basa en Gemini 3.5 Flash, pero está diseñado para usar menos tokens, menos rondas de interacción y menos llamadas a herramientas.

¿Es Gemini 3.6 Flash más inteligente que Gemini 3.5 Flash?

Google informa mejoras en varios benchmarks de programación, uso de computadoras, aprendizaje automático y trabajo de conocimiento. Artificial Analysis asigna a ambos modelos la misma puntuación general de índice de inteligencia, 50, por lo que la mejora más evidente parece estar en la eficiencia y la velocidad de finalización de tareas, más que en un aumento general de la inteligencia.

¿Cuánto cuesta Gemini 3.6 Flash?

Google ha fijado el precio del modelo en 1,50 USD por millón de tokens de entrada y 7,50 USD por millón de tokens de salida. Los precios pueden cambiar, y el coste total de un agente también depende del razonamiento, el tamaño del contexto, las llamadas a herramientas, los reintentos y la longitud de la salida.

¿Para qué sirve Gemini 3.5 Flash-Lite?

Flash-Lite es adecuado para cargas de trabajo de alto rendimiento y baja latencia, como extracción, clasificación, búsqueda, traducción, enrutamiento, procesamiento de datos estructurados y ejecución de subagentes. Es más barato y rápido que Gemini 3.6 Flash, pero no está diseñado para reemplazar a modelos más potentes en todas las tareas difíciles.

¿Gemini 3.6 Flash admite imágenes y vídeo?

Sí. Su ficha técnica indica soporte para entrada de texto, imágenes, audio y vídeo, con salida de texto. La ventana de contexto del modelo es de hasta 1 millón de tokens.

¿Qué es Gemini 3.5 Flash Cyber?

Es una versión especializada de Gemini 3.5 Flash, entrenada para descubrimiento, verificación y reparación de vulnerabilidades. Google planea ofrecerlo a gobiernos y socios de defensa de confianza a través de un programa piloto restringido llamado CodeMender.

¿Se ha cancelado Gemini 3.5 Pro?

Google no ha indicado que esté cancelado. La compañía afirma que Gemini 3.5 Pro está en pruebas con socios y estará ampliamente disponible cuando esté listo.

¿Debo migrar inmediatamente desde Gemini 3.5 Flash?

No necesariamente. Antes de cambiar, ejecuta ambos modelos en tareas representativas de producción y compara la tasa de éxito, el tiempo de corrección manual, la fiabilidad de las herramientas, la latencia, el uso de tokens y el coste total.

Herramientas relacionadas

  • Google AI Studio: entorno basado en navegador de Google para probar modelos Gemini, indicaciones, herramientas y configuraciones de API.
  • API de Gemini: API oficial para integrar modelos Gemini en aplicaciones y flujos de trabajo de agentes.
  • Aplicación Gemini: interfaz de consumo de Google para usar directamente los modelos Gemini.

Antigravity (enlace: https://antigravity.google/): entorno de desarrollo de agentes de Google, con Gemini 3.6 Flash integrado para flujos de trabajo de codificación.

Enlaces relacionados

Resumen

La última versión Flash de Google incluye tres productos independientes. Gemini 3.6 Flash está orientado a agentes complejos y escenarios de codificación, Gemini 3.5 Flash-Lite se centra en ejecución de alto rendimiento y Gemini 3.5 Flash Cyber está diseñado para casos de uso de ciberseguridad controlada. Esta actualización no se trata de que un único modelo lo haga todo, sino de asignar el nivel adecuado de inteligencia y coste a cada parte del flujo de trabajo del agente.

Gemini 3.5 Flash Cyber se centra en la investigación defensiva de vulnerabilidades bajo acceso restringido.

Gemini 3.6 Flash ha mejorado varias pruebas de referencia a nivel de tareas, reduciendo el uso de tokens de salida, acelerando la finalización de tareas de agentes y reduciendo el precio de las salidas. Sin embargo, pruebas independientes descubrieron que su puntuación general de inteligencia no ha mejorado en comparación con Gemini 3.5 Flash.

Por lo tanto, la reacción compleja del mercado es comprensible. Este lanzamiento demuestra más un sólido argumento en términos de eficiencia que un salto en capacidad general.

La mejor evaluación de Gemini 3.6 Flash es: es un modelo de producción más rápido y optimizado, no una prueba de que todas las formas de inteligencia o calidad de salida hayan mejorado de forma sincronizada.