GPT-5.6 de OpenAI, Agente Múltiple V2 y experiencia ChatGPT 16 veces más rápida
OpenAI está realizando cambios en dos frentes simultáneamente. Primero, la interfaz de ChatGPT ha sido optimizada significativamente para abordar el problema de las conversaciones largas que son difíciles de abrir y navegar.

El GPT-5.6 Multiagente V2 de OpenAI y una experiencia de ChatGPT 16 veces más rápida
Introducción
OpenAI está evolucionando simultáneamente en dos frentes.
En primer lugar, el frontend de ChatGPT ha experimentado una optimización importante, dirigida específicamente a esas conversaciones largas que se volvían difíciles de abrir y navegar después de cientos de llamadas a herramientas. Según informa el artículo fuente, en una sesión de prueba que contenía 741 turnos de conversación y 231 MB de datos, el tiempo de apertura se redujo de 27,62 segundos a 1,66 segundos.
En segundo lugar, Codex ha pasado a un flujo de trabajo multiagente más automatizado, adoptando el GPT-5.6 Multiagente V2. Ya no se exige al usuario elegir manualmente el mejor modelo para cada subtarea; el agente principal puede delegar diferentes partes del trabajo en distintos modelos y establecer de forma independiente la intensidad de razonamiento.
La documentación oficial de GPT-5.6 de OpenAI confirma una arquitectura más amplia: GPT-5.6 incluye Sol, Terra y Luna, y su experiencia Codex/API admite subagentes paralelos y el procesamiento integral de trabajos complejos.
El resultado es una idea simple pero de gran alcance:
El sistema está intentando eliminar el trabajo de espera y de selección de modelos que los usuarios normalmente tienen que gestionar por sí mismos.
La apertura de conversaciones extensas en ChatGPT es ahora mucho más rápida
En la era de los agentes, las conversaciones largas se han convertido en un problema de naturaleza muy distinta.
Una conversación típica de chatbot puede contener unas pocas docenas de turnos. En cambio, una sesión de agente puede crecer fácilmente, ya que el modelo puede leer código, llamar a herramientas, comprobar resultados, ejecutar pruebas, realizar modificaciones y repetir este proceso cientos de veces.
Según el artículo fuente, OpenAI probó una sesión con 741 turnos de conversación y un peso de 231 MB para medir el comportamiento del nuevo frontend.
Los resultados fueron notables:
| Métrica | Antes de la optimización | Después de la optimización |
|---|---|---|
| Tiempo de apertura de la conversación | 27,62 segundos | 1,66 segundos |
| Crecimiento de memoria | 1030,7 MiB | 606 MiB |
| Número de solicitudes de red | 894 | 16 |
| Entradas de conversación cargadas | 15.529 | 64 |
Según el artículo fuente, los principales cambios de rendimiento incluyen:
- Velocidad de carga de la aplicación un 94 % mayor
- Reducción del 87,8 % en el crecimiento de la memoria heap
- Reducción del 41,2 % en el uso total de memoria
- Reducción del 98,2 % en las solicitudes de red
- Reducción del 99,6 % en las entradas de conversación cargadas
Este cambio importante es a nivel de arquitectura, no un simple retoque superficial.
ChatGPT ya no necesita cargar y renderizar todo el historial de la conversación cada vez que el usuario la abre.
En su lugar, la mayor parte del historial puede permanecer almacenada, y solo la parte que se necesita en ese momento se carga en la interfaz.
Por qué esto es aún más importante en la era de los agentes
Para los chatbots tradicionales, las conversaciones extremadamente largas eran principalmente un problema de almacenamiento.
Para los agentes, se convierten en un problema de flujo de trabajo.
Una sesión típica de codificación puede implicar:
- Leer un repositorio de código grande.
- Ejecutar comandos.
- Comprobar los resultados de salida.
- Editar archivos.
- Ejecutar pruebas.
- Corregir fallos.
- Repetir el ciclo.
Una sola tarea puede generar fácilmente cientos de registros de interacción.
Esto significa que la propia interfaz de conversación se convierte en parte de la infraestructura del agente.
El artículo fuente describe la nueva estrategia de renderizado como: cargar solo la parte del historial que el usuario necesita ver, en lugar de reconstruir toda la sesión.
Por eso una optimización del frontend que hace un año parecía trivial, ahora tiene un impacto enorme.
Esa es la diferencia ahora.
Resultado: las sesiones largas se sienten mucho más ligeras
El beneficio más evidente es sencillo.
Una conversación que ha durado semanas o meses no debería hacer sentir, al abrirla, que la aplicación está reconstruyendo toda una base de datos en el navegador.
El artículo original señala que estos cambios son especialmente notables para los usuarios intensivos de Codex que realizan cientos de llamadas a herramientas con frecuencia.
En lugar de esperar a que la voluminosa sesión se vuelva interactiva, el usuario puede volver rápidamente a la conversación y continuar trabajando.
Es una mejora a nivel de infraestructura que, cuando funciona bien, el usuario apenas percibe.
Y esa es precisamente la clave.
Las mejores optimizaciones del frontend suelen ser aquellas que se integran en la experiencia del producto hasta pasar completamente desapercibidas.
GPT-5.6 Multiagente V2 avanza hacia la selección automática de modelos
Casi al mismo tiempo, OpenAI también ha ampliado su flujo de trabajo multiagente.
Según el artículo original, el GPT-5.6 Multiagente V2 ya está totalmente disponible y permite que el agente principal delegue subtareas en diferentes modelos compatibles.
Cada subagente puede tener su propia intensidad de razonamiento.
La documentación oficial de GPT-5.6 de OpenAI confirma de forma independiente que la serie incluye tres niveles de capacidad:
- GPT-5.6 Sol — el modelo principal para las tareas más difíciles.
- GPT-5.6 Terra — un modelo equilibrado para el trabajo cotidiano.
- GPT-5.6 Luna — el modelo más rápido y rentable.
OpenAI también documenta multiagente como una función en fase de pruebas en la API de Responses, donde una instancia de GPT-5.6 puede coordinar en paralelo múltiples subagentes y sintetizar sus resultados.
Esa es la idea central detrás del nuevo flujo de trabajo.
El usuario no tiene por qué saber qué modelo es el más adecuado para cada pequeña parte de una tarea grande.
El agente puede decidirlo por sí mismo.
La gama de modelos está diseñada para diferentes tareas
El artículo original muestra aproximadamente la gama de modelos de la siguiente manera:
| Modelo | Rol típico |
|---|---|
| GPT-5.6 Sol | Codificación de agentes complejos y tareas de razonamiento más difíciles |
| GPT-5.6 Terra | Programación cotidiana y cargas de trabajo equilibradas |
| GPT-5.6 Luna | Subtareas rápidas y de bajo costo |
| Daybreak | Tareas centradas en ciberseguridad |
| GPT-5.5 | Codificación compleja, investigación y tareas generales |
La documentación pública oficial de OpenAI confirma los tres primeros niveles de GPT-5.6 y destaca sus diferentes capacidades y características de costo.
Por ejemplo, OpenAI describe actualmente a Luna como su modelo optimizado para cargas de trabajo sensibles al costo y de alto rendimiento, con un precio público actual en la página del modelo de 1 dólar por millón de tokens de entrada y 6 dólares por millón de tokens de salida.
Esto crea una división natural del trabajo.
Las decisiones arquitectónicas difíciles pueden asignarse al modelo más potente.
Las transformaciones de código rutinarias pueden asignarse al modelo más barato.
Los pasos pequeños de clasificación o búsqueda pueden usar la opción más rápida.
De la selección manual de modelos al enrutamiento automático
El artículo original describe esto como una transición desde la selección manual de modelos.
Hoy en día, los usuarios suelen pensar así:
"Esta parte es difícil, así que debería usar el modelo más potente."
Y luego repiten la misma decisión en la siguiente parte de la tarea.
Un sistema multiagente, en cambio, puede tratar a los modelos como recursos computacionales internos.
El agente principal descompone el trabajo en unidades más pequeñas, decide qué
modelo debe encargarse de cada unidad y luego combina los resultados.
El flujo de trabajo simplificado es el siguiente:
Tarea del usuario
↓
Agente principal
├── Planificación compleja → GPT-5.6 Sol
├── Codificación rutinaria → GPT-5.6 Terra
├── Subtareas rápidas → GPT-5.6 Luna
└── Tareas especializadas → Modelos dedicados
↓
Síntesis de resultados
↓
Respuesta final
La documentación oficial de OpenAI describe con claridad este patrón de subagentes paralelos: una instancia de GPT-5.6 puede coordinar múltiples agentes que trabajan en paralelo y fusionar las salidas en un único resultado.
Por qué esto puede reducir el costo de razonamiento
El artículo fuente plantea una observación económica sencilla.
Las tareas complejas no requieren que cada paso utilice el modelo más potente.
Quizás solo las fases de planificación, arquitectura o depuración difícil necesiten el modelo más fuerte.
El resto de los pasos pueden ser gestionados por modelos más baratos.
En el ejemplo del artículo fuente, quizás solo alrededor del 20 % del flujo de trabajo necesita el modelo más potente, mientras que el resto se delega en modelos de bajo costo.
Ese 20 % exacto debe considerarse una ilustración de una regla empírica, no una garantía de OpenAI.
La idea central sigue siendo importante.
Si el agente puede enrutar el trabajo automáticamente según la dificultad, el costo promedio de completar tareas complejas puede disminuir, sin que el usuario tenga que gestionar manualmente el enrutamiento.
Los desarrolladores ya no tienen que pensar en cada modelo
El cambio en la experiencia del usuario es tan importante como el cambio económico.
Seleccionar modelos manualmente es una carga cognitiva.
El desarrollador tiene que preguntarse:
- ¿Qué modelo debería usar?
- ¿Esta tarea merece usar el modelo caro?
- ¿Debería cambiar de modelo a mitad del proceso?
- ¿El modelo barato pierde demasiada calidad?
- ¿El tiempo ahorrado justifica el costo adicional?
En un buen sistema multiagente, la mayoría de estas preguntas se transfieren al propio sistema.
El usuario proporciona el objetivo.
El agente decide cómo distribuir el trabajo.
Este es un cambio significativo que va de la selección de modelos a la orquestación de recursos.
La combinación de ambos es mayor que la simple suma de funciones individuales
El argumento más sólido del artículo original es que estos dos cambios se refuerzan mutuamente.
El frontend está optimizado para gestionar de manera más eficiente historiales de agente enormes.
Al mismo tiempo, el sistema de agentes del backend ha adquirido mayor capacidad para dividir el trabajo entre varios modelos.
Esto le ofrece a OpenAI dos formas de reducir la fricción:
Reducir los segundos de espera en las pantallas de carga.
Reducir la decisión de elegir qué modelo usar.
El primero es una mejora de rendimiento.
El segundo es una mejora en el flujo de trabajo.
Combinados, ambos acercan a ChatGPT y a Codex a una posición más alejada de la de una simple interfaz de chat.
ChatGPT avanza hacia una plataforma de flujos de trabajo
El anuncio oficial de OpenAI sobre GPT-5.6 ya describe a esta familia de modelos como capaz de coordinar herramientas, manejar resultados intermedios y admitir flujos de trabajo multiagente. También introduce en Codex la capacidad de
delegar trabajo a otros modelos, ejecutar tareas en paralelo y sintetizar los resultados de cada una.
El usuario se convierte cada vez más en la persona que define el objetivo y revisa los resultados.
La orquestación interna ocurre entre bastidores.
La filosofía de "no elegir modelo" es el verdadero cambio de producto
Es fácil centrarse en las cifras de los benchmarks.
Pero la decisión de producto más importante podría ser el intento de ocultar la complejidad de los modelos al usuario.
A medida que crece el número de modelos, exponer directamente cada opción podría hacer que el sistema sea más difícil de usar.
Si OpenAI tiene de cinco a diez modelos especializados, los usuarios no deberían tener que conocerlos todos para completar un proyecto.
Una plataforma de agentes madura debería entender esto:
La tarea es la interfaz, no el modelo.
El usuario dice lo que necesita hacer.
El sistema decide cuánto razonamiento se requiere, qué modelo debería encargarse de cada parte y cómo combinar los resultados.
Qué significa esto para los desarrolladores
Para los desarrolladores que crean productos con IA, esta lección es más universal que la propia OpenAI.
Las arquitecturas de agentes modernas requieren cada vez más de tres capas:
- Descomposición de tareas: dividir trabajos grandes en subtareas con sentido.
- Enrutamiento de modelos: elegir el modelo más barato y competente para cada subtarea.
- Síntesis de resultados: combinar las salidas parciales en un resultado coherente.
Además, el frontend necesita manejar historiales de conversación mucho más grandes de lo que el diseño tradicional de productos de chat tenía en mente.
Si estás construyendo un producto de agentes, la representación de la conversación ya no es solo pulido de la interfaz.
Es infraestructura.
Preguntas frecuentes
¿Qué es el multiagente de GPT-5.6?
El multiagente de GPT-5.6 es una capacidad de orquestación de agentes en la que una instancia de GPT-5.6 puede coordinar en paralelo múltiples subagentes y sintetizar su trabajo. OpenAI documenta actualmente esta capacidad como una función de prueba dentro de la API de Responses.
¿Qué es Multi-agent V2 en Codex?
El artículo original describe Multi-agent V2 como un flujo de trabajo de Codex en el que el agente principal puede delegar diferentes subtareas a modelos compatibles y controlar la intensidad de razonamiento de cada subagente. La fecha exacta de lanzamiento y la disponibilidad de los modelos pueden cambiar, por lo que conviene consultar la documentación actual de OpenAI Codex para conocer la configuración más reciente.
¿Qué son GPT-5.6 Sol, Terra y Luna?
Son tres niveles de capacidad dentro de la familia GPT-5.6. OpenAI describe a Sol como el modelo insignia, a Terra como la opción equilibrada y a Luna como el modelo más rápido y rentable.
¿Para qué sirve GPT-5.6 Luna?
OpenAI posiciona a GPT-5.6 Luna para cargas de trabajo de alto rendimiento y sensibles al coste. Su página actual de API enumera 1 dólar por cada millón de tokens de entrada y 6 dólares por cada millón de tokens de salida.
¿Por qué ha mejorado el rendimiento de las conversaciones largas en ChatGPT?
Las sesiones de agentes pueden ser mucho más grandes que un chat normal, ya que pueden incluir cientos de llamadas a herramientas, resultados de ejecución y pasos intermedios. El artículo original informa de que OpenAI cambió la forma de cargar y representar los historiales extensos, de modo que la aplicación no tenga que procesar toda la conversación cada vez.
¿ChatGPT ahora elige automáticamente el mejor modelo para cada tarea?
La tendencia general apunta hacia el enrutamiento automático de modelos y la delegación, pero la disponibilidad depende del producto y del avance del lanzamiento de los modelos.
Nota aclaratoria. La documentación de GPT-5.6 de OpenAI confirma la orquestación multiagente y los distintos niveles de capacidad de GPT-5.6; esto no significa que cada conversación estándar de ChatGPT exponga un control completo de enrutamiento automático.
¿La ejecución multiagente puede reducir los costes de IA?
Sí. Si las subtareas difíciles usan modelos más potentes y el trabajo rutinario se asigna a modelos más baratos, el coste medio de todo el flujo de trabajo puede ser menor que usar el modelo más potente en cada paso. El ahorro real depende de la estrategia de enrutamiento y de la carga de trabajo.
Herramientas relacionadas
- OpenAI Codex: El agente de programación de OpenAI para desarrollo de software en varios pasos y flujos de trabajo de agentes.
- OpenAI API: La plataforma oficial de API para el desarrollo de aplicaciones con GPT-5.6 y multiagentes.
- Modelos GPT-5.6: Documentación oficial de modelos para Sol, Terra, Luna y capacidades relacionadas.
- API de Responses: La interfaz de API de OpenAI que admite llamadas a herramientas, invocaciones programáticas y flujos de trabajo multiagente.
- ChatGPT: El espacio de trabajo de IA de OpenAI para consumidores y empresas.
Enlaces relacionados
- Anuncio oficial de GPT-5.6: La página principal de lanzamiento de OpenAI sobre GPT-5.6, incluidos los aspectos multiagente y las supercapacidades.
- Guía de modelos GPT-5.6: Documentación oficial para desarrolladores sobre las capacidades de los modelos y el uso multiagente.
- GPT-5.6 Luna: Precios actuales de API y detalles técnicos del nivel de GPT-5.6 de bajo coste.
- GPT-5.6 en ChatGPT: Información actual sobre disponibilidad y planes en ChatGPT.
- OpenAI Codex: Información oficial del producto sobre Codex y la programación con agentes.
- Documentación de la API de OpenAI: El centro de documentación principal para crear con los modelos de OpenAI.
Resumen
Los cambios más recientes de OpenAI abordan dos tipos de fricción que cada vez importan más a medida que los agentes de IA ganan potencia. La primera es la espera: las conversaciones grandes, con cientos de turnos y llamadas a herramientas, también deberían abrirse con rapidez. La segunda es el coste de decisión: los usuarios no deberían tener que elegir manualmente un modelo para cada subtarea.
La arquitectura multiagente de GPT-5.6 apunta a un sistema de enrutamiento de modelos en el que los modelos más potentes pueden planificar y delegar, mientras que los más baratos se encargan del trabajo rutinario. Al mismo tiempo, las optimizaciones del frontend hacen que esas sesiones de agente más largas sean más fáciles de usar.
La dirección es clara: ChatGPT y Codex están pasando de ser lugares donde los usuarios conversan con un modelo, a convertirse en sistemas que deciden cómo debe ejecutarse el trabajo.