OpenAI GPT-5.6 Sol, Terra y Luna: Rendimiento, Precios y Eficiencia en Detalle

La serie GPT-5.6 de OpenAI incluye tres niveles de modelos: Sol, Terra y Luna. En lugar de ofrecer un único modelo para todas las cargas de trabajo, OpenAI segmenta la serie según capacidad, costo y rendimiento: - GPT-5.6 Sol es el modelo insignia, ideal para tareas profesionales complejas, programación, investigación, ciberseguridad y tareas de agentes a largo plazo. - GPT-5.6 Terra está diseñado para cargas de trabajo que aún requieren una inteligencia sólida pero con restricciones de costo más estrictas. - GPT-5.6 Luna es el miembro más rápido y económico de la serie.

发布于 2026年7月30日generalGEO 评分: 07 次阅读
Esta imagen es un visual promocional del contenido de OpenAI GPT-5.6, con un fondo negro profundo. En el centro, un texto degradado llamativo (de azul claro a lavanda) dice 'GPT-5.6', y debajo, en texto blanco, aparece 'Sol vs Terra vs Luna'. En la parte inferior, tres planetas con anillos están alineados en colores dorado, azul y púrpura, correspondientes a los tres modelos mencionados en el documento bajo la serie GPT-5.6. El estilo general es minimalista, sin elementos complejos innecesarios, adecuado para el diseño de portada requerido por el documento, presentando visualmente el tema central del contenido.

OpenAI GPT-5.6 Sol, Terra y Luna: Rendimiento, Precios y Eficiencia en Detalle

Introducción

La serie GPT-5.6 de OpenAI incluye tres niveles de modelo: Sol, Terra y Luna.

En lugar de ofrecer un solo modelo para todas las cargas de trabajo, OpenAI diferencia la serie según capacidad, coste y rendimiento:

  • GPT-5.6 Sol es el modelo insignia, diseñado para trabajos complejos y especializados, programación, investigación, ciberseguridad y tareas de agente a largo plazo.
  • GPT-5.6 Terra está orientado a cargas de trabajo que aún requieren una inteligencia potente pero con requisitos de coste más estrictos.
  • GPT-5.6 Luna es el miembro más rápido y de menor precio de la serie, adecuado para cargas de trabajo sensibles al coste y de alto rendimiento.

OpenAI presentó por primera vez la serie en junio de 2026 y la lanzó por completo el 9 de julio. El artículo original de AIBase se publicó el 30 de julio, destacando las mejoras de eficiencia detrás de este lanzamiento: mejor rendimiento por token, niveles de modelo de menor coste y optimizaciones de infraestructura y ciclo de agente diseñadas para reducir el coste total de completar trabajos reales.

Este enfoque es crucial. Para los sistemas de IA en producción, la métrica relevante es cada vez menos lo inteligente que parece un modelo de forma aislada, sino cuánto trabajo útil puede completar dados un tiempo, recursos informáticos y presupuesto determinados.

Tres modelos GPT-5.6 para diferentes cargas de trabajo

OpenAI describe Sol, Terra y Luna como niveles de capacidad persistentes, no como sufijos temporales.

El número de generación identifica la serie GPT-5.6, mientras que los nombres distinguen los niveles esperados de rendimiento y coste.

Modelo Posicionamiento Precio de entrada API Precio de salida API Ventana de contexto Salida máxima
GPT-5.6 Sol Modelo insignia para trabajos complejos y especializados 5 USD por millón de tokens 30 USD por millón de tokens 1.050.000 tokens 128.000 tokens
GPT-5.6 Terra Equilibrio entre inteligencia y coste 2,50 USD por millón de tokens 15 USD por millón de tokens 1.050.000 tokens 128.000 tokens
GPT-5.6 Luna Cargas de trabajo de alto rendimiento sensibles al coste 1 USD por millón de tokens 6 USD por millón de tokens 1.050.000 tokens 128.000 tokens

Las tres páginas de modelo indican una fecha límite de conocimiento del 16 de febrero de 2026 y admiten entrada de texto e imagen, así como salida de texto.

El alias de API gpt-5.6 enruta a GPT-5.6 Sol.

GPT-5.6 Sol: El modelo insignia

Sol es el nivel más potente de GPT-5.6 de OpenAI.

OpenAI lo posiciona para:

  • Programación compleja
  • Flujos de trabajo de agente a largo plazo
  • Trabajo de conocimiento especializado
  • Investigación científica
  • Ciberseguridad
  • Uso de ordenador
  • Análisis multimodal
  • Tareas de razonamiento de alto valor

En el Artificial Analysis Coding Agent Index v1.1, OpenAI informa que GPT-5.6 Sol obtiene una puntuación de 80 en modo de razonamiento máximo, en comparación con 77,2 de Claude Fable 5 en la misma tabla.

OpenAI también afirma que, en esa comparación, Sol utiliza menos de la mitad de los tokens de salida y menos de la mitad del tiempo, mientras que su coste estimado de tarea es menor.

Esto no significa que Sol sea superior en todos los puntos de referencia. La propia tabla de lanzamiento de OpenAI muestra que los modelos competidores lideran en algunas evaluaciones. El argumento más consistente de GPT-5.6 es el rendimiento por token y por dólar, no el liderazgo absoluto en cada categoría de tarea.

GPT-5.6 Terra: El nivel equilibrado

Terra es el modelo intermedio de la serie.

OpenAI describe su capacidad como comparable al nivel de GPT-5.5, mientras que sus tarifas son:

  • 2,50 USD por millón de tokens de entrada
  • 15 USD por millón de tokens de salida

Esto equivale a la mitad del precio de 5 USD / 30 USD correspondiente al nivel insignia anterior.

Por lo tanto, Terra es adecuado para equipos que necesitan una potente capacidad de razonamiento y agente, pero sin necesidad de recurrir a Sol para cada solicitud.

Los ejemplos típicos incluyen:

  • Agentes empresariales internos
  • Subagentes de codificación
  • Análisis de documentos
  • Flujos de investigación
  • Automatización intensiva en herramientas
  • Tareas especializadas de alto volumen

El modelo admite la misma ventana de contexto de 1,05 millones de tokens y una salida máxima de 12,8 millones de tokens que Sol.

GPT-5.6 Luna: El nivel de menor coste de GPT-5.6

Luna está diseñado para cargas de trabajo donde el rendimiento y el coste son los más críticos.

Sus precios de API son:

  • 1 USD por millón de tokens de entrada
  • 6 USD por millón de tokens de salida

Esto supone un 80 % menos que Sol tanto en precios de entrada como de salida.

OpenAI describe Luna como su modelo GPT-5.6 más rápido y asequible. Es adecuado para cargas de trabajo como:

  • Clasificación
  • Extracción
  • Enrutamiento
  • Procesamiento de alto volumen
  • Agentes ligeros
  • Tareas estructuradas repetitivas
  • Aplicaciones que pueden escalar casos difíciles a Terra o Sol

El precio más bajo no significa que Luna sea solo un modelo práctico sin razonamiento. Sigue admitiendo las funciones de razonamiento de GPT-5.6 y el ecosistema de herramientas de OpenAI, pero su límite de capacidad es inferior al de Sol.

La imagen muestra la eficiencia de GPT-5.6 en cada capa. Se divide en tres partes: 1. Agent harness local, 2. Orquestación API en CPU, 3. Inferencia de modelo en GPU. El Agent harness se encarga de construir solicitudes y ejecutar bucles, incluyendo Context + cache, Lazy tools + code mode, etc. La orquestación API convierte las solicitudes en trabajo ejecutable, involucrando Render → Tokenize → Route, Stateful connection + model routing, etc. La inferencia de modelo ejecuta el modelo en GPU, incluyendo KV cache + memory, memory management, etc. La imagen también señala direcciones de mejora del modelo, como Reasoning + Generation, Tool Orchestration, Adaptive Compute, etc., y resultados compuestos, como Less network data, Less CPU work, More output from the same GPUs, etc.

La eficiencia es el tema central de GPT-5.6

El artículo de AIBase enfatiza que GPT-5.6 no es solo una mejora en la calidad del modelo.

El objetivo de ingeniería más amplio es aumentar la cantidad de trabajo útil producido por cada token y reducir la sobrecarga adicional de la ejecución del agente.

Los materiales oficiales de lanzamiento de OpenAI respaldan esta dirección más amplia.

La compañía afirma que GPT-5.6 ha sido entrenado para completar trabajos útiles con menos tokens de salida, y su guía para desarrolladores sugiere que, al migrar desde GPT-5.5 o GPT-5.4, se pruebe el mismo nivel de esfuerzo de razonamiento, generalmente reduciendo un nivel.

Esto es importante porque el precio anunciado por token es solo una parte del coste del agente.

Un flujo de trabajo de múltiples pasos puede consumir presupuesto a través de:

  • Muchos prompts
  • Contexto repetido
  • Tokens de razonamiento
  • Definiciones de herramientas
  • Salidas de herramientas
  • Bucles de reintento
  • Múltiples rondas de modelo
  • Subagentes
  • Respuestas finales largas

Por lo tanto, un modelo que requiere menos pasos, incluso si su tarifa nominal por token parece similar, puede resultar más barato en la práctica.

El rendimiento de codificación de Sol mejora la relación rendimiento por dólar

El artículo original destaca el rendimiento del agente de codificación de Sol.

Tabla de referencia actual de OpenAI

Informe:

Evaluación de codificación GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5
Índice de inteligencia de codificación de análisis de IA v1.1 80 77,4 74,6 76,4
SWE-Bench Pro 64,6% 63,4% 62,7% 59,4%
DeepSWE v1.1 72,7% 69,6% 67,2% 67,0%
Terminal-Bench 2.1 88,8% 87,4% 84,7% 85,6%

Estos datos provienen de la tabla de lanzamiento publicada por OpenAI y deben leerse en el contexto del marco de evaluación y la configuración específicos.

Por ejemplo, los resultados de las pruebas de referencia pueden variar según los siguientes factores:

  • Profundidad de razonamiento
  • Marco del agente
  • Disponibilidad de herramientas
  • Límites de tiempo
  • Número de semillas de evaluación
  • Instantáneas del modelo
  • Formato del mensaje

OpenAI también señala que algunas de sus comparaciones de costos y latencia se basan en estimaciones fuera de línea del comportamiento de producción, y no en facturación directa de cada servicio competidor.

La lección práctica es que los modelos deben probarse en trabajos de producción representativos, y no elegirse únicamente según las tablas de clasificación.

La pila de inferencia se está optimizando, no solo el modelo

La fuente de AIBase describe la optimización de toda la pila de servicios, que incluye:

  • Balanceo de carga
  • Decodificación especulativa
  • Optimización de caché
  • Núcleos de GPU optimizados

También informa que el trabajo de inferencia ha mejorado la eficiencia de generación de tokens en más de un 15%.

Estos detalles subyacentes del servicio se presentan en el informe de AIBase. La página pública de lanzamiento actual de GPT-5.6 de OpenAI confirma el esfuerzo más amplio por mejorar el servicio y la eficiencia de la investigación, pero los datos subyacentes exactos deben considerarse como informes de origen, a menos que se reproduzcan en publicaciones técnicas de OpenAI o en pruebas de referencia que documenten el método completo.

Lo que puede confirmarse de forma independiente a partir de la documentación de OpenAI es que GPT-5.6 incorpora varios mecanismos destinados a reducir el trabajo innecesario del modelo.

Estos incluyen:

  • Generación de tokens más eficiente
  • Caché de mensajes explícito
  • Inferencia persistente
  • Llamadas a herramientas programáticas
  • Ejecución multiagente para cargas de trabajo adecuadas
  • Profundidad de razonamiento configurable

La dirección de ingeniería es coherente: reducir el trabajo redundante en torno a cada tarea exitosa.

El caché de mensajes se vuelve más explícito

GPT-5.6 introduce un caché de mensajes más predecible.

La documentación de OpenAI admite puntos de corte de caché explícitos, que permiten a los desarrolladores decidir qué prefijos de mensajes reutilizables deben almacenarse en caché.

Para los modelos GPT-5.6:

  • La escritura en caché se factura a 1,25 veces la tarifa normal de entrada no almacenada en caché.
  • La lectura desde caché puede obtener un descuento del 90% en la entrada almacenada en caché.
  • La documentación de OpenAI indica un ciclo de vida mínimo de caché de 30 minutos para el nuevo comportamiento de caché.

Esto cambia la forma en que los desarrolladores piensan sobre los agentes de larga duración.

Si los mensajes grandes del sistema, los directorios de herramientas, las secciones de políticas o el contexto del proyecto estable se envían repetidamente como entrada no almacenada en caché, el costo puede ser alto.

Cuando los prefijos reutilizables se mantienen estables, el caché puede reducir ese costo.

Al mismo tiempo, las escrituras innecesarias en caché pueden aumentar los costos. Por lo tanto, OpenAI recomienda realizar un seguimiento tanto del uso de tokens almacenados en caché como de los tokens de escritura en caché, en lugar de asumir que el caché siempre es más barato.

La orquestación de herramientas puede reducir las rondas de interacción del modelo

La segunda área principal de eficiencia es el marco del agente.

El ciclo de herramientas tradicional suele ser el siguiente:

  1. El modelo decide llamar a una herramienta.
  2. La aplicación ejecuta la herramienta.
  3. El resultado completo de la herramienta se devuelve al modelo.
  4. El modelo lee el resultado y decide el siguiente paso.
  5. Se llama a otra herramienta.
  6. El ciclo se repite.

La imagen muestra el flujo del ciclo de herramientas tradicional. Una tarea de usuario inicia el ciclo, el modelo decide la siguiente acción, se ejecuta la herramienta, se devuelve el resultado de la herramienta y el ciclo se repite. El ciclo incluye múltiples llamadas a herramientas, y después de cada llamada se devuelven nuevas observaciones. La imagen está estrechamente relacionada con el contexto, que menciona que el ciclo de herramientas tradicional puede ser costoso, las salidas grandes de herramientas intermedias pueden entrar repetidamente en el contexto del modelo, y las llamadas a herramientas programáticas de GPT-5.6 ofrecen una alternativa que puede reducir las rondas del modelo, el crecimiento del mensaje, los tokens intermedios, etc., y es adecuada cuando el código puede manejar múltiples resultados predecibles de herramientas.

Aunque este método es flexible, puede volverse costoso.

Las salidas grandes de herramientas intermedias pueden entrar repetidamente en el contexto del modelo, incluso si solo se necesita una pequeña parte de los datos.

Las llamadas a herramientas programáticas de GPT-5.6 ofrecen otra opción.

La documentación de OpenAI muestra que GPT-5.6 puede escribir JavaScript en un entorno de ejecución gestionado para:

  • Llamar a herramientas que cumplan las condiciones
  • Pasar resultados entre llamadas
  • Filtrar datos intermedios
  • Fusionar registros
  • Ordenar resultados
  • Deduplicar datos
  • Validar datos
  • Devolver resultados estructurados más pequeños al modelo

Para flujos de trabajo acotados, esto puede reducir:

  • Rondas del modelo
  • Crecimiento del mensaje
  • Tokens intermedios
  • Número de viajes de ida y vuelta en la red

OpenAI indica que este patrón es particularmente útil cuando el código puede manejar múltiples resultados predecibles de herramientas sin necesidad de reevaluar semánticamente después de cada llamada.

No es adecuado para todas las tareas de agente.

En los siguientes casos, la interacción directa modelo-herramienta sigue siendo la mejor opción:

  • Una sola llamada a herramienta es suficiente
  • Cada resultado puede provocar un cambio sustancial en el razonamiento del siguiente paso
  • Se requiere aprobación humana
  • Los resultados intermedios ya son pequeños
  • La respuesta final debe conservar referencias nativas o artefactos

El objetivo no es minimizar el número de llamadas a toda costa, sino evitar pasar información innecesaria a través del modelo.

El historial de conversación y el razonamiento pueden gestionarse de forma más precisa

El artículo de AIBase también señala que una gestión más estricta del historial de conversación es un método para mejorar la tasa de reutilización del caché.

La guía de desarrollo actual de GPT-5.6 de OpenAI proporciona el mecanismo oficial relacionado: inferencia persistente.

Los desarrolladores pueden configurar cómo mantener disponible el razonamiento de rondas anteriores.

Esto es importante para los flujos de trabajo de larga duración, ya que no todas las ideas anteriores son igualmente útiles para siempre.

Si la tarea se mantiene estable, el razonamiento anterior puede mejorar la continuidad.

Si el objetivo cambia, mantener todo el razonamiento anterior aumenta los costos e introduce suposiciones obsoletas.

Por lo tanto, OpenAI permite a las aplicaciones controlar el contexto de razonamiento y recomienda conservar correctamente los elementos de respuesta necesarios al gestionar el historial manualmente.

Esto proporciona a los desarrolladores otra palanca para equilibrar los siguientes elementos:

  • Continuidad
  • Eficiencia del caché
  • Tamaño del contexto
  • Costo
  • Calidad

Simplificar los mensajes también puede reducir el costo del agente

La guía de desarrollo de GPT-5.6 de OpenAI recomienda especialmente simplificar los mensajes.

En las muestras de ejecución de evaluación interna de agentes de codificación, OpenAI informa que simplificar los mensajes y las descripciones de las herramientas:

  • Mejoró las puntuaciones de evaluación en aproximadamente un 10% a un 15%
  • Redujo el número total de tokens entre un 41% y un 66%
  • Redujo los costos entre un 33% y un 67%

OpenAI indica claramente que estas cifras son solo de referencia y explica que los resultados varían según la carga de trabajo.

La recomendación no es eliminar restricciones útiles.

Su objetivo es eliminar contenido duplicado.

El proceso de migración práctico es el siguiente:

  1. Partir de un conjunto de mensajes y herramientas que ya funcione correctamente.
  2. Eliminar un conjunto de instrucciones duplicadas cada vez.
  3. Volver a ejecutar la misma tarea de evaluación.
  4. Conservar las restricciones que mejoren la calidad medible.
  5. Eliminar aquellas instrucciones que aumenten los tokens sin mejorar el resultado.

Esto es especialmente importante para los productos de agente, ya que el mismo mensaje del sistema y las mismas descripciones de herramientas pueden enviarse miles de veces al día.

La selección del modelo debe coincidir con la carga de trabajo

La serie GPT-5.6 ofrece a los desarrolladores tres opciones principales de costo-calidad.

Usar Sol cuando la calidad sea la restricción principal

Elegir Sol cuando la tarea pueda beneficiarse sustancialmente de capacidades de vanguardia.

Casos de uso adecuados:

  • Ingeniería de software de alta dificultad
  • Investigación compleja
  • Planificación a largo plazo
  • Trabajo de ciberseguridad
  • Análisis profesional de alto valor
  • Tareas en las que una pequeña mejora en la calidad justifique el mayor costo del modelo

Usar Terra para trabajos de producción generales y potentes

Cuando la tarea requiera una capacidad de razonamiento sólida pero no necesite Sol, Terra es la opción pragmática.

Es adecuada para:

  • Agentes empresariales cotidianos
  • Asistencia de codificación
  • Flujos de trabajo de documentación
  • Subagentes de investigación
  • Uso de herramientas de complejidad media
  • Tareas profesionales de alto volumen

Usar Luna cuando el costo y el volumen sean los factores dominantes

Luna es la opción natural para los siguientes escenarios:

  • Clasificación
  • Extracción
  • Enrutamiento
  • Transformación de datos
  • Flujos de trabajo de herramientas ligeras
  • Automatización de fondo de alto volumen

Una arquitectura común consiste en enrutar el trabajo rutinario a Luna o Terra, y solo escalar las tareas más difíciles a Sol.

El precio es solo el punto de partida

Para los sistemas de agentes, una simple comparación por token puede ser engañosa.

Considera dos modelos.

El modelo A tiene un costo menor por token de salida, pero requiere:

  • El doble de tokens de razonamiento
  • Más llamadas a herramientas
  • Más reintentos
  • Más contexto
  • Más rondas

El modelo B tiene un precio nominal más alto, pero necesita la mitad de pasos para completar la tarea.

El segundo modelo podría seguir siendo más barato calculando por tarea completada.

Por lo tanto, los equipos que evalúan GPT-5.6 deben rastrear:

  • Tasa de éxito de tareas
  • Total de tokens de entrada
  • Total de tokens de salida
  • Tokens de caché
  • Tokens de escritura en caché
  • Número de rondas del modelo
  • Número de llamadas a herramientas
  • Latencia
  • Tasa de reintentos
  • Tiempo de corrección manual
  • Costo total por tarea exitosa

Esto es lo que realmente significa "inteligencia por token".

Pruebas de migración prácticas

Para los equipos que ya usan GPT-5.5 o modelos anteriores, una comparación controlada es más útil que una migración completa inmediata.

Paso 1: Construir un conjunto de evaluación representativo

Incluye:

  • Solicitudes simples
  • Solicitudes difíciles
  • Tareas de contexto largo
  • Flujos de trabajo intensivos en herramientas
  • Casos de fallo conocidos
  • Ejemplos de producción

Paso 2: Usar el esfuerzo de razonamiento actual como referencia

OpenAI sugiere comenzar con el mismo nivel de esfuerzo de razonamiento utilizado en el modelo anterior.

Luego prueba reduciendo un nivel.

GPT-5.6 puede mantener la calidad usando menos tokens de razonamiento, pero esto debe confirmarse en tu carga de trabajo.

Paso 3: Comparar Sol, Terra y Luna

No asumas que el modelo insignia es automáticamente la mejor opción de producción.

Mide si Terra o Luna pueden cumplir los mismos criterios de aceptación a un costo menor.

Paso 4: Probar el almacenamiento en caché de indicaciones

Rastrea las lecturas y escrituras de caché.

Cuando la tasa de reutilización es alta, el contexto estable puede volverse significativamente más económico, pero los prefijos de indicaciones que cambian con frecuencia pueden no beneficiarse tanto.

Paso 5: Probar llamadas a herramientas programáticas donde corresponda

Aplícalo en etapas de procesamiento con límites bien definidos, como:

  • Filtrado
  • Agregación
  • Ordenamiento
  • Uniones
  • Deduplicación

Compara los resultados con las llamadas directas a herramientas normales.

Paso 6: Medir la economía de completar tareas

Una factura de tokens más baja solo tiene sentido si la tarea final sigue alcanzando los estándares de calidad.

El objetivo de optimización correcto no es la menor cantidad de tokens.

Es obtener resultados exitosos al costo confiable más bajo.

Por qué GPT-5.6 refleja un cambio más amplio hacia la eficiencia

Durante años, la competencia entre modelos de frontera ha estado dominada por una pregunta: ¿qué modelo es más capaz?

Esa pregunta sigue siendo importante.

Pero a medida que la IA entra en producción a gran escala, otra pregunta es igualmente relevante:

¿Cuánto trabajo útil puede completar un sistema por unidad de cómputo y por dólar invertido?

Los sistemas de agentes amplifican esta presión.

Una sola solicitud de usuario puede desencadenar:

  • Múltiples rondas de razonamiento
  • Búsquedas
  • Ejecución de código
  • APIs externas
  • Subagentes
  • Ventanas de contexto grandes
  • Validaciones repetidas

Sin una orquestación cuidadosa, la factura total crece rápidamente.

GPT-5.6 refleja un cambio más amplio, desde simplemente escalar la capacidad intelectual hacia hacer que el despliegue de inteligencia sea más económico.

Sol impulsa la capacidad intelectual en el extremo superior.

Terra reduce el costo del trabajo potente de uso general.

Luna lleva la familia de modelos a cargas de trabajo de alto rendimiento.

El almacenamiento en caché de indicaciones y la orquestación programática de herramientas se enfocan en la sobrecarga del sistema alrededor de los propios modelos.

El resultado es una familia de modelos diseñada no solo en torno a puntuaciones de referencia, sino también en torno a la economía de producción.

Preguntas frecuentes

¿Qué es GPT-5.6?

GPT-5.6 es la familia de modelos de OpenAI para razonamiento complejo, programación, trabajo profesional, flujos de trabajo de agentes y aplicaciones de IA de alto rendimiento. La serie incluye actualmente Sol, Terra y Luna.

¿Cuál es la diferencia entre GPT-5.6 Sol, Terra y Luna?

Sol es el nivel insignia y más capaz. Terra equilibra inteligencia y costo, mientras que Luna está optimizada para cargas de trabajo de bajo costo y alto rendimiento.

¿Cuánto cuesta usar GPT-5.6 a través de la API?

OpenAI fija el precio de Sol en $5 por millón de tokens de entrada y $30 por millón de tokens de salida, Terra en $2.50/$15, y Luna en $1/$6. El precio de entrada en caché es más bajo, y las indicaciones muy largas pueden tener reglas de precios diferentes.

¿Cuál es la ventana de contexto de GPT-5.6?

La página actual del modelo API de OpenAI enumera las ventanas de contexto de Sol, Terra y Luna en 1,050,000 tokens. Cada modelo admite hasta 128,000 tokens de salida.

¿Es GPT-5.6 Sol mejor que GPT-5.5 para programar?

OpenAI informa que Sol obtiene puntuaciones más altas en varias evaluaciones de agentes de programación, incluido el Índice de Agentes de Programación de Artificial Analysis, SWE-Bench Pro, DeepSWE y Terminal-Bench 2.1. El rendimiento real en producción sigue dependiendo del repositorio, marco de agente, indicaciones y herramientas.

¿Qué son las llamadas a herramientas programáticas?

Las llamadas a herramientas programáticas permiten que GPT-5.6 escriba código para coordinar herramientas elegibles y manejar resultados intermedios en un entorno de ejecución gestionado. Pueden reducir los viajes de ida y vuelta del modelo y el uso de tokens en flujos de trabajo con límites bien definidos.

Por ejemplo, operaciones como filtrado, uniones, ordenamiento y agregación.

¿GPT-5.6 admite almacenamiento en caché de indicaciones?

Sí. GPT-5.6 admite almacenamiento en caché automático y puntos de interrupción de caché explícitos. OpenAI afirma que las lecturas de caché reciben un 90% de descuento en la entrada, mientras que las nuevas escrituras en caché cuestan 1.25 veces el precio de entrada no almacenada en caché.

¿Se debe usar Sol para cada solicitud?

Generalmente no. Si Terra o Luna pueden cumplir los mismos criterios de evaluación a un costo menor, usar un nivel de modelo más pequeño mejora la economía de la aplicación. Las tareas complejas solo deben enrutarse a Sol cuando una mayor capacidad genere beneficios medibles.

Herramientas relacionadas

  • API de OpenAI: Plataforma oficial para desarrolladores para acceder a los modelos GPT-5.6 y herramientas de OpenAI.
  • Guía de modelos GPT-5.6: Guía de migración y optimización de OpenAI para la familia de modelos GPT-5.6.
  • GPT-5.6 Sol: Especificaciones oficiales del modelo, precios, límites de contexto y características compatibles con Sol.
  • GPT-5.6 Terra: Página oficial del modelo para el nivel equilibrado GPT-5.6.
  • GPT-5.6 Luna: Página oficial del modelo para el nivel de menor costo GPT-5.6.
  • OpenAI Codex: Entorno de programación inteligente de OpenAI para flujos de trabajo de desarrollo de software.

Enlaces relacionados

Directorio oficial de modelos y sus especificaciones principales.

Resumen

GPT-5.6 es una familia de modelos compuesta por tres niveles, no un único modelo de uso general. Sol está orientado a las capacidades de primer nivel, Terra ofrece un equilibrio más rentable para tareas de producción habituales, mientras que Luna está optimizado para escenarios de alto rendimiento.

El tema principal es la eficiencia. OpenAI reduce la carga de trabajo del modelo necesaria para completar tareas complejas combinando modelos con mayor eficiencia de tokens, caché explícito de indicaciones, inferencia continua, consumo de inferencia configurable y llamadas a herramientas de programación.

Fuentes de AIBase también informan de más optimizaciones en la pila de inferencia, incluyendo decodificación especulativa y trabajo en núcleos de GPU, que mejoran la velocidad de generación de tokens en más de un 15%.

Eficiencia. A menos que se reproduzca en publicaciones técnicas oficiales completamente documentadas de OpenAI, estos datos de bajo nivel deben considerarse como informes de fuentes.

La comprensión óptima de GPT-5.6 no es simplemente el lanzamiento de un modelo más potente, sino un intento de mejorar la economía de la inteligencia en todo el flujo de trabajo de los agentes.

OpenAI GPT-5.6 Sol、Terra与Luna:性能、定价与效率详解