OpenAI GPT-5.6 Sol, Terra y Luna: Rendimiento, Precios y Eficiencia en Detalle
La serie GPT-5.6 de OpenAI incluye tres niveles de modelos: Sol, Terra y Luna. En lugar de ofrecer un único modelo para todas las cargas de trabajo, OpenAI segmenta la serie según capacidad, costo y rendimiento: - GPT-5.6 Sol es el modelo insignia, ideal para tareas profesionales complejas, programación, investigación, ciberseguridad y tareas de agentes a largo plazo. - GPT-5.6 Terra está diseñado para cargas de trabajo que aún requieren una inteligencia sólida pero con restricciones de costo más estrictas. - GPT-5.6 Luna es el miembro más rápido y económico de la serie.

OpenAI GPT-5.6 Sol, Terra y Luna: Rendimiento, Precios y Eficiencia en Detalle
Introducción
La serie GPT-5.6 de OpenAI incluye tres niveles de modelo: Sol, Terra y Luna.
En lugar de ofrecer un solo modelo para todas las cargas de trabajo, OpenAI diferencia la serie según capacidad, coste y rendimiento:
- GPT-5.6 Sol es el modelo insignia, diseñado para trabajos complejos y especializados, programación, investigación, ciberseguridad y tareas de agente a largo plazo.
- GPT-5.6 Terra está orientado a cargas de trabajo que aún requieren una inteligencia potente pero con requisitos de coste más estrictos.
- GPT-5.6 Luna es el miembro más rápido y de menor precio de la serie, adecuado para cargas de trabajo sensibles al coste y de alto rendimiento.
OpenAI presentó por primera vez la serie en junio de 2026 y la lanzó por completo el 9 de julio. El artículo original de AIBase se publicó el 30 de julio, destacando las mejoras de eficiencia detrás de este lanzamiento: mejor rendimiento por token, niveles de modelo de menor coste y optimizaciones de infraestructura y ciclo de agente diseñadas para reducir el coste total de completar trabajos reales.
Este enfoque es crucial. Para los sistemas de IA en producción, la métrica relevante es cada vez menos lo inteligente que parece un modelo de forma aislada, sino cuánto trabajo útil puede completar dados un tiempo, recursos informáticos y presupuesto determinados.
Tres modelos GPT-5.6 para diferentes cargas de trabajo
OpenAI describe Sol, Terra y Luna como niveles de capacidad persistentes, no como sufijos temporales.
El número de generación identifica la serie GPT-5.6, mientras que los nombres distinguen los niveles esperados de rendimiento y coste.
| Modelo | Posicionamiento | Precio de entrada API | Precio de salida API | Ventana de contexto | Salida máxima |
|---|---|---|---|---|---|
| GPT-5.6 Sol | Modelo insignia para trabajos complejos y especializados | 5 USD por millón de tokens | 30 USD por millón de tokens | 1.050.000 tokens | 128.000 tokens |
| GPT-5.6 Terra | Equilibrio entre inteligencia y coste | 2,50 USD por millón de tokens | 15 USD por millón de tokens | 1.050.000 tokens | 128.000 tokens |
| GPT-5.6 Luna | Cargas de trabajo de alto rendimiento sensibles al coste | 1 USD por millón de tokens | 6 USD por millón de tokens | 1.050.000 tokens | 128.000 tokens |
Las tres páginas de modelo indican una fecha límite de conocimiento del 16 de febrero de 2026 y admiten entrada de texto e imagen, así como salida de texto.
El alias de API gpt-5.6 enruta a GPT-5.6 Sol.
GPT-5.6 Sol: El modelo insignia
Sol es el nivel más potente de GPT-5.6 de OpenAI.
OpenAI lo posiciona para:
- Programación compleja
- Flujos de trabajo de agente a largo plazo
- Trabajo de conocimiento especializado
- Investigación científica
- Ciberseguridad
- Uso de ordenador
- Análisis multimodal
- Tareas de razonamiento de alto valor
En el Artificial Analysis Coding Agent Index v1.1, OpenAI informa que GPT-5.6 Sol obtiene una puntuación de 80 en modo de razonamiento máximo, en comparación con 77,2 de Claude Fable 5 en la misma tabla.
OpenAI también afirma que, en esa comparación, Sol utiliza menos de la mitad de los tokens de salida y menos de la mitad del tiempo, mientras que su coste estimado de tarea es menor.
Esto no significa que Sol sea superior en todos los puntos de referencia. La propia tabla de lanzamiento de OpenAI muestra que los modelos competidores lideran en algunas evaluaciones. El argumento más consistente de GPT-5.6 es el rendimiento por token y por dólar, no el liderazgo absoluto en cada categoría de tarea.
GPT-5.6 Terra: El nivel equilibrado
Terra es el modelo intermedio de la serie.
OpenAI describe su capacidad como comparable al nivel de GPT-5.5, mientras que sus tarifas son:
- 2,50 USD por millón de tokens de entrada
- 15 USD por millón de tokens de salida
Esto equivale a la mitad del precio de 5 USD / 30 USD correspondiente al nivel insignia anterior.
Por lo tanto, Terra es adecuado para equipos que necesitan una potente capacidad de razonamiento y agente, pero sin necesidad de recurrir a Sol para cada solicitud.
Los ejemplos típicos incluyen:
- Agentes empresariales internos
- Subagentes de codificación
- Análisis de documentos
- Flujos de investigación
- Automatización intensiva en herramientas
- Tareas especializadas de alto volumen
El modelo admite la misma ventana de contexto de 1,05 millones de tokens y una salida máxima de 12,8 millones de tokens que Sol.
GPT-5.6 Luna: El nivel de menor coste de GPT-5.6
Luna está diseñado para cargas de trabajo donde el rendimiento y el coste son los más críticos.
Sus precios de API son:
- 1 USD por millón de tokens de entrada
- 6 USD por millón de tokens de salida
Esto supone un 80 % menos que Sol tanto en precios de entrada como de salida.
OpenAI describe Luna como su modelo GPT-5.6 más rápido y asequible. Es adecuado para cargas de trabajo como:
- Clasificación
- Extracción
- Enrutamiento
- Procesamiento de alto volumen
- Agentes ligeros
- Tareas estructuradas repetitivas
- Aplicaciones que pueden escalar casos difíciles a Terra o Sol
El precio más bajo no significa que Luna sea solo un modelo práctico sin razonamiento. Sigue admitiendo las funciones de razonamiento de GPT-5.6 y el ecosistema de herramientas de OpenAI, pero su límite de capacidad es inferior al de Sol.

La eficiencia es el tema central de GPT-5.6
El artículo de AIBase enfatiza que GPT-5.6 no es solo una mejora en la calidad del modelo.
El objetivo de ingeniería más amplio es aumentar la cantidad de trabajo útil producido por cada token y reducir la sobrecarga adicional de la ejecución del agente.
Los materiales oficiales de lanzamiento de OpenAI respaldan esta dirección más amplia.
La compañía afirma que GPT-5.6 ha sido entrenado para completar trabajos útiles con menos tokens de salida, y su guía para desarrolladores sugiere que, al migrar desde GPT-5.5 o GPT-5.4, se pruebe el mismo nivel de esfuerzo de razonamiento, generalmente reduciendo un nivel.
Esto es importante porque el precio anunciado por token es solo una parte del coste del agente.
Un flujo de trabajo de múltiples pasos puede consumir presupuesto a través de:
- Muchos prompts
- Contexto repetido
- Tokens de razonamiento
- Definiciones de herramientas
- Salidas de herramientas
- Bucles de reintento
- Múltiples rondas de modelo
- Subagentes
- Respuestas finales largas
Por lo tanto, un modelo que requiere menos pasos, incluso si su tarifa nominal por token parece similar, puede resultar más barato en la práctica.
El rendimiento de codificación de Sol mejora la relación rendimiento por dólar
El artículo original destaca el rendimiento del agente de codificación de Sol.
Tabla de referencia actual de OpenAI
Informe:
| Evaluación de codificación | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 |
|---|---|---|---|---|
| Índice de inteligencia de codificación de análisis de IA v1.1 | 80 | 77,4 | 74,6 | 76,4 |
| SWE-Bench Pro | 64,6% | 63,4% | 62,7% | 59,4% |
| DeepSWE v1.1 | 72,7% | 69,6% | 67,2% | 67,0% |
| Terminal-Bench 2.1 | 88,8% | 87,4% | 84,7% | 85,6% |
Estos datos provienen de la tabla de lanzamiento publicada por OpenAI y deben leerse en el contexto del marco de evaluación y la configuración específicos.
Por ejemplo, los resultados de las pruebas de referencia pueden variar según los siguientes factores:
- Profundidad de razonamiento
- Marco del agente
- Disponibilidad de herramientas
- Límites de tiempo
- Número de semillas de evaluación
- Instantáneas del modelo
- Formato del mensaje
OpenAI también señala que algunas de sus comparaciones de costos y latencia se basan en estimaciones fuera de línea del comportamiento de producción, y no en facturación directa de cada servicio competidor.
La lección práctica es que los modelos deben probarse en trabajos de producción representativos, y no elegirse únicamente según las tablas de clasificación.
La pila de inferencia se está optimizando, no solo el modelo
La fuente de AIBase describe la optimización de toda la pila de servicios, que incluye:
- Balanceo de carga
- Decodificación especulativa
- Optimización de caché
- Núcleos de GPU optimizados
También informa que el trabajo de inferencia ha mejorado la eficiencia de generación de tokens en más de un 15%.
Estos detalles subyacentes del servicio se presentan en el informe de AIBase. La página pública de lanzamiento actual de GPT-5.6 de OpenAI confirma el esfuerzo más amplio por mejorar el servicio y la eficiencia de la investigación, pero los datos subyacentes exactos deben considerarse como informes de origen, a menos que se reproduzcan en publicaciones técnicas de OpenAI o en pruebas de referencia que documenten el método completo.
Lo que puede confirmarse de forma independiente a partir de la documentación de OpenAI es que GPT-5.6 incorpora varios mecanismos destinados a reducir el trabajo innecesario del modelo.
Estos incluyen:
- Generación de tokens más eficiente
- Caché de mensajes explícito
- Inferencia persistente
- Llamadas a herramientas programáticas
- Ejecución multiagente para cargas de trabajo adecuadas
- Profundidad de razonamiento configurable
La dirección de ingeniería es coherente: reducir el trabajo redundante en torno a cada tarea exitosa.
El caché de mensajes se vuelve más explícito
GPT-5.6 introduce un caché de mensajes más predecible.
La documentación de OpenAI admite puntos de corte de caché explícitos, que permiten a los desarrolladores decidir qué prefijos de mensajes reutilizables deben almacenarse en caché.
Para los modelos GPT-5.6:
- La escritura en caché se factura a 1,25 veces la tarifa normal de entrada no almacenada en caché.
- La lectura desde caché puede obtener un descuento del 90% en la entrada almacenada en caché.
- La documentación de OpenAI indica un ciclo de vida mínimo de caché de 30 minutos para el nuevo comportamiento de caché.
Esto cambia la forma en que los desarrolladores piensan sobre los agentes de larga duración.
Si los mensajes grandes del sistema, los directorios de herramientas, las secciones de políticas o el contexto del proyecto estable se envían repetidamente como entrada no almacenada en caché, el costo puede ser alto.
Cuando los prefijos reutilizables se mantienen estables, el caché puede reducir ese costo.
Al mismo tiempo, las escrituras innecesarias en caché pueden aumentar los costos. Por lo tanto, OpenAI recomienda realizar un seguimiento tanto del uso de tokens almacenados en caché como de los tokens de escritura en caché, en lugar de asumir que el caché siempre es más barato.
La orquestación de herramientas puede reducir las rondas de interacción del modelo
La segunda área principal de eficiencia es el marco del agente.
El ciclo de herramientas tradicional suele ser el siguiente:
- El modelo decide llamar a una herramienta.
- La aplicación ejecuta la herramienta.
- El resultado completo de la herramienta se devuelve al modelo.
- El modelo lee el resultado y decide el siguiente paso.
- Se llama a otra herramienta.
- El ciclo se repite.

Aunque este método es flexible, puede volverse costoso.
Las salidas grandes de herramientas intermedias pueden entrar repetidamente en el contexto del modelo, incluso si solo se necesita una pequeña parte de los datos.
Las llamadas a herramientas programáticas de GPT-5.6 ofrecen otra opción.
La documentación de OpenAI muestra que GPT-5.6 puede escribir JavaScript en un entorno de ejecución gestionado para:
- Llamar a herramientas que cumplan las condiciones
- Pasar resultados entre llamadas
- Filtrar datos intermedios
- Fusionar registros
- Ordenar resultados
- Deduplicar datos
- Validar datos
- Devolver resultados estructurados más pequeños al modelo
Para flujos de trabajo acotados, esto puede reducir:
- Rondas del modelo
- Crecimiento del mensaje
- Tokens intermedios
- Número de viajes de ida y vuelta en la red
OpenAI indica que este patrón es particularmente útil cuando el código puede manejar múltiples resultados predecibles de herramientas sin necesidad de reevaluar semánticamente después de cada llamada.
No es adecuado para todas las tareas de agente.
En los siguientes casos, la interacción directa modelo-herramienta sigue siendo la mejor opción:
- Una sola llamada a herramienta es suficiente
- Cada resultado puede provocar un cambio sustancial en el razonamiento del siguiente paso
- Se requiere aprobación humana
- Los resultados intermedios ya son pequeños
- La respuesta final debe conservar referencias nativas o artefactos
El objetivo no es minimizar el número de llamadas a toda costa, sino evitar pasar información innecesaria a través del modelo.
El historial de conversación y el razonamiento pueden gestionarse de forma más precisa
El artículo de AIBase también señala que una gestión más estricta del historial de conversación es un método para mejorar la tasa de reutilización del caché.
La guía de desarrollo actual de GPT-5.6 de OpenAI proporciona el mecanismo oficial relacionado: inferencia persistente.
Los desarrolladores pueden configurar cómo mantener disponible el razonamiento de rondas anteriores.
Esto es importante para los flujos de trabajo de larga duración, ya que no todas las ideas anteriores son igualmente útiles para siempre.
Si la tarea se mantiene estable, el razonamiento anterior puede mejorar la continuidad.
Si el objetivo cambia, mantener todo el razonamiento anterior aumenta los costos e introduce suposiciones obsoletas.
Por lo tanto, OpenAI permite a las aplicaciones controlar el contexto de razonamiento y recomienda conservar correctamente los elementos de respuesta necesarios al gestionar el historial manualmente.
Esto proporciona a los desarrolladores otra palanca para equilibrar los siguientes elementos:
- Continuidad
- Eficiencia del caché
- Tamaño del contexto
- Costo
- Calidad
Simplificar los mensajes también puede reducir el costo del agente
La guía de desarrollo de GPT-5.6 de OpenAI recomienda especialmente simplificar los mensajes.
En las muestras de ejecución de evaluación interna de agentes de codificación, OpenAI informa que simplificar los mensajes y las descripciones de las herramientas:
- Mejoró las puntuaciones de evaluación en aproximadamente un 10% a un 15%
- Redujo el número total de tokens entre un 41% y un 66%
- Redujo los costos entre un 33% y un 67%
OpenAI indica claramente que estas cifras son solo de referencia y explica que los resultados varían según la carga de trabajo.
La recomendación no es eliminar restricciones útiles.
Su objetivo es eliminar contenido duplicado.
El proceso de migración práctico es el siguiente:
- Partir de un conjunto de mensajes y herramientas que ya funcione correctamente.
- Eliminar un conjunto de instrucciones duplicadas cada vez.
- Volver a ejecutar la misma tarea de evaluación.
- Conservar las restricciones que mejoren la calidad medible.
- Eliminar aquellas instrucciones que aumenten los tokens sin mejorar el resultado.
Esto es especialmente importante para los productos de agente, ya que el mismo mensaje del sistema y las mismas descripciones de herramientas pueden enviarse miles de veces al día.
La selección del modelo debe coincidir con la carga de trabajo
La serie GPT-5.6 ofrece a los desarrolladores tres opciones principales de costo-calidad.
Usar Sol cuando la calidad sea la restricción principal
Elegir Sol cuando la tarea pueda beneficiarse sustancialmente de capacidades de vanguardia.
Casos de uso adecuados:
- Ingeniería de software de alta dificultad
- Investigación compleja
- Planificación a largo plazo
- Trabajo de ciberseguridad
- Análisis profesional de alto valor
- Tareas en las que una pequeña mejora en la calidad justifique el mayor costo del modelo
Usar Terra para trabajos de producción generales y potentes
Cuando la tarea requiera una capacidad de razonamiento sólida pero no necesite Sol, Terra es la opción pragmática.
Es adecuada para:
- Agentes empresariales cotidianos
- Asistencia de codificación
- Flujos de trabajo de documentación
- Subagentes de investigación
- Uso de herramientas de complejidad media
- Tareas profesionales de alto volumen
Usar Luna cuando el costo y el volumen sean los factores dominantes
Luna es la opción natural para los siguientes escenarios:
- Clasificación
- Extracción
- Enrutamiento
- Transformación de datos
- Flujos de trabajo de herramientas ligeras
- Automatización de fondo de alto volumen
Una arquitectura común consiste en enrutar el trabajo rutinario a Luna o Terra, y solo escalar las tareas más difíciles a Sol.
El precio es solo el punto de partida
Para los sistemas de agentes, una simple comparación por token puede ser engañosa.
Considera dos modelos.
El modelo A tiene un costo menor por token de salida, pero requiere:
- El doble de tokens de razonamiento
- Más llamadas a herramientas
- Más reintentos
- Más contexto
- Más rondas
El modelo B tiene un precio nominal más alto, pero necesita la mitad de pasos para completar la tarea.
El segundo modelo podría seguir siendo más barato calculando por tarea completada.
Por lo tanto, los equipos que evalúan GPT-5.6 deben rastrear:
- Tasa de éxito de tareas
- Total de tokens de entrada
- Total de tokens de salida
- Tokens de caché
- Tokens de escritura en caché
- Número de rondas del modelo
- Número de llamadas a herramientas
- Latencia
- Tasa de reintentos
- Tiempo de corrección manual
- Costo total por tarea exitosa
Esto es lo que realmente significa "inteligencia por token".
Pruebas de migración prácticas
Para los equipos que ya usan GPT-5.5 o modelos anteriores, una comparación controlada es más útil que una migración completa inmediata.
Paso 1: Construir un conjunto de evaluación representativo
Incluye:
- Solicitudes simples
- Solicitudes difíciles
- Tareas de contexto largo
- Flujos de trabajo intensivos en herramientas
- Casos de fallo conocidos
- Ejemplos de producción
Paso 2: Usar el esfuerzo de razonamiento actual como referencia
OpenAI sugiere comenzar con el mismo nivel de esfuerzo de razonamiento utilizado en el modelo anterior.
Luego prueba reduciendo un nivel.
GPT-5.6 puede mantener la calidad usando menos tokens de razonamiento, pero esto debe confirmarse en tu carga de trabajo.
Paso 3: Comparar Sol, Terra y Luna
No asumas que el modelo insignia es automáticamente la mejor opción de producción.
Mide si Terra o Luna pueden cumplir los mismos criterios de aceptación a un costo menor.
Paso 4: Probar el almacenamiento en caché de indicaciones
Rastrea las lecturas y escrituras de caché.
Cuando la tasa de reutilización es alta, el contexto estable puede volverse significativamente más económico, pero los prefijos de indicaciones que cambian con frecuencia pueden no beneficiarse tanto.
Paso 5: Probar llamadas a herramientas programáticas donde corresponda
Aplícalo en etapas de procesamiento con límites bien definidos, como:
- Filtrado
- Agregación
- Ordenamiento
- Uniones
- Deduplicación
Compara los resultados con las llamadas directas a herramientas normales.
Paso 6: Medir la economía de completar tareas
Una factura de tokens más baja solo tiene sentido si la tarea final sigue alcanzando los estándares de calidad.
El objetivo de optimización correcto no es la menor cantidad de tokens.
Es obtener resultados exitosos al costo confiable más bajo.
Por qué GPT-5.6 refleja un cambio más amplio hacia la eficiencia
Durante años, la competencia entre modelos de frontera ha estado dominada por una pregunta: ¿qué modelo es más capaz?
Esa pregunta sigue siendo importante.
Pero a medida que la IA entra en producción a gran escala, otra pregunta es igualmente relevante:
¿Cuánto trabajo útil puede completar un sistema por unidad de cómputo y por dólar invertido?
Los sistemas de agentes amplifican esta presión.
Una sola solicitud de usuario puede desencadenar:
- Múltiples rondas de razonamiento
- Búsquedas
- Ejecución de código
- APIs externas
- Subagentes
- Ventanas de contexto grandes
- Validaciones repetidas
Sin una orquestación cuidadosa, la factura total crece rápidamente.
GPT-5.6 refleja un cambio más amplio, desde simplemente escalar la capacidad intelectual hacia hacer que el despliegue de inteligencia sea más económico.
Sol impulsa la capacidad intelectual en el extremo superior.
Terra reduce el costo del trabajo potente de uso general.
Luna lleva la familia de modelos a cargas de trabajo de alto rendimiento.
El almacenamiento en caché de indicaciones y la orquestación programática de herramientas se enfocan en la sobrecarga del sistema alrededor de los propios modelos.
El resultado es una familia de modelos diseñada no solo en torno a puntuaciones de referencia, sino también en torno a la economía de producción.
Preguntas frecuentes
¿Qué es GPT-5.6?
GPT-5.6 es la familia de modelos de OpenAI para razonamiento complejo, programación, trabajo profesional, flujos de trabajo de agentes y aplicaciones de IA de alto rendimiento. La serie incluye actualmente Sol, Terra y Luna.
¿Cuál es la diferencia entre GPT-5.6 Sol, Terra y Luna?
Sol es el nivel insignia y más capaz. Terra equilibra inteligencia y costo, mientras que Luna está optimizada para cargas de trabajo de bajo costo y alto rendimiento.
¿Cuánto cuesta usar GPT-5.6 a través de la API?
OpenAI fija el precio de Sol en $5 por millón de tokens de entrada y $30 por millón de tokens de salida, Terra en $2.50/$15, y Luna en $1/$6. El precio de entrada en caché es más bajo, y las indicaciones muy largas pueden tener reglas de precios diferentes.
¿Cuál es la ventana de contexto de GPT-5.6?
La página actual del modelo API de OpenAI enumera las ventanas de contexto de Sol, Terra y Luna en 1,050,000 tokens. Cada modelo admite hasta 128,000 tokens de salida.
¿Es GPT-5.6 Sol mejor que GPT-5.5 para programar?
OpenAI informa que Sol obtiene puntuaciones más altas en varias evaluaciones de agentes de programación, incluido el Índice de Agentes de Programación de Artificial Analysis, SWE-Bench Pro, DeepSWE y Terminal-Bench 2.1. El rendimiento real en producción sigue dependiendo del repositorio, marco de agente, indicaciones y herramientas.
¿Qué son las llamadas a herramientas programáticas?
Las llamadas a herramientas programáticas permiten que GPT-5.6 escriba código para coordinar herramientas elegibles y manejar resultados intermedios en un entorno de ejecución gestionado. Pueden reducir los viajes de ida y vuelta del modelo y el uso de tokens en flujos de trabajo con límites bien definidos.
Por ejemplo, operaciones como filtrado, uniones, ordenamiento y agregación.
¿GPT-5.6 admite almacenamiento en caché de indicaciones?
Sí. GPT-5.6 admite almacenamiento en caché automático y puntos de interrupción de caché explícitos. OpenAI afirma que las lecturas de caché reciben un 90% de descuento en la entrada, mientras que las nuevas escrituras en caché cuestan 1.25 veces el precio de entrada no almacenada en caché.
¿Se debe usar Sol para cada solicitud?
Generalmente no. Si Terra o Luna pueden cumplir los mismos criterios de evaluación a un costo menor, usar un nivel de modelo más pequeño mejora la economía de la aplicación. Las tareas complejas solo deben enrutarse a Sol cuando una mayor capacidad genere beneficios medibles.
Herramientas relacionadas
- API de OpenAI: Plataforma oficial para desarrolladores para acceder a los modelos GPT-5.6 y herramientas de OpenAI.
- Guía de modelos GPT-5.6: Guía de migración y optimización de OpenAI para la familia de modelos GPT-5.6.
- GPT-5.6 Sol: Especificaciones oficiales del modelo, precios, límites de contexto y características compatibles con Sol.
- GPT-5.6 Terra: Página oficial del modelo para el nivel equilibrado GPT-5.6.
- GPT-5.6 Luna: Página oficial del modelo para el nivel de menor costo GPT-5.6.
- OpenAI Codex: Entorno de programación inteligente de OpenAI para flujos de trabajo de desarrollo de software.
Enlaces relacionados
- Lanzamiento de OpenAI GPT-5.6: Anuncio oficial de lanzamiento de OpenAI, que incluye tablas de referencia, detalles de seguridad, precios y disponibilidad del producto.
- Avance de GPT-5.6 Sol: Anuncio de avance temprano de OpenAI sobre Sol, Terra y Luna.
- Modelos de la API de OpenAI: Modelos actuales de la API de OpenAI.
Directorio oficial de modelos y sus especificaciones principales.
- Guía del modelo GPT-5.6: Instrucciones oficiales sobre consumo de inferencia, caché de indicaciones, inferencia continua y llamadas a herramientas de programación.
- Página de la API de GPT-5.6 Sol: Precios actuales de Sol, tamaño de contexto, fecha de corte de conocimiento y funciones de API compatibles.
- Página de la API de GPT-5.6 Terra: Precios y especificaciones del modelo actual de Terra.
- Página de la API de GPT-5.6 Luna: Precios y especificaciones del modelo actual de Luna.
Resumen
GPT-5.6 es una familia de modelos compuesta por tres niveles, no un único modelo de uso general. Sol está orientado a las capacidades de primer nivel, Terra ofrece un equilibrio más rentable para tareas de producción habituales, mientras que Luna está optimizado para escenarios de alto rendimiento.
El tema principal es la eficiencia. OpenAI reduce la carga de trabajo del modelo necesaria para completar tareas complejas combinando modelos con mayor eficiencia de tokens, caché explícito de indicaciones, inferencia continua, consumo de inferencia configurable y llamadas a herramientas de programación.
Fuentes de AIBase también informan de más optimizaciones en la pila de inferencia, incluyendo decodificación especulativa y trabajo en núcleos de GPU, que mejoran la velocidad de generación de tokens en más de un 15%.
Eficiencia. A menos que se reproduzca en publicaciones técnicas oficiales completamente documentadas de OpenAI, estos datos de bajo nivel deben considerarse como informes de fuentes.
La comprensión óptima de GPT-5.6 no es simplemente el lanzamiento de un modelo más potente, sino un intento de mejorar la economía de la inteligencia en todo el flujo de trabajo de los agentes.