OpenAI GPT-5.6 Sol, Terra e Luna: Desempenho, Preços e Eficiência em Detalhe
A série GPT-5.6 da OpenAI inclui três níveis de modelos: Sol, Terra e Luna. Em vez de oferecer um modelo único para todas as cargas de trabalho, a OpenAI segmenta a série por capacidade, custo e taxa de transferência: - GPT-5.6 Sol é o modelo principal, adequado para trabalhos profissionais complexos, programação, pesquisa, segurança cibernética e tarefas de agentes de longo prazo. - GPT-5.6 Terra é voltado para cargas de trabalho que ainda exigem inteligência robusta, mas com requisitos de custo mais rigorosos. - GPT-5.6 Luna é o membro mais rápido e de menor preço da série.

OpenAI GPT-5.6 Sol, Terra e Luna: Desempenho, Preços e Eficiência em Detalhe
Introdução
A série GPT-5.6 da OpenAI inclui três níveis de modelo: Sol, Terra e Luna.
Em vez de oferecer um único modelo para todas as cargas de trabalho, a OpenAI diferencia a série com base em capacidade, custo e taxa de transferência:
- GPT-5.6 Sol é o modelo principal, projetado para trabalhos profissionais complexos, programação, pesquisa, segurança cibernética e tarefas de agente de longo prazo.
- GPT-5.6 Terra é voltado para cargas de trabalho que ainda exigem inteligência robusta, mas com requisitos de custo mais rigorosos.
- GPT-5.6 Luna é o membro mais rápido e de menor preço da série, adequado para cargas de trabalho sensíveis a custo e de alta taxa de transferência.
A OpenAI visualizou esta série pela primeira vez em junho de 2026, e ela foi totalmente lançada em 9 de julho. O artigo original da AIBase foi publicado em 30 de julho, destacando as melhorias de eficiência por trás deste lançamento: melhor desempenho por token, níveis de modelo de menor custo e otimizações de infraestrutura e ciclo de agente projetadas para reduzir o custo total de conclusão de trabalho real.
Este foco é crucial. Para sistemas de IA em produção, as métricas relevantes cada vez mais não são apenas o quão inteligente um modelo parece isoladamente, mas quanto trabalho útil ele pode concluir dado um tempo, recurso computacional e orçamento específicos.
Três Modelos GPT-5.6 para Diferentes Cargas de Trabalho
A OpenAI descreve Sol, Terra e Luna como níveis de capacidade duradouros, não sufixos temporários.
O número da geração identifica a série GPT-5.6, enquanto os nomes distinguem os níveis esperados de desempenho e custo.
| Modelo | Posicionamento | Preço de Entrada da API | Preço de Saída da API | Janela de Contexto | Saída Máxima |
|---|---|---|---|---|---|
| GPT-5.6 Sol | Modelo principal para trabalho profissional complexo | US$ 5 por 1 milhão de tokens | US$ 30 por 1 milhão de tokens | 1.050.000 tokens | 128.000 tokens |
| GPT-5.6 Terra | Equilíbrio entre inteligência e custo | US$ 2,50 por 1 milhão de tokens | US$ 15 por 1 milhão de tokens | 1.050.000 tokens | 128.000 tokens |
| GPT-5.6 Luna | Carga de trabalho de alta taxa de transferência sensível a custo | US$ 1 por 1 milhão de tokens | US$ 6 por 1 milhão de tokens | 1.050.000 tokens | 128.000 tokens |
Todos os três modelos listam a data de corte de conhecimento de 16 de fevereiro de 2026 e suportam entrada de texto e imagem e saída de texto.
O alias da API gpt-5.6 roteia para GPT-5.6 Sol.
GPT-5.6 Sol: Modelo Principal
Sol é o nível GPT-5.6 mais capaz da OpenAI.
A OpenAI o posiciona para uso em:
- Programação complexa
- Fluxos de trabalho de agente de longo prazo
- Trabalho profissional especializado
- Pesquisa científica
- Segurança cibernética
- Uso de computador
- Análise multimodal
- Tarefas de raciocínio de alto valor
No Artificial Analysis Coding Agent Index v1.1, a OpenAI relata que GPT-5.6 Sol atinge uma pontuação de 80 no modo de raciocínio máximo, em comparação com a pontuação de 77,2 do Claude Fable 5 na mesma tabela.
A OpenAI também afirma que, nesta comparação, Sol usou menos da metade dos tokens de saída, menos da metade do tempo, enquanto seu custo estimado da tarefa é menor.
Isso não significa que Sol seja superior em todos os benchmarks. A própria tabela de lançamento da OpenAI mostra que modelos concorrentes lideram em algumas avaliações. O ponto de venda mais consistente do GPT-5.6 é o desempenho por token e por dólar, em vez de liderar em todas as categorias de tarefas.
GPT-5.6 Terra: Nível Equilibrado
Terra é o modelo intermediário na série.
A OpenAI descreve sua capacidade como comparável ao nível GPT-5.5, enquanto cobra:
- US$ 2,50 por milhão de tokens de entrada
- US$ 15 por milhão de tokens de saída
Isto equivale à metade do preço de US$ 5 / US$ 30 do nível principal anterior.
Portanto, Terra é adequado para cargas de trabalho onde as equipes precisam de raciocínio robusto e capacidades de agente, mas não precisam usar Sol para cada solicitação.
Exemplos típicos incluem:
- Agentes empresariais internos
- Subagentes de codificação
- Análise de documentos
- Fluxos de pesquisa
- Automação intensiva em ferramentas
- Tarefas profissionais de alto volume
O modelo suporta a mesma janela de contexto de 1,05 milhão de tokens e saída máxima de 12,8 mil tokens que o Sol.
GPT-5.6 Luna: Nível GPT-5.6 de Menor Custo
Luna é projetado para cargas de trabalho onde a taxa de transferência e o custo são mais críticos.
Seus preços de API são:
- US$ 1 por milhão de tokens de entrada
- US$ 6 por milhão de tokens de saída
Isso torna o preço de entrada e saída 80% menor que o Sol.
A OpenAI descreve Luna como seu modelo GPT-5.6 mais rápido e acessível. É adequado para cargas de trabalho como:
- Classificação
- Extração
- Roteamento
- Processamento de alto volume
- Agentes leves
- Tarefas estruturadas repetitivas
- Aplicativos que podem escalar casos difíceis para Terra ou Sol
O preço mais baixo não significa que Luna seja apenas um modelo utilitário sem raciocínio. Ele ainda suporta as funções de raciocínio do GPT-5.6 e o ecossistema de ferramentas da OpenAI, mas seu teto de capacidade é menor que o Sol.

Eficiência é o Tema Central do GPT-5.6
O artigo da AIBase enfatiza que o GPT-5.6 não é apenas uma atualização na qualidade do modelo.
O objetivo maior da engenharia é aumentar a quantidade de trabalho útil produzido por token e reduzir a sobrecarga adicional da execução do agente.
Os materiais oficiais de lançamento da OpenAI apoiam esta direção mais ampla.
A empresa afirma que o GPT-5.6 foi treinado para concluir trabalho útil com menos tokens de saída, e seu guia de desenvolvedores sugere que, ao migrar do GPT-5.5 ou GPT-5.4, teste o mesmo esforço de raciocínio — geralmente reduzindo um nível.
Isto é importante porque o preço anunciado por token é apenas uma parte do custo do agente.
Um fluxo de trabalho de várias etapas pode consumir custos através de:
- Muitos prompts
- Contexto repetido
- Tokens de raciocínio
- Definições de ferramentas
- Saídas de ferramentas
- Loops de retry
- Múltiplas rodadas de modelo
- Subagentes
- Respostas finais longas
Portanto, um modelo que requer menos etapas, mesmo que sua taxa nominal por token pareça semelhante, pode ser mais barato na prática.
O Desempenho de Codificação do Sol Melhora a Relação Custo-Benefício
O artigo original destaca o desempenho do agente de codificação Sol.
Tabela de referência atual da OpenAI
Relatório:
| Avaliação de Codificação | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 |
|---|---|---|---|---|
| Índice de Inteligência de Codificação por Análise de IA v1.1 | 80 | 77,4 | 74,6 | 76,4 |
| SWE-Bench Pro | 64,6% | 63,4% | 62,7% | 59,4% |
| DeepSWE v1.1 | 72,7% | 69,6% | 67,2% | 67,0% |
| Terminal-Bench 2.1 | 88,8% | 87,4% | 84,7% | 85,6% |
Estes dados provêm da tabela de lançamento publicada pela OpenAI e devem ser interpretados no contexto de estruturas e configurações de avaliação específicas.
Por exemplo, os resultados de referência podem variar de acordo com:
- Profundidade de raciocínio
- Estrutura do agente
- Disponibilidade de ferramentas
- Limites de tempo
- Número de sementes de avaliação
- Instantâneos do modelo
- Formato do prompt
A OpenAI também observa que algumas de suas comparações de custo e latência são baseadas em estimativas offline do comportamento de produção, e não em faturamento direto de cada serviço concorrente.
A lição prática é testar modelos em cargas de trabalho representativas de produção, em vez de selecionar modelos apenas com base em rankings.
A pilha de inferência está sendo otimizada, não apenas o modelo
A fonte AIBase descreve a otimização de toda a pilha de serviços, incluindo:
- Balanceamento de carga
- Decodificação especulativa
- Otimização de cache
- Kernels de GPU otimizados
Ela também relata que o trabalho de inferência melhorou a eficiência da geração de tokens em mais de 15%.
Estes detalhes subjacentes do serviço são apresentados no relatório da AIBase. A atual página de lançamento público do GPT-5.6 da OpenAI confirma o esforço mais amplo para melhorar o serviço e a eficiência da pesquisa, mas os dados subjacentes exatos devem ser considerados como relatados pela fonte, a menos que sejam reproduzidos em publicações técnicas da OpenAI ou benchmarks que documentem métodos completos.
O que pode ser confirmado de forma independente a partir da documentação da OpenAI é que o GPT-5.6 adicionou vários mecanismos destinados a reduzir o trabalho desnecessário do modelo.
Isso inclui:
- Geração de tokens mais eficiente
- Cache de prompt explícito
- Inferência persistente
- Chamada programática de ferramentas
- Execução multiagente para cargas de trabalho adequadas
- Profundidade de raciocínio configurável
A direção da engenharia é coerente: reduzir o trabalho redundante em torno de cada tarefa bem-sucedida.
O cache de prompt tornou-se mais explícito
O GPT-5.6 introduziu um cache de prompt mais previsível.
A documentação da OpenAI oferece suporte a pontos de interrupção de cache explícitos, permitindo que os desenvolvedores decidam quais prefixos de prompt reutilizáveis devem ser armazenados em cache.
Para os modelos GPT-5.6:
- A gravação em cache é faturada a 1,25 vez a taxa normal de entrada sem cache.
- A leitura do cache pode obter um desconto de 90% na entrada em cache.
- A documentação da OpenAI indica um tempo de vida mínimo de cache de 30 minutos para o novo comportamento de cache.
Isso muda a forma como os desenvolvedores pensam sobre agentes de longo prazo.
Se grandes prompts de sistema, catálogos de ferramentas, seções de política ou contextos de projeto estáveis são enviados repetidamente como entrada sem cache, o custo pode ser alto.
Quando os prefixos reutilizáveis permanecem estáveis, o cache pode reduzir esse custo.
No entanto, gravações de cache desnecessárias podem aumentar o custo. Portanto, a OpenAI recomenda rastrear o uso de tokens de cache e tokens de gravação de cache simultaneamente, em vez de assumir que o cache é sempre mais barato.
A orquestração de ferramentas pode reduzir idas e vindas do modelo
A segunda área principal de eficiência é a estrutura do agente.
O ciclo tradicional de ferramentas geralmente é o seguinte:
- O modelo decide chamar
- O aplicativo executa a ferramenta.
- O resultado completo da ferramenta é retornado ao modelo.
- O modelo lê o resultado e decide o próximo passo.
- Outra ferramenta é chamada.
- O ciclo se repete.

Embora flexível, essa abordagem pode se tornar cara.
Grandes saídas intermediárias de ferramentas podem entrar repetidamente no contexto do modelo, mesmo que apenas uma pequena parte dos dados seja necessária.
A chamada programática de ferramentas do GPT-5.6 oferece uma alternativa.
A documentação da OpenAI mostra que o GPT-5.6 pode escrever JavaScript em um ambiente de execução gerenciado para:
- Chamar ferramentas qualificadas
- Passar resultados entre chamadas
- Filtrar dados intermediários
- Mesclar registros
- Ordenar resultados
- Deduplicar dados
- Validar dados
- Retornar resultados estruturados menores ao modelo
Para fluxos de trabalho limitados, isso pode reduzir:
- Rodadas do modelo
- Crescimento do prompt
- Tokens intermediários
- Número de idas e vindas na rede
A OpenAI afirma que esse padrão é particularmente útil quando o código pode lidar com vários resultados previsíveis de ferramentas sem precisar reavaliar semanticamente após cada chamada.
Não é adequado para todas as tarefas de agente.
A interação direta modelo-ferramenta ainda é a melhor escolha quando:
- Uma única chamada de ferramenta é suficiente
- Cada resultado pode levar a uma mudança substancial no raciocínio seguinte
- É necessária aprovação humana
- Os resultados intermediários já são pequenos
- A resposta final deve manter referências ou artefatos nativos
O objetivo não é minimizar o número de chamadas a todo custo, mas evitar passar informações desnecessárias pelo modelo.
Histórico de conversas e raciocínio podem ser gerenciados de forma mais refinada
O artigo da AIBase também aponta que um gerenciamento mais rigoroso do histórico de conversas é uma forma de melhorar a taxa de reutilização do cache.
O guia de desenvolvimento atual do GPT-5.6 da OpenAI fornece o mecanismo oficial relacionado: inferência persistente.
Os desenvolvedores podem configurar como o raciocínio de rodadas anteriores permanece disponível.
Isso é importante para fluxos de trabalho de longo prazo, pois nem todas as ideias anteriores são igualmente úteis para sempre.
Se a tarefa permanecer estável, o raciocínio anterior pode melhorar a continuidade.
Se o objetivo mudar, manter todo o raciocínio anterior aumenta o custo e introduz suposições desatualizadas.
Portanto, a OpenAI permite que os aplicativos controlem o contexto de raciocínio e recomenda preservar corretamente os itens de resposta necessários ao gerenciar o histórico manualmente.
Isso dá aos desenvolvedores outra alavanca para equilibrar:
- Continuidade
- Eficiência do cache
- Tamanho do contexto
- Custo
- Qualidade
Prompts simplificados também podem reduzir custos do agente
O guia de desenvolvimento do GPT-5.6 da OpenAI recomenda especificamente prompts simplificados.
Em amostras de execuções internas de avaliação de agente de codificação, a OpenAI relata que simplificar prompts e descrições de ferramentas:
- Melhorou as pontuações de avaliação em cerca de 10% a 15%
- Reduziu o número total de tokens em 41% a 66%
- Reduziu os custos em 33% a 67%
A OpenAI afirma explicitamente que esses números são apenas para referência e que os resultados variam de acordo com a carga de trabalho.
A recomendação não é remover restrições úteis.
O objetivo é eliminar conteúdo duplicado.
Um fluxo de migração prático é o seguinte:
- Comece com prompts e conjuntos de ferramentas que já funcionam corretamente.
- Remova um conjunto de instruções duplicadas de cada vez.
- Reexecute a mesma tarefa de avaliação.
- Mantenha as restrições que melhoram a qualidade mensurável.
- Remova instruções que aumentam tokens sem melhorar os resultados.
Isso é particularmente importante para produtos de agente, onde o mesmo prompt de sistema e descrições de ferramentas podem ser enviados milhares de vezes por dia.
A seleção do modelo deve corresponder à carga de trabalho
A série GPT-5.6 oferece aos desenvolvedores três opções principais de custo-qualidade.
Use Sol quando a qualidade for a principal restrição
Escolha Sol quando a tarefa puder se beneficiar substancialmente de capacidades de ponta.
Cenários de uso incluem:
- Engenharia de software de alta dificuldade
- Pesquisa complexa
- Planejamento de longo prazo
- Trabalho de segurança cibernética
- Análise profissional de alto valor
- Tarefas onde um pequeno ganho de qualidade justifica o custo maior do modelo
Use Terra para cargas de trabalho de produção de uso geral poderosas
Quando a tarefa requer capacidade de raciocínio relativamente forte, mas não o Sol, o Terra é a escolha prática.
É adequado para:
- Agentes empresariais do dia a dia
- Assistência de codificação
- Fluxos de trabalho de documentação
- Subagentes de pesquisa
- Uso de ferramentas de complexidade média
- Tarefas profissionais de alto volume
Use Luna quando custo e volume forem dominantes
A Luna é a escolha natural para os seguintes cenários:
- Classificação
- Extração
- Roteamento
- Transformação de dados
- Fluxos de trabalho de ferramentas leves
- Automação de backend de alto volume
Uma arquitetura comum é rotear trabalhos regulares para a Luna ou Terra, encaminhando apenas as tarefas mais difíceis para a Sol.
O preço é apenas o ponto de partida
Para sistemas de agentes, uma simples comparação de tokens pode ser enganosa.
Considere dois modelos.
O Modelo A tem um custo menor por token de saída, mas requer:
- O dobro de tokens de raciocínio
- Mais chamadas de ferramenta
- Mais tentativas
- Mais contexto
- Mais rodadas
O Modelo B tem um preço mais alto, mas reduz pela metade as etapas necessárias para concluir a tarefa.
O segundo modelo ainda pode ser mais barato por tarefa concluída.
Portanto, as equipes que avaliam o GPT-5.6 devem monitorar:
- Taxa de sucesso da tarefa
- Total de tokens de entrada
- Total de tokens de saída
- Tokens em cache
- Tokens de gravação em cache
- Número de rodadas do modelo
- Número de chamadas de ferramenta
- Latência
- Taxa de tentativas
- Tempo de correção manual
- Custo total por tarefa bem-sucedida
Este é o verdadeiro significado de "inteligência por token".
Teste de migração prático
Para equipes que já usam o GPT-5.5 ou modelos anteriores, uma comparação controlada é mais útil do que uma migração completa imediata.
Etapa 1: Construa um conjunto de avaliação representativo
Inclui:
- Solicitações simples
- Solicitações difíceis
- Tarefas de contexto longo
- Fluxos de trabalho com uso intensivo de ferramentas
- Casos de falha conhecidos
- Exemplos de produção
Etapa 2: Use o esforço de raciocínio atual como linha de base
A OpenAI sugere começar com o mesmo esforço de raciocínio usado no modelo anterior.
Em seguida, teste a redução de um nível.
O GPT-5.6 pode manter a qualidade usando menos tokens de raciocínio, mas isso precisa ser confirmado na sua carga de trabalho.
Etapa 3: Compare Sol, Terra e Luna
Não presuma que o modelo principal é automaticamente a melhor escolha para produção.
Meça se a Terra ou a Luna podem atender aos mesmos critérios de aceitação a um custo menor.
Etapa 4: Teste o cache de prompt
Acompanhe as leituras e gravações em cache.
Quando a taxa de reutilização é alta, um contexto estável pode se tornar significativamente mais econômico, mas prefixos de prompt que mudam com frequência podem não se beneficiar muito.
Etapa 5: Teste chamadas de ferramenta programáticas onde apropriado
Aplique-as em estágios de processamento com limites bem definidos, como:
- Filtragem
- Agregação
- Ordenação
- Junção
- Deduplicação
Compare os resultados com chamadas de ferramenta diretas comuns.
Etapa 6: Meça a economia de concluir a tarefa
Uma conta de tokens mais baixa só faz sentido se a tarefa final ainda atingir os padrões de qualidade.
O objetivo de otimização correto não é o menor número de tokens.
É obter um resultado bem-sucedido ao menor custo confiável.
Por que o GPT-5.6 reflete uma mudança mais ampla em direção à eficiência
Por anos, a competição entre modelos de fronteira foi dominada por uma questão: qual modelo é mais capaz?
Essa questão ainda é importante.
Mas, com a IA entrando em produção em larga escala, outra questão se torna igualmente importante:
Quanto trabalho útil o sistema pode realizar por unidade de computação e por dólar investido?
Os sistemas de agentes amplificam essa pressão.
Uma única solicitação de usuário pode desencadear:
- Múltiplas rodadas de raciocínio
- Pesquisa
- Execução de código
- APIs externas
- Subagentes
- Grandes janelas de contexto
- Validação repetida
Sem uma orquestração cuidadosa, a conta total pode crescer rapidamente.
O GPT-5.6 reflete uma mudança mais ampla, de simplesmente escalar a capacidade intelectual para tornar a implantação de IA mais econômica.
A Sol impulsiona a capacidade intelectual no topo.
A Terra reduz o custo do trabalho geral poderoso.
A Luna traz a família de modelos para cargas de trabalho de alto rendimento.
O cache de prompt e a orquestração programática de ferramentas visam a sobrecarga do sistema ao redor do próprio modelo.
O resultado é uma família de modelos projetada não apenas em torno de pontuações de referência, mas também em torno da economia de produção.
Perguntas frequentes
O que é o GPT-5.6?
O GPT-5.6 é a família de modelos da OpenAI para raciocínio complexo, programação, trabalho especializado, fluxos de trabalho de agentes e aplicações de IA de alto rendimento. A série atualmente inclui Sol, Terra e Luna.
Qual é a diferença entre GPT-5.6 Sol, Terra e Luna?
A Sol é o nível principal e mais capaz. A Terra equilibra inteligência e custo, enquanto a Luna é otimizada para cargas de trabalho de baixo custo e alto rendimento.
Qual é o custo de usar o GPT-5.6 via API?
A OpenAI precifica a Sol em US$ 5 por milhão de tokens de entrada e US$ 30 por milhão de tokens de saída, a Terra em US$ 2,50/US$ 15 e a Luna em US$ 1/US$ 6. Os preços de entrada em cache são mais baixos e prompts muito longos podem ter preços diferentes.
Qual é a janela de contexto do GPT-5.6?
A página atual do modelo de API da OpenAI lista a janela de contexto para Sol, Terra e Luna como 1.050.000 tokens. Cada modelo suporta até 128.000 tokens de saída.
O GPT-5.6 Sol é melhor para programação do que o GPT-5.5?
A OpenAI relata que a Sol obtém pontuações mais altas em várias avaliações de agentes de programação, incluindo o Artificial Analysis Coding Agent Index, SWE-Bench Pro, DeepSWE e Terminal-Bench 2.1. O desempenho real em produção ainda depende do repositório, estrutura do agente, prompt e ferramentas.
O que são chamadas de ferramenta programáticas?
As chamadas de ferramenta programáticas permitem que o GPT-5.6 escreva código para orquestrar ferramentas elegíveis em um tempo de execução hospedado e processar resultados intermediários. Elas podem reduzir viagens de ida e volta do modelo e uso de tokens em fluxos de trabalho com limites bem definidos.
Por exemplo, operações como filtragem, junção, ordenação e agregação.
O GPT-5.6 suporta cache de prompt?
Sim. O GPT-5.6 suporta cache automático e pontos de interrupção de cache explícitos. A OpenAI afirma que as leituras em cache recebem 90% de desconto na entrada, enquanto novas gravações em cache custam 1,25x o preço da entrada não armazenada em cache.
Devo usar a Sol para cada solicitação?
Geralmente não. Se a Terra ou a Luna puderem atender aos mesmos critérios de avaliação a um custo menor, usar um nível de modelo menor melhora a economia da aplicação. Apenas encaminhe tarefas complexas para a Sol quando a maior capacidade trouxer benefícios mensuráveis.
Ferramentas relacionadas
- API da OpenAI: A plataforma oficial de desenvolvedores para acessar modelos GPT-5.6 e ferramentas da OpenAI.
- Guia de modelos GPT-5.6: Guia de migração e otimização da OpenAI para a série de modelos GPT-5.6.
- GPT-5.6 Sol: Especificações oficiais do modelo, preços, limites de contexto e recursos suportados pela Sol.
- GPT-5.6 Terra: Página oficial do modelo para o nível equilibrado GPT-5.6.
- GPT-5.6 Luna: Página oficial do modelo para o nível de menor custo do GPT-5.6.
- OpenAI Codex: O ambiente de programação inteligente da OpenAI para fluxos de trabalho de desenvolvimento de software.
Links relacionados
- Lançamento do OpenAI GPT-5.6: Anúncio oficial de lançamento da OpenAI com tabelas de benchmark, detalhes de segurança, preços e disponibilidade do produto.
- Prévia do GPT-5.6 Sol: Anúncio de prévia inicial da OpenAI sobre Sol, Terra e Luna.
- [Modelos de API da OpenAI](https://developers.openai.com/api/docs/models
Catálogo oficial dos modelos e suas especificações principais.
- Guia do modelo GPT-5.6: Orientações oficiais sobre consumo de raciocínio, cache de prompts, raciocínio contínuo e chamadas de ferramentas de programação.
- Página da API GPT-5.6 Sol: Preços atuais do Sol, janela de contexto, data de corte de conhecimento e funcionalidades da API suportadas.
- Página da API GPT-5.6 Terra: Preços atuais e especificações do modelo Terra.
- Página da API GPT-5.6 Luna: Preços atuais e especificações do modelo Luna.
Resumo
O GPT-5.6 é uma família de modelos composta por três níveis, não um único modelo de uso geral. O Sol é voltado para capacidades de ponta, o Terra oferece um equilíbrio mais econômico para tarefas regulares de produção, e o Luna é otimizado para cenários de alto throughput.
O tema principal é eficiência. A OpenAI reduz a carga de trabalho do modelo necessária para concluir tarefas complexas ao combinar modelos com maior eficiência de tokens, cache explícito de prompts, raciocínio contínuo, consumo de raciocínio configurável e chamadas de ferramentas de programação.
Fontes da AIBase também relataram mais otimizações na pilha de inferência, incluindo decodificação especulativa e trabalho em núcleos de GPU, resultando em um aumento de mais de 15% na velocidade de geração de tokens.
Eficiência. A menos que reproduzidos em publicações técnicas completamente documentadas da OpenAI, esses dados de baixo nível devem ser tratados como reportagens de fontes.
A melhor compreensão do GPT-5.6 não é apenas o lançamento de um modelo mais forte, mas uma tentativa de melhorar a economia da inteligência em todo o fluxo de trabalho dos agentes.