OpenAI reduz preço do GPT-5.6 Luna em 80% e lança modo Sol API mais rápido
A OpenAI realizou um grande ajuste de preços na série GPT-5.6. A partir de 30 de julho de 2026, a empresa reduziu o preço da API do GPT-5.6 Luna em 80% e do GPT-5.6 Terra em 20%. A

OpenAI reduz preço do GPT-5.6 Luna em 80% e lança modo Sol API mais rápido
Introdução
A OpenAI fez ajustes significativos de preços na família GPT-5.6.
Desde 30 de julho de 2026, a empresa reduziu o preço da API do GPT-5.6 Luna em 80% e o do GPT-5.6 Terra em 20%. O preço padrão do modelo principal GPT-5.6 Sol permanece inalterado, mas a OpenAI lançou um modo rápido que processa até 2,5 vezes mais rápido que o modo padrão, mantendo o mesmo nível de inteligência do modelo.
Essa mudança chega logo após a OpenAI publicar uma análise de engenharia mostrando como o GPT-5.6 Sol ajudou a otimizar os sistemas usados para servir o próprio GPT-5.6. Segundo a OpenAI, melhorias nos núcleos de GPU em produção reduziram o custo de serviço de ponta a ponta em 20%, enquanto melhorias na decodificação especulativa aumentaram a eficiência de geração de tokens em mais de 15%.
O resultado é que a OpenAI está adotando uma estratégia mais agressiva na chamada fronteira de custo-benefício: alinhar a quantidade de inteligência utilizada ao valor econômico da tarefa.

Para desenvolvedores, a mudança mais importante é clara: Luna agora é drasticamente mais barata para cargas de trabalho de agentes de alto volume, Terra tem custo menor para uso diário e Sol pode ser adquirido em um nível de serviço superior quando a latência importa mais que o preço.
1. Luna com redução de 80%, Terra com redução de 20% e Sol com modo rápido
A atualização de preços de 30 de julho abrange toda a família GPT-5.6, mas os ajustes não são uniformes entre os modelos.
GPT-5.6 Luna: a maior redução
Luna recebeu o corte de preço mais agressivo.
O preço padrão da API foi ajustado dos seguintes valores:
| Tipo de token | Preço antigo | Preço novo | Variação |
|---|---|---|---|
| Entrada | US$ 1,00 / 1 milhão de tokens | US$ 0,20 / 1 milhão de tokens | -80% |
| Saída | US$ 6,00 / 1 milhão de tokens | US$ 1,20 / 1 milhão de tokens | -80% |
A OpenAI descreve o Luna como o modelo mais rápido e acessível da família GPT-5.6, posicionando-o para cargas de trabalho de alto volume sensíveis a custo.
Isso inclui tarefas como:
- Classificação
- Extração de informações
- Agentes em segundo plano
- Trabalho de codificação diário
- Geração de testes
- Fluxos de trabalho com saída estruturada
- Subagentes que usam ferramentas
- Processamento de documentos em larga escala
O preço mais baixo muda especialmente a economia dos ciclos de agentes, porque uma única solicitação do usuário pode envolver várias chamadas de modelo, em vez de uma única conclusão simples.
A OpenAI afirma que o Luna é capaz de usar ferramentas e concluir fluxos de trabalho de múltiplas etapas, o que torna viável delegar mais trabalho a modelos de custo menor, sem precisar reservar o comportamento de agente para o nível de fronteira mais caro.
GPT-5.6 Terra: redução menor, mas relevante
O preço padrão da API do Terra agora é:
| Tipo de token | Preço antigo | Preço novo | Variação |
|---|---|---|---|
| Entrada | US$ 2,50 / 1 milhão de tokens | US$ 2,00 / 1 milhão de tokens | -20% |
| Saída | US$ 15,00 / 1 milhão de tokens | US$ 12,00 / 1 milhão de tokens | -20% |
O Terra continua sendo o modelo intermediário da família GPT-5.6.
Ele foi projetado para cargas de trabalho que exigem mais raciocínio que o Luna, mas que não necessariamente precisam do custo mais alto do Sol.
Aplicações típicas incluem:
- Agentes empresariais do dia a dia
- Assistência de codificação
- Perguntas e respostas no ambiente de trabalho
- Análise de documentos
- Pesquisa com escopo definido
- Fluxos de trabalho profissionais com múltiplas etapas
A OpenAI mencionou a Notion como um dos clientes que usam o Terra para cargas de trabalho de agentes pessoais, como perguntas e respostas sensíveis à latência no ambiente de trabalho e tarefas com escopo definido.
GPT-5.6 Sol mantém o preço padrão
O preço padrão da API do Sol permanece inalterado:
| Tipo de token | Preço padrão |
|---|---|
| Entrada | US$ 5,00 / 1 milhão de tokens |
| Saída | US$ 30,00 / 1 milhão de tokens |
A mudança no Sol não é uma redução de preço.
Em vez disso, a OpenAI lançou o modo rápido.
Modo rápido do Sol: até 2,5 vezes mais veloz
O modo rápido substitui a terminologia anterior de "processamento prioritário" da OpenAI.
Para o GPT-5.6 Sol, a OpenAI afirma que o modo rápido processa até 2,5 vezes mais rápido que o processamento padrão, com o mesmo nível de inteligência do modelo.
O custo é o preço.
O modo rápido custa o dobro do processamento padrão.
Para o Sol, isso significa:
| Tipo de token | Padrão | Modo rápido |
|---|---|---|
| Entrada | US$ 5,00 / 1 milhão | US$ 10,00 / 1 milhão |
| Entrada em cache | US$ 0,50 / 1 milhão | US$ 1,00 / 1 milhão |
| Saída | US$ 30,00 / 1 milhão | US$ 60,00 / 1 milhão |
As solicitações existentes à API que usam:
service_tier="priority"
permanecem compatíveis e são roteadas para o modo rápido.
A OpenAI também aceita:
service_tier="fast"
como o novo identificador do serviço renomeado.
O modo rápido é útil quando o custo de esperar é maior que o custo de uma inferência mais rápida.
Exemplos incluem:
- Agentes de codificação interativos
- Fluxos de trabalho de produção sensíveis ao tempo
- Assistência analítica em tempo real
- Operações de clientes de alto valor
- Tarefas complexas de agentes em que a latência se acumula em múltiplas etapas
Um fluxo de trabalho que exige 20 ou 30 chamadas de modelo, mesmo que cada chamada individual tenha baixa latência, pode parecer muito mais lento do que uma única resposta de chat. Portanto, em sistemas de agentes, o processamento mais rápido pode ter um impacto desproporcionalmente importante.
Mudanças também na medição de uso do ChatGPT Work e do Codex
Os preços mais baixos do Luna e do Terra também se refletem na forma como o uso é calculado no ChatGPT Work e no Codex.
A OpenAI afirma:
- Usuários gratuitos e usuários Go podem usar o Terra.
- Usuários Plus, Pro, Business e Enterprise podem escolher entre Terra e Luna.
- Os preços das assinaturas e os orçamentos de cota permanecem inalterados.
- Como Luna e Terra estão mais baratos, agora eles consomem menos créditos.
Isso não significa que as assinaturas pagas ficaram mais baratas.
A mudança significa que, quando o usuário escolhe Luna ou Terra, a mesma cota dura mais tempo.

Custo-benefício se torna uma métrica mais importante para modelos
A OpenAI publicou um gráfico de preço versus inteligência com base no Artificial Analysis Intelligence Index v4.1 para ilustrar o novo posicionamento do Luna.
O gráfico coloca o GPT-5.6 Luna acima da marca de 50 pontos no índice de inteligência, mostrando que, após o ajuste de preço, um dos
O custo estimado da tarefa configurada é de aproximadamente 0,05 USD.
Este dado não deve ser confundido com o preço de uma única chamada de API.
A Artificial Analysis calcula o custo por tarefa de índice de inteligência com base no uso de tokens do modelo e em uma metodologia ponderada de benchmarks. O custo de requisições reais em produção depende de:
Tamanho da entrada
Tamanho da saída
Profundidade de raciocínio
Cache de prompt
Número de chamadas de ferramentas
Número de rodadas de execução do agente
Cobrança por contexto longo
Mecanismos de nova tentativa
Antes da redução de preços em 30 de julho, a Artificial Analysis reportou que o GPT-5.6 Luna tinha um índice de inteligência de aproximadamente 51 na configuração máxima de raciocínio.
Os novos preços mais baixos por token aproximaram ainda mais o Luna da extremidade de baixo custo da curva "inteligência-custo".
A mensagem mais ampla transmitida pela OpenAI é: as empresas não devem usar o modelo mais caro em todas as etapas.
Um fluxo de trabalho pode primeiro usar o Sol para eliminar ambiguidades e elaborar um plano, e depois atribuir tarefas bem definidas de implementação, testes ou trabalhos repetitivos ao Luna.
Quando modelos de camadas inferiores já possuem capacidade de usar ferramentas e concluir fluxos de trabalho de múltiplas etapas, esse tipo de roteamento de modelos se torna ainda mais atraente.
2. O GPT-5.6 ajudou a otimizar a infraestrutura que executa o GPT-5.6
Um dia antes da redução de preços, a OpenAI publicou um artigo técnico detalhado sobre como o GPT-5.6 se tornou mais eficiente.
O aspecto mais incomum dessa história é que o próprio GPT-5.6 Sol participou do processo de otimização.
A OpenAI afirmou que seus engenheiros usaram o Sol por meio do Codex para analisar sistemas de produção, escrever código de performance, testar alternativas e monitorar experimentos.
A empresa descreveu otimizações em três grandes camadas:
- Conjunto de ferramentas de agentes
- Orquestração de API e requisições
- Inferência de modelos em infraestrutura de GPU
O Sol ajudou a otimizar os kernels de GPU em produção
Na camada de inferência, a OpenAI afirmou que o GPT-5.6 Sol reescreveu e otimizou de forma autônoma os kernels de produção.
Kernels de GPU são programas de baixo nível responsáveis por executar operações matemáticas de forma eficiente no hardware acelerador.
Mesmo que a arquitetura subjacente do modelo não mude, movimentações de memória ineficientes, sincronização, escalonamento ou layout de dados podem fazer com que recursos caros de GPU fiquem subutilizados.
A OpenAI afirmou que o Sol ajudou a identificar os seguintes tipos de computação otimizáveis:
- Pré-computáveis
- Evitáveis
- Paralelizáveis
- Reordenáveis
- Implementáveis por meio de kernels mais eficientes
A empresa mencionou especificamente as tecnologias de programação de GPU Triton e Gluon como participantes desse trabalho.
Segundo a OpenAI, as melhorias nos kernels e otimizações de serviços relacionadas reduziram o custo de serviço de ponta a ponta do GPT-5.6 em 20%.
O Sol também melhorou a decodificação especulativa
Outra otimização importante veio da decodificação especulativa.
Uma versão simplificada da decodificação especulativa é a seguinte:
- Um modelo de rascunho menor prevê alguns tokens possíveis subsequentes.
- O modelo principal avalia esses tokens candidatos em paralelo.
- Os tokens aceitos podem ser emitidos sem a mesma quantidade de trabalho sequencial de geração.
Portanto, a qualidade do modelo de rascunho é crucial.
A OpenAI afirmou que o GPT-5.6 Sol projetou e executou centenas de experimentos sobre a arquitetura do modelo especulativo, com alterações incluindo:
- Escala
- Estrutura
- Características
- Configuração de treinamento
O Sol também monitorava o processo de treinamento e intervinha quando havia falhas de hardware ou instabilidade no treinamento.
A OpenAI afirmou que as melhorias resultantes aumentaram a eficiência de geração de tokens em mais de 15%.

O balanceamento de carga também é importante
O custo do modelo não depende apenas do código executado dentro de uma única GPU.
As requisições precisam ser roteadas entre os seguintes níveis:
- Regiões
- Data centers
- Tipos de aceleradores
- Clusters
- Instâncias de modelo
- Sub-redes de modelo
- Núcleos de computação
Se a distribuição do trabalho for inadequada e parte do hardware ficar ociosa, os custos podem permanecer elevados mesmo com aceleradores de alto desempenho.
A OpenAI afirmou que o Sol ajudou a analisar o tráfego de produção, identificar as causas do desbalanceamento de carga, testar estratégias alternativas de roteamento e ajustar as heurísticas usadas para distribuir requisições.
Esse tipo de otimização operacional pode aumentar a taxa de transferência geral sem um investimento proporcional em hardware.
O gerenciamento de contexto reduz o processamento redundante
A OpenAI também otimizou a estrutura de agentes usada por sistemas como Codex e ChatGPT Work.
Um agente pode precisar fazer múltiplas chamadas de modelos e ferramentas antes de retornar um resultado final.
Por exemplo, o Codex pode:
- Verificar o código-fonte.
- Pesquisar o histórico de implantações.
- Ler relatórios de incidentes.
- Editar arquivos.
- Executar testes.
- Verificar erros.
- Modificar o código.
- Executar os testes novamente.
Cada ciclo pode carregar contexto, definições de ferramentas, resultados anteriores e informações do ambiente.
Se esse contexto crescer desnecessariamente, os custos e a latência também aumentam.
A OpenAI afirmou que sua estrutura de agentes adota técnicas como descoberta tardia, expondo apenas ferramentas, habilidades, plug-ins e integrações MCP quando necessário.
As saídas de ferramentas são limitadas por padrão a 10.000 tokens, a menos que o modelo solicite um limite diferente.
Isso reduz a possibilidade de grandes resultados de ferramentas preencherem desnecessariamente a janela de contexto.
Histórico somente de acréscimo para preservar o cache de prompt
Os ciclos de agentes normalmente reutilizam as mesmas instruções e contexto várias vezes.
O cache de prompt evita o recálculo repetido de prefixos de prompt estáveis.
Mas o cache só é eficaz quando o prefixo repetido permanece exatamente idêntico.
A OpenAI afirmou que sua estrutura mantém a característica de somente acréscimo no histórico visível ao modelo:
- Novas mensagens são adicionadas ao final.
- Resultados de ferramentas são adicionados ao final.
- Atualizações de ambiente são adicionadas ao final.
- A ordenação das ferramentas é determinística.
- As configurações de aprovação em tempo de execução não são tratadas nas definições das ferramentas.
Esse design aumentou a taxa de reutilização do cache de prompt no Codex e no ChatGPT Work.
O princípio básico é simples:
Um modelo é mais barato não apenas porque seu custo por token é menor, mas também porque os sistemas ao redor evitam gerar e processar tokens desnecessários desde o início.
O ciclo de eficiência pode produzir efeitos compostos
A OpenAI descreve isso como um ciclo de feedback.
Modelos mais fortes ajudam os engenheiros a melhorar:
- Kernels de GPU
- Roteamento
- Decodificação especulativa
- Cache
- Configuração de cargas de trabalho
- Orquestração de agentes
Essas melhorias reduzem custos e latência.
Uma infraestrutura mais eficiente, por sua vez, torna mais econômico executar modelos mais fortes em maior escala.
A OpenAI acredita que isso pode encurtar o ciclo desde a pesquisa e desenvolvimento de modelos até a implantação em larga escala, acelerando o ritmo de inovação em IA.
Os ganhos da próxima geração de otimização precisam ser encontrados.
A redução de preços do Luna e do Terra em 30 de julho é o resultado mais visível para os clientes até agora.
3. Reação dos desenvolvedores: Luna ganha mais atenção, concorrentes enfrentam nova pressão de preços
O relatório original em chinês também destacou a reação entusiasmada da comunidade de desenvolvedores após o anúncio.
Alguns usuários focaram na magnitude da redução de preços do Luna.
Uma queda de 80% é muito maior do que os ajustes incrementais de preço comuns nas APIs de fronteira.
Outros consideram que o Luna já estava subvalorizado antes da redução, especialmente para cargas de trabalho de agentes — nesses cenários, modelos de menor custo podem lidar com tarefas rotineiras de execução sob a orientação de um planejador mais forte.
Esse ajuste de preços também gerou imediatamente comparações com outros modelos focados em custo, incluindo o Kimi K3.
Um meme viral que circulou na comunidade descreveu a situação assim: o Luna de repente começou a disputar os usuários atraídos pelo posicionamento de baixo preço do Kimi K3.
O meme é engraçado, mas não é um benchmark técnico e, portanto, não foi incluído nas imagens do texto principal.
Desenvolvedores imediatamente questionaram se a Anthropic irá responder
Outra reação comum foi marcar a @Anthropic, perguntando se os preços da API do Claude seriam ajustados de forma correspondente.
Essa reação reflete uma mudança mais ampla no cenário competitivo dos modelos de fronteira.
Um ano atrás, a competição mais visível se concentrava em:
- Pontuações em benchmarks
- Capacidades de codificação
- Janelas de contexto
- Funcionalidades multimodais
Essas dimensões continuam importantes.
Mas os desenvolvedores que executam agentes de nível de produção estão cada vez mais focados em:
- Custo por tarefa concluída
- Latência
- Uso de tokens de saída
- Eficiência do cache de prompt
- Número de chamadas de ferramentas
- Confiabilidade
- Flexibilidade de roteamento de modelos
O token mais barato nem sempre representa o fluxo de trabalho mais barato.
Da mesma forma, o modelo mais inteligente também não é necessariamente o melhor para cada etapa de um fluxo de trabalho.
A redução de preço da Luna torna o roteamento de modelos mais atraente
Suponha que uma tarefa seja composta por cinco etapas:
- Compreender um problema ambíguo.
- Elaborar um plano.
- Modificar arquivos rotineiros.
- Escrever testes.
- Revisar os resultados.
Uma equipe pode usar o Sol nas etapas 1 e 2.
Quando o trabalho é claramente especificado, a Luna pode lidar com as etapas 3 a 5.
Quanto mais barata a Luna, maior o incentivo para desviar o trabalho padrão de agentes do modelo principal.
Isso não significa que a Luna se aproxime do Sol em todas as capacidades.
Significa que o valor de um modelo menor depende de ele ser inteligente o suficiente para a tarefa específica que lhe foi atribuída.
A métrica importante é o custo por resultado bem-sucedido
A nova narrativa da OpenAI enfatiza repetidamente resultado por dólar investido.
Isso é mais útil do que focar apenas no preço dos tokens.
Avaliações em produção devem monitorar:
- Taxa de sucesso das tarefas
- Tokens de entrada
- Tokens de saída
- Reutilização de cache de entrada
- Rodadas do modelo
- Chamadas de ferramentas
- Latência de ponta a ponta
- Taxa de repetições
- Tempo de correção manual
- Custo total por tarefa bem-sucedida
Um modelo com custo por token cinco vezes menor pode continuar sendo caro se exigir muitas tentativas.
Um modelo mais caro pode, na prática, custar menos se concluir o trabalho com menos etapas.
O novo preço da Luna torna o cálculo mais favorável para modelos menores, mas os desenvolvedores ainda precisam
de avaliações específicas para suas cargas de trabalho.
Conclusão: a competição entre modelos está se deslocando para a relação inteligência-custo
Os eventos de 29 e 30 de julho mostram que a OpenAI está avançando simultaneamente em duas ideias relacionadas.
Primeiro, o GPT-5.6 está sendo cada vez mais usado para melhorar a própria infraestrutura que executa o GPT-5.6.
Segundo, a empresa está convertendo parte desses ganhos de eficiência em preços mais baixos e opções de serviço mais rápidas para os clientes.
Isso muda o cenário competitivo.
A próxima fase do mercado de modelos não é apenas:
Qual modelo é o mais inteligente?
Inclui também:
Quanta inteligência útil os desenvolvedores conseguem comprar por dólar gasto e por segundo de latência?
A redução de 80% no preço da Luna torna essa questão especialmente relevante.
A Terra ficou mais barata para trabalhos profissionais do dia a dia.
O Sol continua sendo o modelo premium, mas o modo Fast permite que desenvolvedores paguem mais por mais velocidade quando o tempo é crítico.
À medida que a qualidade dos modelos se aproxima em mais tarefas, as empresas que conseguirem fazer o mesmo hardware realizar mais trabalho útil — e transformar esses ganhos de eficiência em preços melhores — podem conquistar uma vantagem competitiva cada vez mais importante.
Perguntas frequentes
Qual é o novo preço da API do GPT-5.6 Luna?
Desde 30 de julho de 2026, a OpenAI define o preço do GPT-5.6 Luna no modo de processamento padrão como US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. Isso representa uma redução de 80% em relação ao preço inicial de US$ 1/US$ 6 por milhão de tokens.
Qual é o novo preço do GPT-5.6 Terra?
O GPT-5.6 Terra está atualmente precificado no modo de processamento padrão em US$ 2 por milhão de tokens de entrada e US$ 12 por milhão de tokens de saída. A OpenAI afirma que isso representa uma redução de 20% em relação ao preço anterior de US$ 2,50/US$ 15 por milhão de tokens.
O GPT-5.6 Sol teve redução de preço?
Não. O preço padrão da API do Sol continua em US$ 5 por milhão de tokens de entrada e US$ 30 por milhão de tokens de saída. A principal mudança foi a introdução do modo Fast.
O que é o modo Fast do GPT-5.6 Sol?
O modo Fast é o nível de processamento de API mais rápido da OpenAI, que substitui o antigo nome Priority Processing (Processamento Prioritário). Para o GPT-5.6 Sol, a OpenAI afirma que, ao custo do dobro do preço padrão dos tokens, ele pode aumentar a velocidade de processamento em até 2,5 vezes em relação ao modo padrão, sem alterar o nível de inteligência do modelo.
As solicitações antigas de API Priority Processing ainda funcionam?
Sim. A OpenAI afirma que solicitações usando o nível de serviço priority continuam compatíveis retroativamente e usarão automaticamente o modo Fast. Os desenvolvedores também podem usar o valor de nível de serviço fast.
O GPT-5.6 realmente ajudou a otimizar a si mesmo?
A OpenAI afirma que o GPT-5.6 Sol, usado por meio do Codex em processos de engenharia com supervisão humana, ajudou a analisar tráfego de produção, reescrever kernels de GPU, executar centenas de experimentos de decodificação especulativa e monitorar o processo de treinamento. A OpenAI atribui parte da redução de 20% no custo de serviço de ponta a ponta e o aumento de mais de 15% na eficiência de geração de tokens a esses trabalhos.
A redução de preços muda as assinaturas do ChatGPT?
Os preços das assinaturas e os orçamentos de cotas não mudam. A OpenAI afirma que, devido aos preços base mais baixos, Luna e Terra agora consomem menos créditos no Codex e no ChatGPT Work.
A Luna agora é o melhor modelo para todas as cargas de trabalho de agentes?
Não. A Luna é muito mais barata, mas a escolha do modelo ainda depende da dificuldade da tarefa e da taxa de erro aceitável. Uma estratégia comum é: usar um modelo mais forte para tarefas de planejamento ambíguas e um modelo mais barato para tarefas de execução bem definidas.
Ferramentas relacionadas
- [OpenAI
API: plataforma de desenvolvedores da OpenAI para acessar os modelos GPT-5.6 e serviços de API.
- GPT-5.6 Sol: especificações oficiais do modelo principal GPT-5.6.
- GPT-5.6 Terra: documentação oficial do modelo do nível equilibrado GPT-5.6.
- GPT-5.6 Luna: documentação oficial do nível GPT-5.6 sensível a custo.
- Codex: ambiente de codificação com agentes da OpenAI, usado em parte dos trabalhos de otimização do GPT-5.6.
- Artificial Analysis: plataforma independente de análise de modelos, cobrindo nível de inteligência, velocidade, uso de tokens e custo por tarefa.
Links relacionados
- OpenAI: avançando a fronteira de custo-benefício com o GPT-5.6: anúncio oficial da OpenAI em 30 de julho sobre a redução de preços da Luna e da Terra e o modo Fast do Sol.
- OpenAI: como o GPT-5.6 combina inteligência de fronteira com eficiência de fronteira: detalhes de engenharia sobre balanceamento de carga, kernels de GPU, decodificação especulativa, gerenciamento de contexto e cache de prompt.
- OpenAI Fast Mode: documentação oficial sobre processamento de API mais rápido e preços do modo Fast.
- Lançamento do OpenAI GPT-5.6: anúncio original de disponibilidade geral da família GPT-5.6 e contexto de benchmarks.
- Artificial Analysis: benchmarks do GPT-5.6: análise independente do nível de inteligência, desempenho de codificação, velocidade e custo do GPT-5.6 antes da redução de preços de 30 de julho.
- [Artificial Analysis GPT-5.6 Luna](https://artificialanalysis.
ai/models/gpt-5-6-luna/): Detalhes da metodologia de modelo da Luna e do índice de inteligência.
- Catálogo de modelos da OpenAI: catálogo oficial de modelos de API e especificações atuais.
Resumo
A OpenAI reduziu o preço da API do GPT-5.6 Luna em 80% e do Terra em 20%, mantendo o preço do Sol Standard inalterado. Em vez disso, o Sol ganhou um novo modo Fast, que aumenta a velocidade de processamento da API em até 2,5 vezes, mas com o dobro do preço do modo Standard.
Este momento está diretamente ligado ao trabalho recente de engenharia da OpenAI. A empresa afirma que o GPT-5.6 Sol ajudou a otimizar núcleos de GPU, decodificação especulativa, balanceamento de carga e infraestrutura de agentes, reduzindo o custo de serviço de ponta a ponta em 20% e alcançando ganhos de eficiência na geração de tokens superiores a 15% em parte da pilha tecnológica.
Para os desenvolvedores, o resultado é uma faixa mais ampla de custo-benefício: Sol para as tarefas mais difíceis, Terra para tarefas profissionais equilibradas e Luna a um preço mais baixo para execução de agentes em grande escala.
As atualizações do GPT-5.6 mostram que a concorrência entre modelos de fronteira está cada vez mais focada no custo por resultado bem-sucedido — e não apenas no nível bruto de inteligência dos benchmarks.