Análise da redução de preços do GPT-5.6: Luna cai 80%, Terra cai 20%, Sol lança modo rápido

A OpenAI ajustou sua estratégia de preços menos de um mês após o lançamento oficial da série GPT-5.6. A partir de 30 de julho de 2026: - GPT-5.6 Luna com redução de 80% no preço. - GPT-5.6 Terra com redução de 20% no preço.

发布于 2026年8月3日generalGEO 评分: 04 次阅读
A imagem é uma arte promocional da atualização de preços do OpenAI GPT-5.6, com fundo escuro e padrões de nuvens. A imagem mostra uma queda de 28% no preço da Luna, 41% na Terra, e a introdução do modo Fast no Sol, com otimização de custos. Abaixo, há três curvas representando alto custo com baixa eficiência, baixo custo com alta eficiência e a curva de preço da Luna, que apresenta uma tendência clara de queda. A imagem está alinhada com o conteúdo do documento sobre a atualização de preços do GPT-5.6, os ajustes de preços da Luna e da Terra, e a introdução do modo Fast no Sol, ilustrando diretamente as mudanças de preço.

Análise da Redução de Preços do GPT-5.6: Luna cai 80%, Terra cai 20%, Sol ganha novo modo rápido

Introdução

Menos de um mês após o lançamento oficial da série GPT-5.6, a OpenAI ajustou seu sistema de preços.

A partir de 30 de julho de 2026:

  • GPT-5.6 Luna teve redução de 80% no preço.
  • GPT-5.6 Terra teve redução de 20% no preço.
  • GPT-5.6 Sol mantém o preço Standard original, mas ganhou uma opção de processamento de API mais rápida.
  • Priority Processing foi renomeado para Fast mode.

Esta atualização não se limita a descontos temporários. A OpenAI afirma que as reduções refletem melhorias no próprio modelo, na arquitetura de raciocínio, no sistema de roteamento, no gerenciamento de contexto e no software de agentes que conecta modelos às ferramentas.

O resultado prático é uma gama mais ampla de opções para ambientes de produção.

A Luna agora tem preço adequado para fluxos de trabalho de agentes com alta concorrência e sensibilidade a custos. A Terra continua sendo a opção equilibrada para tarefas diárias que exigem maior inteligência. A Sol continua atendendo às tarefas mais exigentes, enquanto o Fast mode oferece menor latência quando o tempo de espera importa mais do que o prêmio por token.

Mudanças em 30 de julho de 2026

Quando o GPT-5.6 foi lançado em 9 de julho, a OpenAI divulgou os seguintes preços Standard de API para contexto curto:

Modelo Preço original de entrada Preço original de saída
GPT-5.6 Sol US$ 5,00 / milhão de tokens US$ 30,00 / milhão de tokens
GPT-5.6 Terra US$ 2,50 / milhão de tokens US$ 15,00 / milhão de tokens
GPT-5.6 Luna US$ 1,00 / milhão de tokens US$ 6,00 / milhão de tokens

A atualização de 30 de julho ajustou os preços da Terra e da Luna:

Modelo Novo preço de entrada Novo preço de saída Variação
GPT-5.6 Sol US$ 5,00 / milhão de tokens US$ 30,00 / milhão de tokens Sem alteração
GPT-5.6 Terra US$ 2,00 / milhão de tokens US$ 12,00 / milhão de tokens Redução de 20%
GPT-5.6 Luna US$ 0,20 / milhão de tokens US$ 1,20 / milhão de tokens Redução de 80%

O preço da Luna agora é um quinto do preço original de lançamento.

O novo preço da Terra corresponde a quatro quintos do preço original.

A Sol permanece inalterada sob o processamento Standard, mas o Fast mode agora oferece aos desenvolvedores uma escolha: velocidade de resposta até 2,5 vezes maior por duas vezes o preço por token do Standard.

Preços atuais da API Standard

Os preços de entrada e saída apresentados superficialmente não mostram a estrutura completa de cobrança.

O GPT-5.6 oferece descontos para entrada em cache e escrita explícita em cache. Solicitações com mais de 272.000 tokens de entrada também recebem preços de contexto longo para a solicitação inteira.

Preços Standard para contexto curto

As tarifas abaixo são calculadas por milhão de tokens:

Modelo Entrada Entrada em cache Escrita em cache Saída
GPT-5.6 Sol US$ 5,00 US$ 0,50 US$ 6,25 US$ 30,00
GPT-5.6 Terra US$ 2,00 US$ 0,20 US$ 2,50 US$ 12,00
GPT-5.6 Luna US$ 0,20 US$ 0,02 US$ 0,25 US$ 1,20

Leituras em cache têm desconto de 90% em relação à entrada normal sem cache.

A escrita em cache é cobrada a 1,25 vez o preço da entrada sem cache.

Preços Standard para contexto longo

Para prompts com mais de 272.000 tokens de entrada, a OpenAI atualmente cobra os seguintes valores para a solicitação completa:

Modelo Entrada Entrada em cache Escrita em cache Saída
GPT-5.6 Sol US$ 10,00 US$ 1,00 US$ 12,50 US$ 45,00
GPT-5.6 Terra US$ 4,00 US$ 0,40 US$ 5,00 US$ 18,00
GPT-5.6 Luna US$ 0,40 US$ 0,04 US$ 0,50 US$ 1,80

As regras de contexto longo significam que

a estimativa de custo deve considerar tanto o número de tokens quanto se a solicitação ultrapassa o limite de 272.000 tokens.

Um único prompt muito grande não é tratado cobrando os primeiros 272.000 tokens pela tarifa de contexto curto e o restante por uma tarifa mais alta. O multiplicador de contexto longo se aplica à solicitação inteira.

Correspondendo inteligência a resultados

O principal argumento da OpenAI é que a implantação eficiente de IA começa pelos resultados, não pelo nome do modelo.

Diferentes etapas do mesmo fluxo de trabalho podem exigir diferentes níveis de inteligência, velocidade e confiabilidade.

O modelo ideal para uma tarefa depende de:

  • As consequências de erros.
  • A dificuldade do trabalho.
  • O tempo de resposta aceitável.
  • O volume de solicitações.
  • O custo da revisão humana.
  • A capacidade de validar resultados automaticamente.
  • Se a tarefa é claramente especificada ou ainda vaga.

Quando escolher Luna

O GPT-5.6 Luna foi projetado para trabalhos sensíveis a custo e de alto volume.

Sua página atual do modelo na API o descreve como aproximadamente correspondente ao nível nano usado nas versões anteriores da série GPT-5.

A Luna é uma candidata prática para:

  • Classificação.
  • Extração estruturada.
  • Etapas de agentes em segundo plano.
  • Mudanças rotineiras de código.
  • Geração de testes.
  • Processamento e triagem de documentos.
  • Loops repetitivos de chamadas de ferramentas.
  • Processamento em larga escala, onde o impacto negativo de cada tarefa individual é limitado.

A OpenAI estima que a Luna consegue oferecer desempenho comparável a modelos considerados de ponta cerca de um ano atrás, a aproximadamente seis centavos de dólar por dólar de custo de tarefa e quase nove vezes mais rápido.

Essa comparação é baseada nas avaliações e na metodologia de custo da OpenAI. As equipes devem validar com suas próprias cargas de trabalho.

Quando escolher Terra

O GPT-5.6 Terra é o membro equilibrado da série.

A OpenAI o posiciona onde os modelos mini da era GPT-5 estavam, mas com maior capacidade de atuação como agente e em trabalhos profissionais.

A Terra é adequada para:

  • Perguntas e respostas no ambiente de trabalho.
  • Pesquisa de escopo limitado.
  • Codificação do dia a dia.
  • Análise de documentos.
  • Planejamento de agentes de complexidade média.
  • Fluxos de atendimento ao cliente que exigem raciocínio.
  • Tarefas repetitivas de negócios quando a Luna não é confiável o suficiente, mas a Sol não é necessária.

Quando escolher Sol

O GPT-5.6 Sol é o modelo principal para trabalhos profissionais complexos.

É a melhor escolha quando o modelo precisa:

  • Resolver ambiguidades.
  • Criar planos para projetos difíceis.
  • Revisar decisões de alto valor.
  • Lidar com codificação ou depuração complexa.
  • Coordenar ferramentas em fluxos de trabalho longos.
  • Fazer pesquisa aprofundada.
  • Gerar ou validar trabalhos cujo erro é caro.

O alias de API gpt-5.6 roteia para gpt-5.6-sol.

Um fluxo de trabalho pode usar vários modelos

Esta atualização de preços torna fluxos de trabalho com modelos híbridos mais práticos.

Um agente de codificação não precisa usar a Sol para cada token e cada chamada de ferramenta.

Uma arquitetura possível é:

  1. Usar a Sol para entender o código e identificar incertezas.
  2. Deixar a Sol criar o plano e definir critérios de sucesso.
  3. Enviar tarefas de implementação claramente especificadas para a Luna.
  4. Usar a Luna para escrever testes rotineiros e executar verificações repetitivas.
  5. Roteie etapas incertas ou com falhas para a Terra ou a Sol.
  6. Usar a Sol para revisão final quando o erro tem consequências graves.

é muito alto.

O mesmo padrão pode ser aplicado fora da engenharia de software.

Um sistema de processamento de documentos pode usar a Luna para extração, a Terra para síntese e a Sol apenas quando o material for ambíguo ou de alto impacto.

A estratégia correta de roteamento deve ser determinada por avaliação, não por suposições.

Resultados de clientes compartilhados pela OpenAI

O anúncio da OpenAI incluiu feedback inicial de diversos clientes em produção.

Esses exemplos são relatos feitos pelas próprias empresas e clientes, e não benchmarks independentes.

Empresa Uso ou resultado relatado
Replit A Luna tornou casos de uso antes impraticáveis economicamente viáveis para exploração
Notion Em avaliações internas, a Terra alcançou qualidade equivalente ao GPT-5.5 com metade do custo por tarefa e 60% menos tempo
Ramp A Terra e a Luna lideraram as avaliações internas de codificação em eficiência de custo; a Luna tornou-se a opção padrão para automação de tarefas em segundo plano
Blitzy A Luna elevou a taxa de reutilização de cache de prompt de 24% para 90%, reduzindo significativamente os custos em comparação com a solução padrão anterior
Cognition A Luna atua como um parceiro de codificação de menor custo no Devin Fusion, em conjunto com modelos maiores
Dust Segundo relatos, em tarefas de agente semelhantes, a Luna é 40% mais rápida e 40% mais barata que a solução padrão anterior da empresa

Esses exemplos mostram que a cobrança por token não é a única métrica útil.

Um modelo mais barato também pode alterar:

  • O número de chamadas de ferramentas.
  • A reutilização de cache.
  • O comprimento do contexto.
  • A verbosidade da saída.
  • A frequência de novas tentativas.
  • A necessidade de revisão humana.
  • O tempo total de conclusão.

Uma métrica mais significativa costuma ser o custo por resultado bem-sucedido.

O que a OpenAI diz sobre as formas de ganho de eficiência

A OpenAI atribui a melhoria no preço por desempenho a três camadas interligadas.

1. O modelo

Os modelos da série GPT-5.6 foram projetados para concluir tarefas de forma mais direta.

Um modelo que exige menos tokens de saída, menos novas tentativas ou menos ciclos de raciocínio pode reduzir o custo total da tarefa, mesmo com o preço de tabela inalterado.

2. O sistema de inferência

A pilha de produção determina a eficiência com que o modelo utiliza o hardware.

A OpenAI afirma que software de serviço otimizado pode gerar tokens de forma mais eficiente e manter os recursos computacionais produtivos.

3. A estrutura de agentes

A estrutura é o software ao redor do modelo, fornecendo ferramentas, contexto, roteamento, estado e controle de fluxo de trabalho.

A OpenAI afirma que um melhor gerenciamento de contexto ajuda os agentes a evitar refazer trabalhos já concluídos.

Isso pode reduzir:

  • Chamadas repetidas de ferramentas.
  • Processamento repetido de contextos inalterados.
  • Planejamento redundante.
  • Chamadas desnecessárias de ida e volta ao modelo.
  • Consumo de tokens para reafirmar resultados anteriores.

Essas três camadas se influenciam mutuamente.

Modelos mais fortes podem encontrar espaço para otimização na pilha de serviço. Essa otimização reduz custos, tornando o uso de agentes em maior escala economicamente viável. Mais uso, por sua vez, cria mais oportunidades para melhorar o sistema.

O GPT-5.6 Sol ajudou a otimizar sua própria pilha de serviço

Uma das declarações mais notáveis do anúncio é que o GPT-5.6 Sol contribuiu para os esforços internos de eficiência da OpenAI.

Em um processo de engenharia liderado por humanos, a OpenAI afirma que o Sol:

  • Reescreveu e otimizou núcleos de produção.
  • Projetou e executou centenas de experimentos de geração de tokens.
  • Monitorou processos de treinamento.
  • Interveio quando surgiam problemas.

A OpenAI relatou que as otimizações de núcleo reduziram o custo de serviço de ponta a ponta do modelo em cerca de 20%.

A empresa também afirmou que esses experimentos elevaram a eficiência de geração de tokens em mais de 15%.

Esses são resultados internos da OpenAI, ainda não reproduzidos de forma independente por benchmarks públicos.

Um ponto mais importante é que os modelos estão gradualmente se tornando parte do processo de melhoria da infraestrutura em que operam.

Isso cria um ciclo de feedback de engenharia mais fechado:

Modelos mais fortes
→ Melhor otimização de infraestrutura
→ Menor custo de serviço
→ Adoção mais ampla
→ Mais feedback e investimento
→ Modelos de próxima geração ainda mais fortes

Estratégia de computação voltada à escala

Preços mais baixos não significam que a OpenAI precise de menos poder computacional total.

A empresa acredita que alcançar inteligência suficiente exige dois elementos ao mesmo tempo:

  • Mais poder computacional.
  • Poder computacional mais produtivo.

O primeiro expande a capacidade total.

O segundo aumenta o trabalho efetivo concluído por unidade de hardware.

A OpenAI afirma estar construindo uma infraestrutura diversificada e alocando cargas de trabalho aos sistemas mais adequados para executá-las.

Isso sustenta as duas extremidades da série GPT-5.6:

  • Luna e Terra tornam cargas de trabalho de alto volume mais baratas.
  • Sol e o modo Fast suportam trabalhos difíceis e sensíveis à latência.

Exemplos de cargas de trabalho que podem ser mais fáceis de escalar incluem:

  • Pipelines de análise de grandes documentos.
  • Classificação de interações com clientes.
  • Implementação de software rotineira.
  • Automação de agentes em segundo plano.
  • Processamento repetitivo de dados.
  • Fluxos de trabalho de chamadas de ferramentas com alta reutilização de cache.

Enquanto isso, quando o valor de obter uma resposta mais rapidamente justifica o custo adicional, solicitações complexas do Sol podem usar o modo Fast.

O modo Fast substitui o processamento prioritário

O modo Fast é o novo nome para a camada de serviço prioritária da OpenAI.

Solicitações existentes à API que usam:

"service_tier": "priority"

continuam compatíveis.

Os desenvolvedores também podem usar:

"service_tier": "fast"

Para o GPT-5.6 Sol, a OpenAI afirma que o modo Fast pode ser até 2,5 vezes mais rápido que o processamento padrão, mantendo a mesma inteligência do modelo.

O custo é o preço.

Atualmente, o modo Fast do GPT-5.6 Sol custa 2 vezes o preço padrão dos tokens da API.

Os descontos para entrada em cache continuam válidos.

Exemplo em Python

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="Revise este plano de migração e identifique as três premissas de maior risco.",
    service_tier="fast",
)

print(response.output_text)

O modo Fast está disponível para modelos suportados por meio da API Responses e da API Chat Completions.

Para o GPT-5.6 e modelos anteriores, mesmo que a solicitação use o novo nome fast, o objeto de resposta pode reportar a camada de serviço como priority.

Quando o custo adicional do modo Fast vale a pena

O modo Fast não é automaticamente a melhor configuração para todas as solicitações do Sol.

Ele é mais útil quando a latência afeta diretamente o valor do resultado.

Exemplos incluem:

  • Assistentes voltados ao usuário que concluem fluxos de trabalho de alto valor.
  • Agentes de programação que aguardam para desbloquear desenvolvedores.
  • Pesquisa ou análise interativa.
  • Suporte à resposta a incidentes.
  • Revisão em tempo real antes de decisões.
  • Tráfego comercial sensível à latência em sistemas de produção estáveis.

Para os seguintes cenários, o processamento padrão pode ser mais econômico:

  • Tarefas em segundo plano.
  • Pesquisa noturna.
  • Geração assíncrona de relatórios.
  • Análise em lote.
  • Tarefas em que o usuário não precisa aguardar.
  • Fluxos de trabalho cujo gargalo está em ferramentas externas, não no modelo.

O custo adicional de dois vezes por token só faz sentido se o valor gerado pela conclusão downstream superar seu custo.

Em fluxos de trabalho de agente de longa duração, o cache de prompt é ainda mais importante

Os novos preços de tabela tornam a Luna e a Terra mais baratas, mas o cache de prompt também pode ter um impacto enorme em agentes de longa duração.

Cada rodada do loop do agente pode reenviar:

  • Instruções do sistema.
  • Definições de ferramentas.
  • Documentos compartilhados.
  • Contexto do repositório de código.
  • Histórico de conversa.
  • Regras estáveis do fluxo de trabalho.

Sem cache, os aplicativos podem pagar repetidamente pelos mesmos prefixos.

O GPT-5.6 suporta cache automático e pontos de interrupção explícitos de cache.

O modelo de cobrança atual da OpenAI é:

  • Leitura de cache cobrada a 10% do preço de entrada sem cache.
  • Escrita de cache cobrada a 125% do preço de entrada sem cache.

A escrita de cache custa mais que a entrada comum, mas as leituras subsequentes recebem um grande desconto.

O cache é mais útil quando o mesmo prefixo estável é reutilizado vezes suficientes para recuperar o custo maior da escrita.

Os aplicativos devem monitorar:

  • A taxa de acerto do cache.
  • A estabilidade dos prefixos.
  • O intervalo entre solicitações.
  • O tamanho do contexto armazenado em cache.
  • Se o fluxo de trabalho invalida frequentemente os prefixos.

Especificações do modelo compartilhadas por toda a série

Atual

A página de modelos da API lista várias especificações compartilhadas:

Especificação Sol Terra Luna
Janela de contexto 1.050.000 tokens 1.050.000 tokens 1.050.000 tokens
Saída máxima 128.000 tokens 128.000 tokens 128.000 tokens
Data de corte do conhecimento 16 de fevereiro de 2026 16 de fevereiro de 2026 16 de fevereiro de 2026
Entrada/saída de texto Suportado Suportado Suportado
Entrada de imagem Suportado Suportado Suportado
Tokens de raciocínio Suportado Suportado Suportado
Chamada de função Suportado Suportado Suportado
Saída estruturada Suportado Suportado Suportado
Ajuste fino Não suportado Não suportado Não suportado

Os três modelos estão disponíveis por meio da API Responses.

A página de modelos também lista amplo suporte a ferramentas, mas a disponibilidade de funcionalidades específicas pode variar dependendo do endpoint, da conta, do produto e do estágio de lançamento.

Disponibilidade no ChatGPT Work, Codex e API

A OpenAI afirma que o GPT-5.6 Terra e o Luna continuam disponíveis nas seguintes plataformas:

  • ChatGPT Work.
  • Codex.
  • API da OpenAI.

O acesso atual descrito no anúncio de preços inclui:

Grupo de planos Acesso ao GPT-5.6 no ChatGPT Work e Codex
Free e Go Terra
Plus, Pro, Business, Enterprise Terra e Luna

O Sol possui regras de acesso próprias no ChatGPT, ChatGPT Work, Codex e API.

A atualização de 30 de julho não reduziu os preços das assinaturas do ChatGPT ou do Codex.

Também não aumentou os orçamentos de cotas declarados.

Em vez disso, Luna e Terra agora consomem menos créditos, pois seus custos de uso subjacentes são mais baixos.

A OpenAI também afirmou que as atualizações de preços começarão a ser implementadas via AWS no dia do anúncio. Os preços dos modelos fornecidos por plataformas terceiras podem diferir dos preços diretos da API da OpenAI.

Como fazer

Escolhendo o modelo GPT-5.6 correto

Um processo de seleção prático pode seguir cinco etapas.

Etapa 1: Defina o resultado esperado

Escreva o que conta como sucesso.

Evite escolher o modelo com base apenas em rótulos amplos como "programação" ou "pesquisa".

Etapa 2: Identifique o custo da falha

Tarefas de classificação de baixo risco e migrações de banco de dados em produção não devem usar as mesmas regras de decisão.

Etapa 3: Estabeleça uma linha de base com o Sol

Para tarefas difíceis, teste primeiro o Sol para entender o nível máximo de qualidade disponível.

Etapa 4: Teste Terra e Luna no mesmo conjunto de avaliação

Meça se os modelos de menor custo preservam a qualidade que realmente importa.

Etapa 5: Otimize o fluxo de trabalho completo

Acompanhe:

  • Taxa de sucesso das tarefas.
  • Número total de tokens.
  • Taxa de reutilização de cache.
  • Número de chamadas de ferramenta.
  • Número de tentativas.
  • Latência.
  • Tempo de revisão humana.
  • Custo por resultado bem-sucedido.

Não otimize apenas o preço mais barato do token de entrada.

Perguntas frequentes

Qual é o novo preço do GPT-5.6 Luna?

O GPT-5.6 Luna agora custa US$ 0,20 por milhão de tokens de entrada padrão de contexto curto, US$ 0,02 por milhão de tokens de entrada em cache, US$ 1,20 por milhão de tokens de saída e US$ 0,25 por milhão de tokens para gravação em cache.

Qual é o novo preço do GPT-5.6 Terra?

O GPT-5.6 Terra agora custa US$ 2,00 por milhão de tokens de entrada padrão de contexto curto, US$ 0,20 por milhão de tokens de entrada em cache, US$ 12,00 por milhão de tokens de saída e US$ 2,50 por milhão de tokens para gravação em cache.

O GPT-5.6 Sol teve redução de preço?

Os preços padrão de seus tokens não mudaram. O Sol continua custando US$ 5 por milhão de tokens de entrada de contexto curto e US$ 30 por milhão de tokens de saída, enquanto o Modo Rápido oferece processamento 2,5 vezes mais rápido pelo dobro do preço padrão.

O que mudou no Priority Processing?

A OpenAI renomeou o Priority Processing para Modo Rápido em 30 de julho de 2026. As solicitações existentes que usam service_tier: "priority" continuam compatíveis, e novas solicitações podem usar service_tier: "fast".

Quando a precificação de contexto longo do GPT-5.6 se aplica?

A página de modelos atual indica que prompts com mais de 272.000 tokens de entrada usarão taxas de entrada e saída mais altas para toda a solicitação. Os desenvolvedores devem considerar esse limite ao estimar custos de prompts muito grandes.

Qual modelo GPT-5.6 é o melhor para cargas de trabalho de alto throughput?

A OpenAI posiciona o Luna como o modelo voltado para trabalhos de alto throughput e sensíveis a custo. Quando o Luna não oferece qualidade suficiente, o Terra é a opção equilibrada, enquanto o Sol é direcionado às tarefas especializadas mais difíceis.

A redução de preços diminui os custos de assinatura do ChatGPT e do Codex?

Não. A OpenAI afirma que os preços das assinaturas e os orçamentos de cotas permanecem inalterados. Terra e Luna agora consomem menos créditos nos fluxos de trabalho suportados dos produtos pagos.

Todos os provedores de nuvem oferecem imediatamente os preços reduzidos?

Os preços diretos da API da OpenAI mudaram em 30 de julho. A OpenAI afirmou que os preços da AWS começarão a ser implementados mais tarde no mesmo dia, mas os preços e a disponibilidade em plataformas terceiras podem variar, portanto, os usuários devem verificar as tabelas de preços atuais dos provedores.

Ferramentas relacionadas

  • GPT-5.6 Sol: O modelo GPT-5.6 principal da OpenAI para trabalhos profissionais complexos.
  • GPT-5.6 Terra: O modelo GPT-5.6 equilibrado para cargas de trabalho que exigem inteligência com custos mais baixos.
  • GPT-5.6 Luna: O modelo GPT-5.6 mais rápido e econômico para tarefas de alto throughput e sensíveis a custo.
  • API Responses: A principal API da OpenAI para raciocínio, ferramentas, fluxos de trabalho multi-turno e aplicativos de agentes.
  • Codex: O ambiente de engenharia de software com agentes da OpenAI baseado na família de modelos GPT-5.6.
  • Painel da API da OpenAI: O painel oficial para gerenciar chaves de API, projetos, uso, limites e cobrança.

Links relacionados

/com/api/docs/guides/latest-model): recomendações oficiais sobre seleção de modelos, migração, inferência, cache e fluxos de trabalho.

Resumo

Na atualização de 30 de julho, a OpenAI reduziu os preços padrão da API do GPT-5.6 Luna em 80% e do Terra em 20%. O preço padrão do Sol permaneceu inalterado, enquanto o novo modo rápido pode acelerar as respostas da API em até 2,5 vezes, com tarifas de tokens duas vezes maiores.

O anúncio gira em torno de uma estratégia mais ampla de custo-benefício. A OpenAI afirma estar aprimorando modelos, pilha de raciocínio, roteamento, gerenciamento de contexto e estruturas de agentes para reduzir o tempo, o número de tokens ou o poder computacional necessários por tarefa bem-sucedida.

Para desenvolvedores, a escolha correta não é simplesmente selecionar o modelo mais barato. O Luna é voltado para execução de alto throughput, o Terra equilibra custo e inteligência, e o Sol lida com os trabalhos mais complexos. As economias proporcionadas por roteamento híbrido de modelos, cache, avaliações e medição de custo por sucesso podem superar em muito os benefícios de apenas trocar de modelo.

A mudança central é que o GPT-5.6 agora oferece uma faixa de trabalho mais ampla: os níveis Luna e Terra fornecem inteligência cotidiana mais econômica, enquanto o Sol oferece inteligência de ponta mais rápida quando a latência justificar o custo mais alto.

Este arquivo Markdown é uma adaptação editorial independente do artigo oficial. Preserva os temas, a ordem dos fatos e o significado real, mas não reproduz textualmente a redação da OpenAI nem as citações de clientes.

GPT-5.6 降价解析:Luna 降幅达 80%,Terra 下跌 20%,Sol 推出极速模式