Analisi dei tagli di prezzo di GPT-5.6: Luna in calo dell'80%, Terra in ribasso del 20%, Sol introduce la modalità veloce

OpenAI ha adeguato la propria strategia di prezzi a meno di un mese dal lancio ufficiale della serie GPT-5.6. Dal 30 luglio 2026: - GPT-5.6 Luna subisce una riduzione dell'80%. - GPT-5.6 Terra viene ridotto del 20%.

发布于 2026年8月3日generalGEO 评分: 010 次阅读
L'immagine è un'illustrazione promozionale dell'aggiornamento dei prezzi di OpenAI GPT-5.6, con sfondo scuro e motivi di nuvole. Mostra una riduzione del 28% per Luna, del 41% per Terra, e l'introduzione della modalità Fast per Sol con ottimizzazione dei costi. Nella parte inferiore sono presenti tre curve che rappresentano rispettivamente alto costo/bassa efficienza, basso costo/alta efficienza e la curva dei prezzi di Luna, la quale mostra una chiara tendenza al ribasso. L'immagine è in linea con i contenuti del documento riguardanti l'aggiornamento dei prezzi di GPT-5.6, gli adeguamenti di Luna e Terra e l'introduzione della modalità Fast per Sol, illustrando visivamente i cambiamenti dei prezzi.

Interpretazione del taglio dei prezzi di GPT-5.6: Luna -80%, Terra -20%, Sol introduce la nuova modalità Fast

Introduzione

OpenAI ha modificato il proprio sistema di prezzi meno di un mese dopo il rilascio ufficiale della serie GPT-5.6.

A partire dal 30 luglio 2026:

  • GPT-5.6 Luna subisce un taglio dell'80%.
  • GPT-5.6 Terra subisce un taglio del 20%.
  • GPT-5.6 Sol mantiene il prezzo Standard originale, ma introduce una nuova opzione di elaborazione API più rapida.
  • Priority Processing è stata rinominata Fast mode.

L'aggiornamento non si limita a sconti temporanei. OpenAI dichiara che i tagli riflettono miglioramenti a livello di modello, architettura di inferenza, sistema di routing, gestione del contesto e software agente che collega i modelli agli strumenti.

Il risultato concreto è una gamma di scelte più ampia negli ambienti di produzione.

Luna ora ha un prezzo adatto a flussi di lavoro agente ad alta concorrenza e sensibili ai costi. Terra rimane la scelta equilibrata per il lavoro quotidiano quando è necessaria una maggiore intelligenza. Sol continua a servire i compiti più esigenti, mentre Fast mode offre una latenza ridotta quando il tempo di attesa conta più del sovrapprezzo sui token.

Le modifiche del 30 luglio 2026

Quando GPT-5.6 è stato rilasciato il 9 luglio, OpenAI aveva annunciato i seguenti prezzi API Standard a contesto breve:

Modello Prezzo input originale Prezzo output originale
GPT-5.6 Sol $5,00 / milione di token $30,00 / milione di token
GPT-5.6 Terra $2,50 / milione di token $15,00 / milione di token
GPT-5.6 Luna $1,00 / milione di token $6,00 / milione di token

L'aggiornamento del 30 luglio ha modificato i prezzi di Terra e Luna:

Modello Nuovo prezzo input Nuovo prezzo output Variazione
GPT-5.6 Sol $5,00 / milione di token $30,00 / milione di token Invariato
GPT-5.6 Terra $2,00 / milione di token $12,00 / milione di token -20%
GPT-5.6 Luna $0,20 / milione di token $1,20 / milione di token -80%

Il prezzo di Luna è ora pari a un quinto di quello iniziale.

Il nuovo prezzo di Terra è pari a quattro quinti di quello originale.

Sol rimane invariato con l'elaborazione Standard, ma Fast mode offre ora agli sviluppatori una scelta: velocità di risposta fino a 2,5 volte superiore al prezzo Standard dei token.

Prezzi API Standard attuali

I prezzi di input e output visibili non mostrano l'intera struttura di fatturazione.

GPT-5.6 supporta sconti per input in cache e scritture esplicite in cache. Le richieste che superano i 272.000 token di input beneficiano inoltre di prezzi per contesto lungo sull'intera richiesta.

Prezzi Standard a contesto breve

Le seguenti tariffe sono calcolate per milione di token:

Modello Input Input in cache Scrittura in cache Output
GPT-5.6 Sol $5,00 $0,50 $6,25 $30,00
GPT-5.6 Terra $2,00 $0,20 $2,50 $12,00
GPT-5.6 Luna $0,20 $0,02 $0,25 $1,20

Le letture dalla cache godono di uno sconto del 90% rispetto al normale input non in cache.

Le scritture in cache sono fatturate a 1,25 volte il prezzo dell'input non in cache.

Prezzi Standard a contesto lungo

Per i prompt con più di 272.000 token di input, OpenAI applica attualmente le seguenti tariffe all'intera richiesta:

Modello Input Input in cache Scrittura in cache Output
GPT-5.6 Sol $10,00 $1,00 $12,50 $45,00
GPT-5.6 Terra $4,00 $0,40 $5,00 $18,00
GPT-5.6 Luna $0,40 $0,04 $0,50 $1,80

Le regole del contesto lungo implicano che

la stima dei costi debba considerare sia il numero di token, sia se la richiesta supera la soglia dei 272.000 token.

Un singolo prompt molto grande non viene gestito fatturando i primi 272.000 token alla tariffa a contesto breve e il resto a una tariffa più alta. Il moltiplicatore per contesto lungo si applica all'intera richiesta.

Abbinare l'intelligenza ai risultati

La tesi principale di OpenAI è che una distribuzione efficiente dell'AI inizia dai risultati, non dal nome del modello.

Fasi diverse dello stesso flusso di lavoro possono richiedere diversi livelli di intelligenza, velocità e affidabilità.

Il modello ideale per un compito dipende da:

  • Le conseguenze degli errori.
  • La difficoltà del lavoro.
  • Il tempo di risposta accettabile.
  • Il volume delle richieste.
  • Il costo della revisione umana.
  • La capacità di verificare automaticamente i risultati.
  • Se il compito è chiaramente specificato o ancora ambiguo.

Quando scegliere Luna

GPT-5.6 Luna è progettato per lavori ad alto volume e sensibili ai costi.

La sua pagina attuale sul modello API lo descrive come corrispondente all'incirca al livello nano utilizzato nella precedente serie GPT-5.

Luna è un candidato pratico per:

  • Classificazione.
  • Estrazione strutturata.
  • Passaggi agente in background.
  • Modifiche di codice di routine.
  • Generazione di test.
  • Elaborazione e classificazione di documenti.
  • Cicli ripetitivi di chiamate a strumenti.
  • Elaborazione su larga scala in cui l'impatto negativo di ogni singolo compito è limitato.

OpenAI stima che Luna possa offrire prestazioni paragonabili a quelle che circa un anno fa erano considerate modelli di frontiera, a un costo di circa sei centesimi per dollaro di attività e una velocità quasi nove volte superiore.

Il confronto si basa sulle valutazioni e sulla metodologia di costo di OpenAI. I team dovrebbero verificarlo sui propri carichi di lavoro.

Quando scegliere Terra

GPT-5.6 Terra è il membro equilibrato della serie.

OpenAI lo posiziona dove si trovavano i modelli mini nella prima era GPT-5, ma con maggiori capacità agente e professionali.

Terra è adatto a:

  • Domande e risposte sull'area di lavoro.
  • Ricerche di ambito limitato.
  • Codifica quotidiana.
  • Analisi di documenti.
  • Pianificazione agente di media complessità.
  • Flussi di lavoro di assistenza clienti che richiedono ragionamento.
  • Attività aziendali ripetitive quando Luna non è abbastanza affidabile ma Sol non è necessario.

Quando scegliere Sol

GPT-5.6 Sol è il modello di punta per lavori complessi e professionali.

È la scelta migliore quando il modello deve:

  • Risolvere ambiguità.
  • Elaborare piani per progetti difficili.
  • Rivedere decisioni ad alto valore.
  • Gestire codifica o debug complessi.
  • Coordinare strumenti in flussi di lavoro lunghi.
  • Condurre ricerche approfondite.
  • Generare o verificare lavori in cui il costo di un errore è elevato.

L'alias API gpt-5.6 instrada a gpt-5.6-sol.

Un flusso di lavoro può utilizzare più modelli

Questo aggiornamento dei prezzi rende più pratici i flussi di lavoro ibridi con più modelli.

Un agente di codifica non ha bisogno di usare Sol per ogni token e ogni chiamata a strumento.

Una possibile architettura è:

  1. Usare Sol per comprendere il codebase e identificare le incertezze.
  2. Far creare a Sol un piano e definire i criteri di successo.
  3. Inviare attività di implementazione chiaramente specificate a Luna.
  4. Usare Luna per scrivere test di routine ed eseguire controlli ripetitivi.
  5. Instradare passaggi incerti o falliti a Terra o Sol.
  6. Usare Sol per la revisione finale quando le conseguenze di un errore sono gravi.

Il costo è molto alto.

Lo stesso schema può essere applicato anche al di fuori dell'ingegneria del software.

Un sistema di elaborazione documenti potrebbe usare Luna per l'estrazione, Terra per la sintesi e Sol solo quando i materiali sono ambigui o di grande impatto.

La strategia di routing corretta dovrebbe essere determinata tramite valutazione, non basata su ipotesi.

Cosa condividono i clienti di OpenAI

Gli annunci di OpenAI includono feedback iniziali provenienti da diversi utenti in produzione.

Questi esempi sono riportati direttamente dalle aziende e dai clienti e non costituiscono benchmark indipendenti.

Azienda Utilizzo o risultato riportato
Replit Luna rende economicamente sostenibili casi d'uso prima impraticabili, sufficienti da esplorare
Notion Terra, nelle valutazioni interne, ha raggiunto una qualità paragonabile a GPT-5.5 con la metà dei costi di elaborazione e un tempo ridotto del 60%
Ramp Terra e Luna guidano le valutazioni interne di codifica in termini di efficienza dei costi; Luna è diventata l'opzione predefinita per le attività di automazione in background
Blitzy Luna ha aumentato il riutilizzo della cache di prompt dal 24% al 90%, riducendo significativamente i costi rispetto alla soluzione precedente
Cognition Luna, in Devin Fusion, funziona come partner di codifica a costo inferiore insieme a modelli più grandi
Dust Secondo quanto riportato, in attività simili con agenti, Luna risulta il 40% più veloce e il 40% più economica rispetto alla soluzione precedente dell'azienda

Questi esempi mostrano che la fatturazione a token non è l'unica metrica utile.

Un modello più economico può inoltre influenzare:

  • Il numero di chiamate agli strumenti.
  • Il riutilizzo della cache.
  • La lunghezza del contesto.
  • Il livello di verbosità dell'output.
  • La frequenza dei nuovi tentativi.
  • La necessità di revisione manuale.
  • Il tempo totale di completamento.

Una metrica più significativa è solitamente il costo per risultato riuscito.

Come OpenAI afferma di migliorare l'efficienza

OpenAI attribuisce il miglioramento del rapporto prestazioni-prezzo a tre livelli interconnessi.

1. Il modello

I modelli della serie GPT-5.6 sono progettati per completare il lavoro in modo più diretto.

Un modello che richiede meno token in output, meno nuovi tentativi o meno cicli di ragionamento può ridurre il costo totale dell'attività, anche a parità di prezzo di listino.

2. Il sistema di inferenza

Lo stack di produzione determina l'efficienza con cui il modello utilizza l'hardware.

OpenAI afferma che un software di servizio ottimizzato può generare token in modo più efficiente e mantenere produttive le risorse di calcolo.

3. Il framework per agenti

Il framework è il software che circonda il modello e fornisce strumenti, contesto, instradamento, stato e controllo dei flussi di lavoro.

OpenAI afferma che una migliore gestione del contesto aiuta gli agenti a evitare di ripetere il lavoro già svolto.

Questo può ridurre:

  • Chiamate ripetute agli strumenti.
  • Elaborazioni ripetute di contesti invariati.
  • Pianificazioni ridondanti.
  • Chiamate non necessarie al modello.
  • Token spesi per riproporre risultati precedenti.

Questi tre livelli si influenzano a vicenda.

Un modello più potente può trovare opportunità di ottimizzazione nello stack di servizio. Questa ottimizzazione riduce i costi, rendendo economico l'uso degli agenti su larga scala. Un maggiore utilizzo crea a sua volta più opportunità per migliorare il sistema.

GPT-5.6 Sol ha contribuito a ottimizzare il proprio stack di servizio

Una delle affermazioni più notevoli dell'annuncio è che GPT-5.6 Sol ha contribuito agli sforzi interni di efficienza di OpenAI.

In un processo ingegneristico guidato da esseri umani, OpenAI afferma che Sol:

  • Ha riscritto e ottimizzato kernel di produzione.
  • Ha progettato ed eseguito centinaia di esperimenti sulla generazione di token.
  • Ha monitorato i processi di addestramento.
  • È intervenuto quando si sono verificati problemi.

OpenAI riporta che le ottimizzazioni a livello di kernel hanno ridotto di circa il 20% il costo end-to-end del servizio del modello.

L'azienda afferma inoltre che questi esperimenti hanno migliorato di oltre il 15% l'efficienza della generazione di token.

Questi sono risultati interni di OpenAI e non sono stati riprodotti in modo indipendente tramite benchmark pubblici.

Un punto ancora più importante è che i modelli stanno diventando gradualmente parte del processo volto a migliorare l'infrastruttura su cui vengono eseguiti.

Questo crea un ciclo di feedback ingegneristico più stretto:

Modello più potente
→ Migliore ottimizzazione dell'infrastruttura
→ Minori costi di servizio
→ Applicazioni più ampie
→ Più feedback e investimenti
→ Modello di nuova generazione più potente

Strategia di calcolo orientata alla scala

Un prezzo più basso non significa che OpenAI abbia bisogno di meno potenza di calcolo complessiva.

L'azienda ritiene che raggiungere un'intelligenza adeguata richieda entrambi i seguenti elementi:

  • Più potenza di calcolo.
  • Potenza di calcolo più produttiva.

Il primo espande la capacità totale.

Il secondo aumenta il lavoro utile completato per unità di hardware.

OpenAI afferma di costruire un portafoglio infrastrutturale diversificato e di abbinare i carichi di lavoro ai sistemi più adatti a eseguirli.

Questo supporta entrambe le estremità della serie GPT-5.6:

  • Luna e Terra rendono più economici i carichi di lavoro ad alto volume.
  • Sol e la modalità Fast supportano attività difficili e sensibili alla latenza.

Esempi di carichi di lavoro che potrebbero essere più facilmente scalabili includono:

  • Pipeline di analisi di grandi documenti.
  • Classificazione delle interazioni con i clienti.
  • Implementazione software di routine.
  • Automazione di agenti in background.
  • Attività ripetitive di elaborazione dati.
  • Flussi di lavoro con chiamate a strumenti con alto tasso di riutilizzo della cache.

Nel frattempo, quando il valore di ottenere una risposta più rapidamente giustifica il costo aggiuntivo, le richieste Sol complesse possono utilizzare la modalità Fast.

La modalità Fast sostituisce la gestione prioritaria

La modalità Fast è il nuovo nome del livello di servizio prioritario di OpenAI.

Le richieste API esistenti che utilizzano:

"service_tier": "priority"

rimangono compatibili.

Gli sviluppatori possono anche utilizzare:

"service_tier": "fast"

Per GPT-5.6 Sol, OpenAI afferma che la modalità Fast può essere fino a 2,5 volte più veloce dell'elaborazione standard mantenendo la stessa intelligenza del modello.

Il costo è il prezzo.

Attualmente, la modalità Fast per GPT-5.6 Sol costa 2 volte il prezzo standard dei token API.

Gli sconti per l'input memorizzato nella cache rimangono applicabili.

Esempio in Python

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-5.6-sol",
    input="Esamina questo piano di migrazione e identifica le tre assunzioni a più alto rischio.",
    service_tier="fast",
)

print(response.output_text)

La modalità Fast è disponibile tramite l'API Responses e l'API Chat Completions per i modelli supportati.

Per GPT-5.6 e modelli precedenti, anche se la richiesta utilizza il nuovo nome fast, l'oggetto di risposta può riportare il livello di servizio come priority.

Quando vale il sovrapprezzo della modalità Fast

La modalità Fast non è automaticamente l'impostazione migliore per tutte le richieste Sol.

È più utile quando la latenza influisce direttamente sul valore del risultato.

Gli esempi includono:

  • Assistenti destinati agli utenti che completano flussi di lavoro ad alto valore.
  • Agenti di programmazione che attendono per sbloccare gli sviluppatori.
  • Ricerca o analisi interattiva.
  • Supporto alla risposta a incidenti.
  • Revisioni in tempo reale prima di prendere decisioni.
  • Traffico aziendale sensibile alla latenza in sistemi di produzione stabili.

Per i seguenti scenari, l'elaborazione standard può essere più economica:

  • Attività in background.
  • Ricerca notturna.
  • Generazione asincrona di report.
  • Analisi batch.
  • Attività in cui l'utente non deve attendere.
  • Flussi di lavoro in cui il collo di bottiglia sono gli strumenti esterni, non il modello.

Il sovrapprezzo del doppio dei token ha senso solo quando il valore creato dal completamento a valle supera il suo costo.

In flussi di lavoro con agenti a lungo ciclo, la cache di prompt è ancora più importante

I nuovi prezzi di listino rendono Luna e Terra più economiche, ma la cache di prompt può avere un impatto enorme anche sugli agenti a lunga esecuzione.

Ogni iterazione del ciclo dell'agente può reinviare:

  • Istruzioni di sistema.
  • Definizioni degli strumenti.
  • Documenti condivisi.
  • Contesto del codebase.
  • Cronologia della conversazione.
  • Regole stabili del flusso di lavoro.

Senza cache, le applicazioni potrebbero pagare ripetutamente per gli stessi prefissi.

GPT-5.6 supporta sia la cache automatica sia i punti di interruzione espliciti.

La struttura tariffaria attuale di OpenAI è:

  • Le letture dalla cache costano il 10% del prezzo dell'input non memorizzato.
  • Le scritture nella cache costano il 125% del prezzo dell'input non memorizzato.

La scrittura nella cache costa più dell'input normale, ma le letture successive ricevono uno sconto sostanziale.

La cache è più utile quando lo stesso prefisso stabile viene riutilizzato abbastanza volte da recuperare il costo maggiore della scrittura.

Le applicazioni dovrebbero monitorare:

  • Il tasso di hit della cache.
  • La stabilità dei prefissi.
  • L'intervallo di tempo tra le richieste.
  • La dimensione del contesto memorizzato.
  • Se il flusso di lavoro invalida frequentemente i prefissi.

Specifiche del modello condivise dall'intera serie

L'attuale

La pagina dei modelli API elenca diverse specifiche condivise:

Specifica Sol Terra Luna
Finestra di contesto 1.050.000 token 1.050.000 token 1.050.000 token
Output massimo 128.000 token 128.000 token 128.000 token
Data di aggiornamento delle conoscenze 16 febbraio 2026 16 febbraio 2026 16 febbraio 2026
Input/output di testo Supportato Supportato Supportato
Input di immagini Supportato Supportato Supportato
Token di ragionamento Supportato Supportato Supportato
Chiamate di funzione Supportato Supportato Supportato
Output strutturato Supportato Supportato Supportato
Fine-tuning Non supportato Non supportato Non supportato

Tutti e tre i modelli sono disponibili tramite l'API Responses.

La pagina dei modelli elenca anche un ampio supporto per gli strumenti, ma la disponibilità effettiva delle funzionalità può variare in base a endpoint, account, prodotto e fase di rilascio.

Disponibilità in ChatGPT Work, Codex e API

OpenAI ha dichiarato che GPT-5.6 Terra e Luna rimangono disponibili sulle seguenti piattaforme:

  • ChatGPT Work.
  • Codex.
  • OpenAI API.

L'accesso attuale descritto nell'annuncio dei prezzi include:

Gruppo di piani Accesso a GPT-5.6 in ChatGPT Work e Codex
Free e Go Terra
Plus, Pro, Business, Enterprise Terra e Luna

Sol ha le proprie regole di accesso in ChatGPT, ChatGPT Work, Codex e API.

L'aggiornamento del 30 luglio non ha ridotto i prezzi degli abbonamenti a ChatGPT o Codex.

Non ha nemmeno aumentato i budget di quota dichiarati.

Al contrario, Luna e Terra ora consumano meno crediti, poiché i loro costi di utilizzo sottostanti sono inferiori.

OpenAI ha inoltre dichiarato che l'aggiornamento dei prezzi inizierà a essere implementato tramite AWS lo stesso giorno dell'annuncio. I prezzi dei modelli offerti tramite piattaforme di terze parti potrebbero differire dai prezzi diretti dell'API OpenAI.

Come fare

Scegliere il modello GPT-5.6 giusto

Un processo di selezione pratico può seguire cinque passaggi.

Primo passo: definire chiaramente il risultato atteso

Scrivere cosa conta come successo.

Evitare di scegliere il modello basandosi solo su etichette ampie come "programmazione" o "ricerca".

Secondo passo: identificare il costo del fallimento

Le attività di classificazione a basso rischio e la migrazione di database in produzione non dovrebbero utilizzare le stesse regole decisionali.

Terzo passo: stabilire una baseline con Sol

Per attività difficili, testare prima Sol per comprendere il livello di qualità massimo disponibile.

Quarto passo: testare Terra e Luna sullo stesso set di valutazione

Misurare se i modelli a costo inferiore preservano la qualità che conta davvero.

Quinto passo: ottimizzare l'intero flusso di lavoro

Monitorare:

  • Tasso di successo delle attività.
  • Numero totale di token.
  • Tasso di riutilizzo della cache.
  • Numero di chiamate agli strumenti.
  • Numero di tentativi.
  • Latenza.
  • Tempo di revisione umana.
  • Costo per risultato riuscito.

Non ottimizzare solo il prezzo dei token di input più economici.

Domande frequenti

Qual è il nuovo prezzo di GPT-5.6 Luna?

GPT-5.6 Luna ora ha un prezzo standard di input a contesto breve di 0,20 $ per milione di token, input dalla cache a 0,02 $ per milione di token e output a 1,20 $ per milione di token. Il prezzo di scrittura in cache è di 0,25 $ per milione di token.

Qual è il nuovo prezzo di GPT-5.6 Terra?

GPT-5.6 Terra ora ha un prezzo standard di input a contesto breve di 2,00 $ per milione di token, input dalla cache a 0,20 $ per milione di token e output a 12,00 $ per milione di token. Il prezzo di scrittura in cache è di 2,50 $ per milione di token.

GPT-5.6 Sol è stato ridotto di prezzo?

Il suo prezzo standard per token non è cambiato. Sol rimane a 5 $ per milione di token di input a contesto breve e 30 $ per milione di token di output, mentre la modalità Fast offre una velocità di elaborazione 2,5 volte superiore a un prezzo doppio rispetto a quello standard.

Cosa è successo a Priority Processing?

OpenAI ha rinominato Priority Processing in modalità Fast il 30 luglio 2026. Le richieste esistenti che utilizzano service_tier: "priority" rimangono compatibili e le nuove richieste possono utilizzare service_tier: "fast".

Quando si applica la tariffazione a contesto lungo di GPT-5.6?

L'attuale pagina dei modelli indica che i prompt con più di 272.000 token di input utilizzeranno tariffe di input e output più elevate per l'intera richiesta. Gli sviluppatori dovrebbero considerare questa soglia quando stimano i costi per prompt molto grandi.

Quale modello GPT-5.6 è più adatto per carichi di lavoro ad alta produttività?

OpenAI posiziona Luna come il modello orientato a lavori ad alta produttività e sensibili ai costi. Quando Luna non offre qualità sufficiente, Terra rappresenta la scelta equilibrata, mentre Sol è pensato per le attività professionali più difficili.

La riduzione dei prezzi abbassa i costi degli abbonamenti a ChatGPT e Codex?

No. OpenAI ha dichiarato che i prezzi degli abbonamenti e i budget di quota rimangono invariati. Terra e Luna ora consumano meno punti nei flussi di lavoro supportati dei prodotti a pagamento.

Tutti i provider cloud offrono immediatamente i prezzi ridotti?

I prezzi diretti dell'API OpenAI sono cambiati il 30 luglio. OpenAI ha dichiarato che i prezzi AWS inizieranno a essere implementati più tardi lo stesso giorno, ma i prezzi e la disponibilità su piattaforme di terze parti potrebbero variare, pertanto gli utenti dovrebbero verificare le tariffe attuali del proprio provider.

Strumenti correlati

  • GPT-5.6 Sol: il modello GPT-5.6 di punta di OpenAI per lavori professionali complessi.
  • GPT-5.6 Terra: il modello GPT-5.6 bilanciato

adatto a carichi di lavoro che richiedono intelligenza e costi contenuti.

  • GPT-5.6 Luna: il modello GPT-5.6 più veloce ed economico per attività ad alta produttività e sensibili ai costi.
  • API Responses: l'API principale di OpenAI per ragionamento, strumenti, flussi di lavoro multi-turno e applicazioni agente.
  • Codex: l'ambiente di ingegneria software agente di OpenAI basato sulla famiglia di modelli GPT-5.6.
  • Dashboard API OpenAI: il pannello ufficiale per gestire chiavi API, progetti, utilizzo, limiti e fatturazione.

Link correlati

com/api/docs/guides/latest-model): raccomandazioni ufficiali sulla selezione dei modelli, migrazione, inferenza, caching e flussi di lavoro.

Riepilogo

Nell'aggiornamento del 30 luglio, OpenAI ha ridotto i prezzi standard dell'API di GPT-5.6 Luna dell'80% e quelli di Terra del 20%. Il prezzo standard di Sol rimane invariato, mentre la nuova modalità rapida può aumentare la velocità di risposta dell'API fino a 2,5 volte, con tariffe token doppie.

Questo annuncio si inserisce in una strategia più ampia orientata al rapporto prezzo/prestazioni. OpenAI ha dichiarato di stare migliorando modelli, stack di inferenza, routing, gestione del contesto e framework per agenti, al fine di ridurre il tempo, il numero di token o la potenza di calcolo necessari per ogni attività completata con successo.

Per gli sviluppatori, la scelta corretta non è semplicemente selezionare il modello più economico. Luna è pensata per l'esecuzione ad alto throughput, Terra bilancia costi e intelligenza, mentre Sol gestisce i compiti più complessi. I risparmi derivanti dal routing ibrido dei modelli, dal caching, dalla valutazione e dalla misurazione del costo per successo possono superare di gran lunga quelli ottenuti semplicemente cambiando modello.

Il cambiamento principale è che GPT-5.6 ora offre una gamma di lavoro più ampia: i livelli Luna e Terra forniscono intelligenza quotidiana più economica, mentre quando la latenza giustifica un costo maggiore, si può accedere a intelligenza all'avanguardia più rapida tramite Sol.

Questo file Markdown è un adattamento editoriale indipendente dell'articolo ufficiale. Mantiene i temi, l'ordine dei fatti e il significato effettivo, ma non replica alla lettera le formulazioni di OpenAI o le citazioni dei clienti.