OpenAI riduce dell'80% il prezzo di GPT-5.6 Luna e lancia la modalità API Sol più veloce

OpenAI ha apportato significative modifiche ai prezzi della serie GPT-5.6. A partire dal 30 luglio 2026, l'azienda ha ridotto dell'80% il prezzo API di GPT-5.6 Luna e del 20% quello di GPT-5.6 Terra. Il

发布于 2026年7月31日generalGEO 评分: 01 次阅读
OpenAI riduce dell'80% il prezzo di GPT-5.6 Luna e lancia la modalità API Sol più veloce

OpenAI riduce dell'80% il prezzo di GPT-5.6 Luna e introduce la modalità Sol API più veloce

Introduzione

OpenAI ha apportato importanti modifiche ai prezzi della serie GPT-5.6.

Dal 30 luglio 2026, l'azienda ha ridotto dell'80% il prezzo API di GPT-5.6 Luna e del 20% quello di GPT-5.6 Terra. Il prezzo standard del modello di punta GPT-5.6 Sol rimane invariato, ma OpenAI ha introdotto una modalità veloce che offre una velocità di elaborazione fino a 2,5 volte superiore rispetto alla modalità standard, mantenendo lo stesso livello di intelligenza del modello.

Questa modifica arriva mentre OpenAI ha appena pubblicato un'analisi tecnica che mostra come GPT-5.6 Sol abbia contribuito a ottimizzare i sistemi utilizzati per servire GPT-5.6 stesso. Secondo OpenAI, i miglioramenti ai kernel GPU di produzione hanno ridotto i costi di servizio end-to-end del 20%, mentre i miglioramenti alla decodifica speculativa hanno aumentato l'efficienza di generazione dei token di oltre il 15%.

Il risultato è una strategia più aggressiva da parte di OpenAI sul cosiddetto fronte del rapporto qualità-prezzo: far corrispondere la quantità di intelligenza utilizzata al valore economico dell'attività.

Per gli sviluppatori, il cambiamento più importante è chiaro: Luna è ora significativamente più economica per carichi di lavoro ad alta produttività, Terra ha costi giornalieri inferiori e Sol può essere acquistata a un livello di servizio superiore quando la latenza è più importante del prezzo.

1. Luna in calo dell'80%, Terra del 20%, Sol introduce la modalità veloce

L'aggiornamento dei prezzi del 30 luglio riguarda l'intera serie GPT-5.6, ma le modifiche non sono uniformi tra i modelli.

GPT-5.6 Luna: il taglio di prezzo più significativo

Luna ha ricevuto la riduzione di prezzo più aggressiva.

Il suo prezzo API standard è passato dai seguenti livelli:

Tipo di token Prezzo originale Nuovo prezzo Variazione
Input 1,00 $ / 1 milione di token 0,20 $ / 1 milione di token -80%
Output 6,00 $ / 1 milione di token 1,20 $ / 1 milione di token -80%

OpenAI descrive Luna come il modello più veloce e conveniente della serie GPT-5.6, posizionandolo per carichi di lavoro ad alta produttività e sensibili ai costi.

Questo include attività come:

  • Classificazione
  • Estrazione di informazioni
  • Agenti in background
  • Lavoro di codifica quotidiano
  • Generazione di test
  • Flussi di lavoro con output strutturato
  • Sotto-agenti che utilizzano strumenti
  • Elaborazione documentale su larga scala

Il prezzo più basso modifica in particolare l'economia dei cicli degli agenti, poiché una singola richiesta utente può comportare più chiamate al modello, anziché una singola semplice completazione.

OpenAI afferma che Luna è in grado di utilizzare strumenti e completare flussi di lavoro multi-step, rendendo praticabile l'assegnazione di più lavoro a modelli a costo inferiore, senza dover riservare il comportamento da agente esclusivamente ai livelli premium più costosi.

GPT-5.6 Terra: riduzione minore ma significativa

Il prezzo API standard di Terra è ora:

Tipo di token Prezzo originale Nuovo prezzo Variazione
Input 2,50 $ / 1 milione di token 2,00 $ / 1 milione di token -20%
Output 15,00 $ / 1 milione di token 12,00 $ / 1 milione di token -20%

Terra rimane il modello di fascia media della serie GPT-5.6.

È progettato per carichi di lavoro che richiedono capacità di ragionamento superiori a Luna ma non necessariamente i costi più elevati di Sol.

Le applicazioni tipiche includono:

  • Agenti aziendali quotidiani
  • Assistenza alla programmazione
  • Domande e risposte sullo spazio di lavoro
  • Analisi dei documenti
  • Ricerca a portata limitata
  • Flussi di lavoro professionali multi-step

OpenAI menziona Notion come uno dei clienti che utilizza Terra per carichi di lavoro da agente personale, come domande e risposte sullo spazio di lavoro sensibili alla latenza e attività a portata limitata.

GPT-5.6 Sol mantiene invariato il prezzo standard

Il pricing API standard di Sol rimane invariato:

Tipo di token Prezzo standard
Input 5,00 $ / 1 milione di token
Output 30,00 $ / 1 milione di token

Il cambiamento per Sol non è una riduzione di prezzo.

Al contrario, OpenAI ha introdotto la modalità Fast.

Modalità Fast di Sol: velocità fino a 2,5 volte superiore

La modalità Fast sostituisce la precedente terminologia "priorità di elaborazione" di OpenAI.

Per GPT-5.6 Sol, OpenAI afferma che la modalità Fast è fino a 2,5 volte più veloce dell'elaborazione standard, senza alcuna variazione del livello di intelligenza del modello.

Il costo è il prezzo.

La modalità Fast costa il doppio dell'elaborazione standard.

Per Sol, questo significa:

Tipo di token Standard Modalità Fast
Input 5,00 $ / 1 milione 10,00 $ / 1 milione
Input in cache 0,50 $ / 1 milione 1,00 $ / 1 milione
Output 30,00 $ / 1 milione 60,00 $ / 1 milione

Le richieste API esistenti che utilizzano:

service_tier="priority"

mantengono la compatibilità con le versioni precedenti e vengono instradate alla modalità Fast.

OpenAI supporta anche:

service_tier="fast"

come identificatore di servizio ridenominato.

La modalità Fast è utile quando il costo dell'attesa supera il costo di un'elaborazione più rapida.

Gli esempi includono:

  • Agenti di codifica interattivi
  • Flussi di lavoro di produzione sensibili al tempo
  • Assistenza agli analisti in tempo reale
  • Operazioni cliente ad alto valore
  • Attività complesse da agente in cui la latenza si accumula in più passaggi

Un flusso di lavoro che richiede 20 o 30 chiamate al modello, anche se la latenza di ogni singola chiamata non è elevata, può risultare molto più lento di una singola risposta in chat. Pertanto, nei sistemi ad agenti, un'elaborazione più rapida può avere un impatto sproporzionatamente importante.

Cambiano anche le modalità di misurazione dell'utilizzo per ChatGPT Work e Codex

I prezzi più bassi di Luna e Terra si riflettono anche nel modo in cui vengono calcolati gli utilizzi in ChatGPT Work e Codex.

OpenAI afferma:

  • Gli utenti gratuiti e Go possono utilizzare Terra.
  • Gli utenti Plus, Pro, Business ed Enterprise possono scegliere tra Terra e Luna.
  • I prezzi degli abbonamenti e i budget delle quote rimangono invariati.
  • Poiché Luna e Terra sono più economici, ora consumano meno crediti quando vengono utilizzati.

Ciò non significa che gli abbonamenti a pagamento diventino più economici.

Il cambiamento significa che, quando gli utenti scelgono Luna o Terra, le stesse quote durano più a lungo.

Il rapporto qualità-prezzo sta diventando una metrica di valutazione dei modelli sempre più importante

OpenAI ha pubblicato un grafico che confronta prezzo e intelligenza basato sull'Artificial Analysis Intelligence Index v4.1 per illustrare il nuovo posizionamento di Luna.

Il grafico colloca GPT-5.6 Luna a un punteggio superiore a 50 nell'indice di intelligenza, mostrando al contempo che, dopo l'adeguamento dei prezzi, uno dei modelli Luna

Il costo stimato dell'attività di inferenza configurata è di circa 0,05 USD.

Questo dato non deve essere confuso con il prezzo di una singola chiamata API.

Artificial Analysis calcola il costo per attività di intelligenza basandosi su una metodologia ponderata che combina l'utilizzo di token del modello e parametri di riferimento. Il costo effettivo delle richieste in produzione dipende da:

  • Dimensione dell'input

  • Dimensione dell'output

  • Profondità di inferenza

  • Cache dei prompt

  • Numero di chiamate agli strumenti

  • Numero di cicli dell'agente

  • Fatturazione del contesto lungo

  • Meccanismi di retry

Prima della riduzione dei prezzi del 30 luglio, Artificial Analysis riportava che GPT-5.6 Luna, nella configurazione di inferenza massima, aveva un indice di intelligenza di circa 51.

I nuovi prezzi dei token, più bassi, avvicinano ulteriormente Luna all'estremità a basso costo della curva "intelligenza-costo".

Il messaggio più ampio comunicato da OpenAI è che le aziende non dovrebbero utilizzare il modello più costoso per ogni singola operazione.

Un flusso di lavoro potrebbe prima utilizzare Sol per disambiguare e pianificare, per poi assegnare a Luna l'implementazione, i test o le attività ripetitive ben definite.

Quando i modelli di livello inferiore sono già in grado di utilizzare strumenti e completare flussi di lavoro multi-step, questo tipo di routing dei modelli diventa molto più interessante.

2. GPT-5.6 ha contribuito a ottimizzare l'infrastruttura che esegue GPT-5.6

Il giorno prima della riduzione dei prezzi, OpenAI ha pubblicato un articolo tecnico dettagliato su come GPT-5.6 sia diventato più efficiente.

L'aspetto più insolito di questa storia è che GPT-5.6 Sol stesso ha partecipato al processo di ottimizzazione.

OpenAI ha dichiarato che i suoi ingegneri, tramite Codex, hanno utilizzato Sol per analizzare i sistemi di produzione, scrivere codice ad alte prestazioni, testare alternative e monitorare gli esperimenti.

L'azienda ha descritto ottimizzazioni su tre livelli principali:

  1. Suite di strumenti per agenti
  2. Orchestrazione di API e richieste
  3. Inferenza del modello su infrastruttura GPU

Sol ha contribuito a ottimizzare i kernel GPU di produzione

A livello di inferenza, OpenAI ha dichiarato che GPT-5.6 Sol ha riscritto e ottimizzato autonomamente i kernel di produzione.

I kernel GPU sono programmi di basso livello responsabili dell'esecuzione efficiente delle operazioni matematiche sull'hardware acceleratore.

Anche se l'architettura sottostante del modello rimane invariata, movimenti di memoria inefficienti, sincronizzazioni, schedulazioni o layout dei dati possono portare a un sottoutilizzo delle costose risorse GPU.

OpenAI ha dichiarato che Sol ha contribuito a identificare i seguenti tipi di calcoli ottimizzabili:

  • Pre-calcolabili
  • Evitabili
  • Parallelizzabili
  • Riorganizzabili
  • Implementabili tramite kernel più efficienti

L'azienda ha menzionato in particolare le tecnologie di programmazione GPU Triton e Gluon come parte di questo lavoro.

Secondo OpenAI, i miglioramenti ai kernel e le relative ottimizzazioni dei servizi hanno ridotto il costo di servizio end-to-end di GPT-5.6 del 20%.

Sol ha anche migliorato la decodifica speculativa

Un'altra ottimizzazione importante è arrivata dalla decodifica speculativa.

Una versione semplificata della decodifica speculativa è la seguente:

  1. Un modello bozza più piccolo prevede diversi token successivi possibili.
  2. Il modello principale valuta questi token candidati in parallelo.
  3. I token accettati possono essere prodotti senza la stessa quantità di lavoro di generazione sequenziale.

Pertanto, la qualità del modello bozza è cruciale.

OpenAI ha dichiarato che GPT-5.6 Sol ha progettato ed eseguito centinaia di esperimenti sull'architettura del modello speculativo, con modifiche tra cui:

  • Scala
  • Struttura
  • Caratteristiche
  • Configurazione dell'addestramento

Sol ha inoltre monitorato il processo di addestramento, intervenendo in caso di guasti hardware o instabilità dell'addestramento.

OpenAI ha dichiarato che i miglioramenti risultanti hanno portato a un aumento dell'efficienza di generazione dei token superiore al 15%.

Anche il bilanciamento del carico è importante

Il costo del modello non dipende solo dal codice eseguito all'interno di una singola GPU.

Le richieste devono essere instradate tra i seguenti livelli:

  • Regioni
  • Data center
  • Tipi di acceleratori
  • Cluster
  • Istanze del modello
  • Sottoreti del modello
  • Core di calcolo

Se il lavoro non è distribuito in modo uniforme e parte dell'hardware rimane inattiva, i costi possono rimanere elevati anche con acceleratori potenti.

OpenAI ha dichiarato che Sol ha contribuito ad analizzare il traffico di produzione, individuare le cause dello squilibrio di carico, testare strategie di routing alternative e regolare le euristiche utilizzate per distribuire le richieste.

Questo tipo di ottimizzazione a livello operativo può aumentare la produttività complessiva senza un corrispondente aumento dell'investimento hardware.

La gestione del contesto riduce i calcoli ridondanti

OpenAI ha inoltre ottimizzato i framework per agenti utilizzati da sistemi come Codex e ChatGPT Work.

Un agente può richiedere più chiamate a modelli e strumenti prima di restituire un risultato finale.

Ad esempio, Codex potrebbe:

  1. Esaminare il codice sorgente.
  2. Cercare nella cronologia di distribuzione.
  3. Leggere i rapporti sugli incidenti.
  4. Modificare i file.
  5. Eseguire i test.
  6. Controllare gli errori.
  7. Modificare il codice.
  8. Rieseguire i test.

Ogni ciclo può trasportare contesto, definizioni di strumenti, risultati precedenti e informazioni sull'ambiente.

Se questo contesto cresce inutilmente, aumentano anche costi e latenza.

OpenAI ha dichiarato che il suo framework per agenti adotta tecniche come la scoperta a richiesta, esponendo strumenti, competenze, plugin e integrazioni MCP solo quando necessario.

L'output degli strumenti è limitato per impostazione predefinita a 10.000 token, a meno che il modello non richieda un limite diverso.

Questo riduce la probabilità che grandi risultati di strumenti riempiano inutilmente la finestra di contesto.

Cronologia append-only per preservare la cache dei prompt

I cicli degli agenti spesso riutilizzano le stesse istruzioni e lo stesso contesto più volte.

La cache dei prompt evita di ricalcolare i prefissi di prompt stabili.

Ma la cache funziona solo quando i prefissi ripetuti rimangono esattamente identici.

OpenAI ha dichiarato che il suo framework mantiene la cronologia visibile al modello di tipo append-only:

  • I nuovi messaggi vengono aggiunti alla fine.
  • I risultati degli strumenti vengono aggiunti alla fine.
  • Gli aggiornamenti dell'ambiente vengono aggiunti alla fine.
  • L'ordinamento degli strumenti è deterministico.
  • Le impostazioni di approvazione in fase di runtime non vengono gestite nelle definizioni degli strumenti.

Questo design migliora il tasso di riutilizzo della cache dei prompt in Codex e ChatGPT Work.

Il principio di base è semplice:

Un modello è più economico non solo perché il costo dei suoi token è inferiore, ma anche perché i sistemi circostanti evitano fin dall'inizio di generare ed elaborare token non necessari.

Il ciclo di efficienza può produrre effetti composti

OpenAI descrive questo come un ciclo di feedback.

Modelli più potenti aiutano gli ingegneri a migliorare:

  • Kernel GPU
  • Routing
  • Decodifica speculativa
  • Cache
  • Configurazione dei carichi di lavoro
  • Orchestrazione degli agenti

Questi miglioramenti riducono costi e latenza.

Un'infrastruttura più efficiente rende a sua volta più economico eseguire modelli più potenti su larga scala.

OpenAI ritiene che questo possa accorciare il ciclo dalla ricerca sui modelli alla distribuzione su larga scala, accelerando così il ritmo dell'innovazione nell'IA.

È necessario trovare i prossimi guadagni di ottimizzazione.

La riduzione dei prezzi di Luna e Terra del 30 luglio è finora il risultato più visibile per i clienti.

3. Reazioni degli sviluppatori: Luna ottiene più attenzione, i concorrenti affrontano nuove pressioni sui prezzi

Il rapporto originale in cinese ha inoltre evidenziato l'entusiastica reazione della comunità degli sviluppatori dopo l'annuncio.

Alcuni utenti si sono concentrati sull'entità della riduzione del prezzo di Luna.

Il calo dell'80% è di gran lunga superiore agli aggiustamenti incrementali tipici delle API all'avanguardia.

Altri ritengono che Luna fosse sottovalutata prima della riduzione dei prezzi, soprattutto per i carichi di lavoro degli agenti, in cui modelli a costo inferiore possono gestire attività di esecuzione di routine sotto la guida di pianificatori più forti.

Questo aggiustamento dei prezzi ha inoltre immediatamente innescato confronti con altri modelli attenti ai costi, tra cui Kimi K3.

Un meme virale circolato nella community descriveva la situazione come: Luna che improvvisamente compete per gli utenti attratti dal posizionamento a basso prezzo di Kimi K3.

Il meme era divertente, ma non essendo un benchmark tecnico, non è stato incluso tra le immagini del testo principale.

Gli sviluppatori hanno subito chiesto se Anthropic avrebbe risposto

Un'altra reazione comune è stata quella di taggare @Anthropic, chiedendo se i prezzi dell'API Claude sarebbero stati adeguati di conseguenza.

Questa reazione riflette un cambiamento più ampio nel panorama competitivo dei modelli di frontiera.

Un anno fa, la competizione più visibile era concentrata su:

  • Punteggi dei benchmark
  • Capacità di codifica
  • Finestre di contesto
  • Funzionalità multimodali

Queste dimensioni restano importanti.

Ma gli sviluppatori che eseguono agenti a livello di produzione sono sempre più attenti a:

  • Costo per attività completata
  • Latenza
  • Utilizzo dei token di output
  • Efficienza della cache dei prompt
  • Numero di chiamate agli strumenti
  • Affidabilità
  • Flessibilità del routing dei modelli

Il token più economico non è sempre il flusso di lavoro più economico.

Allo stesso modo, il modello più intelligente non è necessariamente il modello migliore per ogni fase di un flusso di lavoro.

Il taglio del prezzo di Luna rende il routing dei modelli più interessante

Supponiamo che un'attività sia composta da cinque fasi:

  1. Comprendere un problema ambiguo.
  2. Elaborare un piano.
  3. Modificare file di routine.
  4. Scrivere test.
  5. Controllare i risultati.

Un team potrebbe utilizzare Sol per le fasi 1 e 2.

Quando il lavoro è chiaramente specificato, Luna può gestire le fasi 3–5.

Più Luna è economica, più forte è l'incentivo a deviare il lavoro agente di routine dal modello di punta.

Questo non significa che Luna sia vicina a Sol in ogni capacità.

Significa che il valore di un modello più piccolo dipende dal fatto che sia abbastanza intelligente per il compito specifico a cui è assegnato.

La metrica importante è il costo per risultato riuscito

La nuova narrativa di OpenAI insiste ripetutamente sul risultato per dollaro.

Questo è più utile che concentrarsi solo sul prezzo dei token.

Le valutazioni in produzione dovrebbero monitorare:

  • Tasso di successo delle attività
  • Token di input
  • Token di output
  • Riuso dell'input nella cache
  • Numero di turni del modello
  • Chiamate a strumenti
  • Latenza end-to-end
  • Tasso di ripetizione
  • Tempo di correzione manuale
  • Costo totale per attività riuscita

Un modello che costa un quinto per token può comunque essere costoso se richiede molte ripetizioni.

Un modello più costoso che completa il lavoro con meno passaggi potrebbe invece avere un costo complessivo inferiore.

Il nuovo prezzo di Luna rende il calcolo più favorevole ai modelli più piccoli, ma gli sviluppatori hanno ancora bisogno di

valutazioni specifiche per i loro carichi di lavoro.

Conclusione: la competizione tra modelli si sta spostando sul rapporto tra intelligenza e costo

Gli eventi del 29 e 30 luglio mostrano che OpenAI sta avanzando su due fronti correlati.

In primo luogo, GPT-5.6 viene sempre più utilizzato per migliorare l'infrastruttura che esegue GPT-5.6 stesso.

In secondo luogo, l'azienda converte parte di questi guadagni di efficienza in prezzi più bassi per i clienti e opzioni di servizio più veloci.

Questo cambia il panorama competitivo.

La fase successiva del mercato dei modelli non riguarda solo:

Quale modello è il più intelligente?

Ma anche:

Quanta intelligenza utile possono acquistare gli sviluppatori per ogni dollaro speso e per ogni secondo di attesa?

Il taglio dell'80% sul prezzo di Luna rende questa domanda particolarmente rilevante.

Terra è diventata più conveniente per il lavoro professionale quotidiano.

Sol rimane il modello di fascia alta, ma la modalità Fast consente agli sviluppatori di pagare di più per una maggiore velocità quando il tempo è critico.

Con la qualità dei modelli che si sta avvicinando su un numero sempre maggiore di attività, le aziende che riescono a far svolgere più lavoro utile con lo stesso hardware — e a trasformare questi guadagni di efficienza in prezzi migliori — potrebbero ottenere un vantaggio competitivo sempre più importante.

Domande frequenti

Qual è il nuovo prezzo dell'API GPT-5.6 Luna?

A partire dal 30 luglio 2026, OpenAI ha fissato il prezzo di GPT-5.6 Luna in modalità di elaborazione standard a 0,20 USD per milione di token di input e 1,20 USD per milione di token di output. Si tratta di una riduzione dell'80% rispetto al prezzo iniziale di 1 USD/6 USD per milione di token.

Qual è il nuovo prezzo di GPT-5.6 Terra?

GPT-5.6 Terra è attualmente prezzato a 2 USD per milione di token di input e 12 USD per milione di token di output in modalità di elaborazione standard. OpenAI ha dichiarato che si tratta di una riduzione del 20% rispetto al precedente prezzo di 2,50 USD/15 USD per milione di token.

GPT-5.6 Sol è stato ridotto di prezzo?

No. Il prezzo API standard di Sol rimane di 5 USD per milione di token di input e 30 USD per milione di token di output. Il cambiamento principale è l'introduzione della modalità Fast.

Cos'è la modalità Fast di GPT-5.6 Sol?

La modalità Fast è il livello di elaborazione API più rapido di OpenAI, che sostituisce il precedente nome Priority Processing (Elaborazione Prioritaria). Per GPT-5.6 Sol, OpenAI ha dichiarato che, al doppio del prezzo standard dei token, può aumentare la velocità di elaborazione fino a 2,5 volte rispetto alla modalità standard, senza modificare il livello di intelligenza del modello.

Le vecchie richieste API con Priority Processing funzionano ancora?

Sì. OpenAI ha dichiarato che le richieste che utilizzano il livello di servizio priority sono ancora retrocompatibili e utilizzeranno automaticamente la modalità Fast. Gli sviluppatori possono anche utilizzare il valore del livello di servizio fast.

GPT-5.6 ha davvero contribuito a ottimizzare se stesso?

OpenAI ha dichiarato che GPT-5.6 Sol, utilizzato tramite Codex in un processo ingegneristico supervisionato da esseri umani, ha contribuito ad analizzare il traffico di produzione, riscrivere kernel GPU, eseguire centinaia di esperimenti di decodifica speculativa e monitorare il processo di addestramento. OpenAI attribuisce parte della riduzione del 20% del costo del servizio end-to-end e dell'aumento di oltre il 15% dell'efficienza nella generazione di token a questo lavoro.

Il taglio dei prezzi cambierà gli abbonamenti ChatGPT?

I prezzi degli abbonamenti e i budget dei crediti non cambieranno. OpenAI ha dichiarato che, grazie ai prezzi sottostanti più bassi, Luna e Terra ora consumano meno crediti in Codex e ChatGPT Work.

Luna è ora il modello migliore per tutti i carichi di lavoro degli agenti?

No. Luna è molto più economica, ma la scelta del modello dipende ancora dalla difficoltà del compito e dal tasso di errore accettabile. La strategia comune è: utilizzare modelli più forti per attività di pianificazione ambigue e modelli più economici per attività di esecuzione chiaramente definite.

Strumenti correlati

  • [OpenAI

API](https://openai.com/api/): La piattaforma per sviluppatori di OpenAI per l'accesso ai modelli GPT-5.6 e ai servizi API.

  • GPT-5.6 Sol: Specifiche ufficiali del modello di punta GPT-5.6.
  • GPT-5.6 Terra: Documentazione ufficiale del modello GPT-5.6 di livello bilanciato.
  • GPT-5.6 Luna: Documentazione ufficiale del modello GPT-5.6 di livello sensibile ai costi.
  • Codex: L'ambiente di codifica agente di OpenAI, utilizzato in parte del lavoro di ottimizzazione di GPT-5.6.
  • Artificial Analysis: Una piattaforma di analisi indipendente dei modelli, che copre livello di intelligenza, velocità, utilizzo dei token e costo per attività.

Link correlati

ai/models/gpt-5-6-luna/): Dettagli sulla metodologia a livello di modello e sull'indice di intelligenza di Luna.

Riepilogo

OpenAI ha ridotto il prezzo dell'API di GPT-5.6 Luna dell'80% e quello di Terra del 20%, mantenendo invariato il prezzo di Sol Standard. Sol ha invece introdotto una nuova modalità Fast, che aumenta la velocità di elaborazione API fino a 2,5 volte, ma a un prezzo doppio rispetto a Standard.

Questa tempistica è strettamente legata ai recenti lavori di ingegneria di OpenAI. L'azienda ha dichiarato che GPT-5.6 Sol ha contribuito a ottimizzare i kernel GPU, la decodifica speculativa, il bilanciamento del carico e l'infrastruttura degli agenti, riducendo i costi di servizio end-to-end del 20% e migliorando l'efficienza di generazione dei token di oltre il 15% in alcune parti dello stack tecnologico.

Per gli sviluppatori, il risultato è una gamma più ampia di rapporto qualità-prezzo: Sol per i compiti più difficili, Terra per attività professionali equilibrate e Luna a un prezzo inferiore per esecuzioni di agenti su larga scala.

Gli aggiornamenti di GPT-5.6 dimostrano che la competizione sui modelli all'avanguardia si concentra sempre più sul costo per risultato riuscito, non solo sul livello di intelligenza di base nei benchmark.