OpenAI GPT-5.6 Sol, Terra e Luna: prestazioni, prezzi ed efficienza in dettaglio
La serie GPT-5.6 di OpenAI include tre livelli di modelli: Sol, Terra e Luna. Invece di offrire un unico modello per tutti i carichi di lavoro, OpenAI suddivide la serie in base a capacità, costi e throughput: - GPT-5.6 Sol è il modello di punta, adatto per lavori professionali complessi, programmazione, ricerca, cybersecurity e attività a lungo termine. - GPT-5.6 Terra è pensato per carichi di lavoro che richiedono ancora un'intelligenza elevata ma con vincoli di costo più stringenti. - GPT-5.6 Luna è il membro più veloce ed economico della serie.

OpenAI GPT-5.6 Sol, Terra e Luna: prestazioni, prezzi ed efficienza in dettaglio
Introduzione
La serie GPT-5.6 di OpenAI comprende tre livelli di modelli: Sol, Terra e Luna.
Invece di offrire un unico modello per tutti i carichi di lavoro, OpenAI differenzia la serie in base a capacità, costo e produttività:
- GPT-5.6 Sol è il modello di punta, progettato per lavori complessi e specialistici, programmazione, ricerca, cybersecurity e attività agente di lunga durata.
- GPT-5.6 Terra è pensato per carichi di lavoro che richiedono comunque un'intelligenza potente, ma con vincoli di costo più stringenti.
- GPT-5.6 Luna è il membro più veloce ed economico della serie, adatto a carichi di lavoro sensibili ai costi e ad alta produttività.
OpenAI ha presentato per la prima volta la serie a giugno 2026, con il lancio completo avvenuto il 9 luglio. L'articolo originale di AIBase è stato pubblicato il 30 luglio, evidenziando i miglioramenti di efficienza alla base del lancio: migliori prestazioni per token, livelli di modello a costo inferiore e ottimizzazioni dell'infrastruttura e dei cicli agente progettate per ridurre il costo totale per completare il lavoro utile.
Questo focus è cruciale. Per i sistemi AI di livello produttivo, la metrica rilevante è sempre meno quanto un modello appare intelligente in isolamento, ma quanto lavoro utile può completare in un dato tempo, con determinate risorse computazionali e budget.
Tre Modelli GPT-5.6 per Diversi Carichi di Lavoro
OpenAI descrive Sol, Terra e Luna come livelli di capacità persistenti, non suffissi temporanei.
Il numero generazionale identifica la serie GPT-5.6, mentre i nomi distinguono i livelli di prestazioni e costo previsti.
| Modello | Posizionamento | Prezzo Input API | Prezzo Output API | Finestra di Contesto | Output Massimo |
|---|---|---|---|---|---|
| GPT-5.6 Sol | Modello di punta per lavori complessi e specialistici | $5 per milione di token | $30 per milione di token | 1.050.000 token | 128.000 token |
| GPT-5.6 Terra | Equilibrio tra intelligenza e costo | $2,50 per milione di token | $15 per milione di token | 1.050.000 token | 128.000 token |
| GPT-5.6 Luna | Carichi di lavoro ad alta produttività e sensibili ai costi | $1 per milione di token | $6 per milione di token | 1.050.000 token | 128.000 token |
Tutte e tre le pagine dei modelli elencano una data di cut-off della conoscenza al 16 febbraio 2026 e supportano input di testo e immagini nonché output di testo.
L'alias API gpt-5.6 instrada a GPT-5.6 Sol.
GPT-5.6 Sol: Il Modello di Punta
Sol è il livello GPT-5.6 più capace di OpenAI.
OpenAI lo posiziona per:
- Programmazione complessa
- Flussi di lavoro agente di lunga durata
- Lavoro conoscitivo specialistico
- Ricerca scientifica
- Cybersecurity
- Utilizzo del computer
- Analisi multimodale
- Attività di ragionamento ad alto valore
Sull'Artificial Analysis Coding Agent Index v1.1, OpenAI riporta che GPT-5.6 Sol ottiene un punteggio di 80 in modalità di ragionamento massimo, rispetto al punteggio di 77,2 di Claude Fable 5 nella stessa tabella.
OpenAI afferma inoltre che in questo confronto, Sol ha utilizzato meno della metà dei token di output e meno della metà del tempo, con un costo stimato per attività inferiore.
Ciò non significa che Sol sia universalmente superiore in ogni benchmark. Le stesse tabelle di lancio di OpenAI mostrano che i modelli concorrenti sono in vantaggio in alcune valutazioni. Il punto di forza più coerente di GPT-5.6 sono le prestazioni per token e per dollaro, non il primato assoluto in ogni categoria di attività.
GPT-5.6 Terra: Il Livello Bilanciato
Terra è il modello intermedio della serie.
OpenAI ne descrive le capacità come paragonabili a quelle di GPT-5.5, con una tariffazione di:
- $2,50 per milione di token di input
- $15 per milione di token di output
Si tratta della metà del prezzo di $5 / $30 corrispondente al precedente livello di punta.
Pertanto, Terra è adatto per team che necessitano di solide capacità di ragionamento e agente, ma per carichi di lavoro che non richiedono di attivare Sol per ogni richiesta.
Esempi tipici includono:
- Agenti aziendali interni
- Sottoagenti di codifica
- Analisi documentale
- Flussi di ricerca
- Automazione ad alta intensità di strumenti
- Attività specialistiche ad alto volume
Il modello supporta la stessa finestra di contesto di 1,05 milioni di token e un output massimo di 128.000 token di Sol.
GPT-5.6 Luna: Il Livello GPT-5.6 a Costo Inferiore
Luna è progettato per carichi di lavoro in cui la produttività e il costo sono fondamentali.
I prezzi API sono:
- $1 per milione di token di input
- $6 per milione di token di output
Ciò rende la tariffazione sia di input che di output l'80% inferiore rispetto a Sol.
OpenAI descrive Luna come il modello GPT-5.6 più veloce e più conveniente. È adatto per carichi di lavoro quali:
- Classificazione
- Estrazione
- Instradamento
- Elaborazione ad alto volume
- Agenti leggeri
- Attività strutturate ripetitive
- Applicazioni che possono trasferire i casi difficili a Terra o Sol
Il prezzo più basso non significa che Luna sia solo un modello utilitario senza ragionamento. Supporta comunque le funzionalità di ragionamento GPT-5.6 e l'ecosistema di strumenti di OpenAI, ma con un tetto di capacità inferiore rispetto a Sol.

L'Efficienza è il Tema Centrale di GPT-5.6
L'articolo di AIBase sottolinea che GPT-5.6 non è solo un aggiornamento della qualità del modello.
L'obiettivo ingegneristico più ampio è aumentare la quantità di lavoro utile prodotto per token e ridurre il sovraccarico dell'esecuzione agente.
I materiali di lancio ufficiali di OpenAI supportano questa direzione più ampia.
L'azienda afferma che GPT-5.6 è stato addestrato per completare lavoro utile con meno token di output e la sua guida per sviluppatori suggerisce, quando si migra da GPT-5.5 o GPT-5.4, di testare il medesimo livello di sforzo di ragionamento—spesso riducendo di un livello.
Questo è importante perché il prezzo pubblicizzato per token è solo una parte del costo agente.
Un flusso di lavoro multi-step può consumare risorse attraverso:
- Prompt lunghi
- Contesto ripetuto
- Token di ragionamento
- Definizioni di strumenti
- Output di strumenti
- Cicli di riprova
- Turni multipli del modello
- Sottoagenti
- Risposte finali lunghe
Pertanto, un modello che richiede meno passaggi, anche se la sua tariffa nominale per token sembra simile, può essere più economico nell'uso reale.
Le Prestazioni di Codifica di Sol Migliorano il Rapporto Prestazioni per Dollaro
L'articolo originale mette in evidenza le prestazioni dell'agente di codifica Sol.
Tabella comparativa attuale di OpenAI
Rapporto:
| Valutazione di codifica | GPT-5.6 Sol | GPT-5.6 Terra | GPT-5.6 Luna | GPT-5.5 |
|---|---|---|---|---|
| Indice di intelligenza di codifica AI v1.1 | 80 | 77,4 | 74,6 | 76,4 |
| SWE-Bench Pro | 64,6% | 63,4% | 62,7% | 59,4% |
| DeepSWE v1.1 | 72,7% | 69,6% | 67,2% | 67,0% |
| Terminal-Bench 2.1 | 88,8% | 87,4% | 84,7% | 85,6% |
Questi dati provengono dalle tabelle di avvio pubblicate da OpenAI e devono essere letti nel contesto di specifici framework di valutazione e impostazioni.
Ad esempio, i risultati dei benchmark possono variare in base a:
- Profondità di ragionamento
- Framework dell'agente
- Disponibilità di strumenti
- Limiti di tempo
- Numero di seed di valutazione
- Snapshot del modello
- Formato del prompt
OpenAI sottolinea inoltre che alcuni dei suoi confronti di costi e latenza si basano su stime offline del comportamento produttivo e non su fatture dirette di ciascun servizio concorrente.
La lezione pratica è che i modelli dovrebbero essere testati su carichi di lavoro rappresentativi, non scelti solo in base alle classifiche.
Lo stack di inferenza viene ottimizzato, non solo il modello
La fonte AIBase descrive l'ottimizzazione dell'intero stack di servizi, tra cui:
- Bilanciamento del carico
- Decodifica speculativa
- Ottimizzazione della cache
- Kernel GPU ottimizzati
Riporta anche che il lavoro di inferenza ha migliorato l'efficienza di generazione dei token di oltre il 15%.
Questi dettagli sui servizi di base sono presentati nel report AIBase. L'attuale pagina di lancio pubblica di GPT-5.6 di OpenAI conferma gli sforzi più ampi per migliorare il servizio e l'efficienza della ricerca, ma i dati sottostanti esatti dovrebbero essere considerati come riportati dalla fonte, a meno che non vengano riprodotti in pubblicazioni tecniche di OpenAI o in benchmark con metodologia completa documentata.
Ciò che può essere confermato indipendentemente dalla documentazione OpenAI è che GPT-5.6 aggiunge vari meccanismi volti a ridurre il lavoro non necessario del modello.
Questi includono:
- Generazione di token più efficiente
- Caching esplicito dei prompt
- Ragionamento persistente
- Chiamate di strumenti programmatiche
- Esecuzione multi-agente per carichi di lavoro appropriati
- Profondità di ragionamento configurabile
La direzione ingegneristica è coerente: ridurre il lavoro ridondante attorno a ogni attività completata con successo.
Il caching dei prompt diventa più esplicito
GPT-5.6 introduce un caching dei prompt più prevedibile.
La documentazione OpenAI supporta punti di interruzione di cache espliciti, consentendo agli sviluppatori di decidere quali prefissi di prompt riutilizzabili devono essere memorizzati nella cache.
Per i modelli GPT-5.6:
- La scrittura nella cache viene fatturata a 1,25 volte la tariffa normale di input non memorizzato nella cache.
- La lettura dalla cache può ottenere uno sconto del 90% sull'input memorizzato nella cache.
- La documentazione OpenAI indica una durata di vita minima della cache di 30 minuti per il nuovo comportamento di caching.
Questo cambia il modo in cui gli sviluppatori pensano agli agenti a lungo termine.
Se prompt di sistema di grandi dimensioni, cataloghi di strumenti, sezioni di policy o contesti di progetto stabili vengono inviati ripetutamente come input non memorizzati nella cache, i costi possono essere elevati.
Quando i prefissi riutilizzabili rimangono stabili, la cache può ridurre tali costi.
Allo stesso tempo, scritture nella cache non necessarie possono aumentare i costi. Pertanto, OpenAI consiglia di monitorare sia l'utilizzo dei token memorizzati nella cache che l'utilizzo dei token di scrittura nella cache, piuttosto che presumere che la cache sia sempre più economica.
L'orchestrazione degli strumenti può ridurre le chiamate di andata e ritorno del modello
La seconda area principale di efficienza è il framework dell'agente.
Il ciclo tradizionale degli strumenti segue solitamente questo schema:
Il modello decide di effettuare una chiamata
L'applicazione esegue lo strumento.
Il risultato completo dello strumento viene restituito al modello.
Il modello legge il risultato e decide il passo successivo.
Viene chiamato un altro strumento.
Il ciclo si ripete.

Sebbene flessibile, questo approccio può diventare costoso.
Output intermedi di grandi dimensioni possono entrare ripetutamente nel contesto del modello, anche se è necessaria solo una piccola parte dei dati.
Le chiamate di strumenti programmatiche di GPT-5.6 offrono un'alternativa.
La documentazione OpenAI mostra che GPT-5.6 può scrivere JavaScript in un ambiente di esecuzione gestito per:
- Chiamare gli strumenti che soddisfano le condizioni
- Passare i risultati tra le chiamate
- Filtrare i dati intermedi
- Unire i record
- Ordinare i risultati
- Deduplicare i dati
- Convalidare i dati
- Restituire al modello risultati strutturati più piccoli
Per i flussi di lavoro vincolati, questo può ridurre:
- I round del modello
- La crescita del prompt
- I token intermedi
- Il numero di viaggi di andata e ritorno di rete
OpenAI afferma che questo schema è particolarmente utile quando il codice può gestire più risultati prevedibili di strumenti senza dover ripetere il giudizio semantico dopo ogni chiamata.
Non è adatto per tutte le attività degli agenti.
L'interazione diretta modello-strumento rimane la scelta migliore quando:
- Una singola chiamata di strumento è sufficiente
- Ogni risultato può portare a un cambiamento sostanziale nel ragionamento successivo
- È necessaria l'approvazione umana
- I risultati intermedi sono già piccoli
- La risposta finale deve mantenere riferimenti o artefatti nativi
L'obiettivo non è ridurre il numero di chiamate a tutti i costi, ma evitare di trasmettere informazioni non necessarie attraverso il modello.
La cronologia della conversazione e il ragionamento possono essere gestiti in modo più granulare
L'articolo di AIBase sottolinea anche che una gestione più rigorosa della cronologia della conversazione è un metodo per migliorare il tasso di riutilizzo della cache.
Le attuali linee guida per lo sviluppo di GPT-5.6 di OpenAI forniscono un meccanismo ufficiale correlato: ragionamento persistente.
Gli sviluppatori possono configurare come mantenere disponibile il ragionamento dei turni precedenti.
Questo è importante per i flussi di lavoro a lungo termine, poiché non tutte le idee precedenti sono ugualmente utili per sempre.
Se l'attività rimane stabile, il ragionamento precedente può migliorare la continuità.
Se l'obiettivo cambia, mantenere tutto il ragionamento precedente aumenta i costi e introduce presupposti obsoleti.
Pertanto, OpenAI consente alle applicazioni di controllare il contesto di ragionamento e suggerisce di conservare correttamente gli elementi di risposta necessari quando si gestisce manualmente la cronologia.
Questo offre agli sviluppatori un'altra leva per bilanciare:
- Continuità
- Efficienza della cache
- Dimensione del contesto
- Costo
- Qualità
Prompt semplificati possono anche ridurre i costi dell'agente
Le linee guida per lo sviluppo di GPT-5.6 di OpenAI raccomandano in particolare prompt semplificati.
In un campione di valutazioni interne di agenti di codifica, OpenAI riporta che la semplificazione dei prompt e delle descrizioni degli strumenti:
- Ha migliorato i punteggi di valutazione di circa il 10-15%
- Ha ridotto il numero totale di token del 41-66%
- Ha ridotto i costi del 33-67%
OpenAI afferma esplicitamente che questi numeri sono solo a scopo di riferimento e che i risultati variano in base al carico di lavoro.
Il suggerimento non è quello di rimuovere vincoli utili.
Il suo scopo è eliminare contenuti duplicati.
Un flusso di migrazione pratico è il seguente:
- Partire da un prompt e un set di strumenti che funzionano già correttamente.
- Rimuovere un insieme di istruzioni duplicate alla volta.
- Rieseguire la stessa attività di valutazione.
- Conservare i vincoli che migliorano la qualità misurabile.
- Eliminare le istruzioni che aumentano i token senza migliorare i risultati.
Questo è particolarmente importante per i prodotti basati su agenti, poiché lo stesso prompt di sistema e le stesse descrizioni degli strumenti possono essere inviati migliaia di volte al giorno.
La scelta del modello dovrebbe corrispondere al carico di lavoro
La serie GPT-5.6 offre agli sviluppatori tre opzioni principali di rapporto costo-qualità.
Utilizzare Sol quando la qualità è il vincolo principale
Scegliere Sol quando l'attività beneficia sostanzialmente di capacità all'avanguardia.
Casi d'uso appropriati includono:
- Ingegneria del software di elevata difficoltà
- Ricerca complessa
- Pianificazione a lungo termine
- Lavoro di cybersecurity
- Analisi professionale ad alto valore
- Attività in cui un leggero miglioramento della qualità giustifica il costo maggiore del modello
Utilizzare Terra per potenti carichi di lavoro produttivi generici
Quando l'attività richiede una buona capacità di ragionamento ma non necessita di Sol, Terra è la scelta pragmatica.
È adatta per:
- Agenti aziendali quotidiani
- Assistenza alla codifica
- Flussi di lavoro di documenti
- Subagenti di ricerca
- Utilizzo di strumenti di media complessità
- Attività professionali ad alto volume
Utilizzare Luna quando costi e volume sono predominanti
Luna è la scelta naturale per i seguenti scenari:
- Classificazione
- Estrazione
- Instradamento
- Trasformazione dei dati
- Flussi di lavoro con strumenti leggeri
- Automazione batch ad alto volume
Un'architettura comune prevede di instradare il lavoro ordinario verso Luna o Terra, inoltrando solo i compiti più difficili a Sol.
Il prezzo è solo l'inizio
Per i sistemi agenziali, un semplice confronto per token può essere fuorviante.
Consideriamo due modelli.
Il modello A ha un costo per token di output inferiore, ma richiede:
- Il doppio dei token di ragionamento
- Più chiamate a strumenti
- Più tentativi
- Più contesto
- Più cicli
Il modello B ha un prezzo nominale più alto, ma completa il compito con la metà dei passaggi.
Il secondo modello potrebbe comunque risultare più economico in termini di costo per compito completato.
Pertanto, i team che valutano GPT-5.6 dovrebbero monitorare:
- Tasso di successo dei compiti
- Token di input totali
- Token di output totali
- Token nella cache
- Scritture nella cache
- Numero di cicli del modello
- Numero di chiamate a strumenti
- Latenza
- Tasso di ripetizione
- Tempo di correzione manuale
- Costo totale per compito riuscito
Questo è il vero significato di "intelligenza per token".
Test di migrazione pratici
Per i team che utilizzano già GPT-5.5 o modelli precedenti, un confronto controllato è più utile di una migrazione completa immediata.
Passo 1: Costruire un set di valutazione rappresentativo
Includere:
- Richieste semplici
- Richieste difficili
- Compiti con contesto lungo
- Flussi di lavoro intensivi di strumenti
- Casi di fallimento noti
- Istanze di produzione
Passo 2: Utilizzare l'attuale sforzo di ragionamento come base
OpenAI consiglia di iniziare con lo stesso sforzo di ragionamento utilizzato per il modello precedente.
Quindi, testare scendendo di un livello.
GPT-5.6 potrebbe mantenere la qualità utilizzando meno token di ragionamento, ma questo va verificato sul tuo carico di lavoro.
Passo 3: Confrontare Sol, Terra e Luna
Non dare per scontato che il modello di punta sia automaticamente la scelta migliore per la produzione.
Valuta se Terra o Luna possono soddisfare gli stessi criteri di accettazione a un costo inferiore.
Passo 4: Testare la cache dei suggerimenti
Monitora le letture e le scritture nella cache.
Quando il tasso di riutilizzo è alto, un contesto stabile può diventare significativamente più economico, ma prefissi di suggerimento che cambiano frequentemente potrebbero non trarne grandi benefici.
Passo 5: Testare le chiamate a strumenti programmatiche dove appropriato
Applicarle a fasi di elaborazione dai confini ben definiti, come:
- Filtraggio
- Aggregazione
- Ordinamento
- Join
- Deduplicazione
Confrontare i risultati con le chiamate a strumenti dirette e normali.
Passo 6: Misurare l'economia del completamento del compito
Una fattura più bassa per i token ha senso solo se il compito finale raggiunge comunque gli standard di qualità.
L'obiettivo di ottimizzazione corretto non è il minor numero di token.
Ma ottenere un risultato positivo al costo affidabile più basso.
Perché GPT-5.6 riflette un più ampio spostamento verso l'efficienza
Per anni, la competizione tra i modelli all'avanguardia è stata dominata da una domanda: quale modello è più capace?
Questa domanda è ancora importante.
Ma con l'ingresso dell'IA nella produzione su larga scala, un'altra domanda è altrettanto importante:
Quanto lavoro utile il sistema può completare per unità di calcolo e per dollaro speso?
I sistemi agenziali amplificano questa pressione.
Una singola richiesta utente può innescare:
- Più cicli di ragionamento
- Ricerche
- Esecuzione di codice
- API esterne
- Sotto-agenti
- Finestre di contesto ampie
- Validazioni ripetute
Senza un'accurata orchestrazione, la fattura totale può crescere rapidamente.
GPT-5.6 riflette un passaggio più ampio dalla semplice capacità di intelligenza alla rendere l'implementazione dell'intelligenza più economica.
Sol spinge le capacità di intelligenza verso l'alto.
Terra riduce il costo del lavoro generico potente.
Luna porta la famiglia di modelli verso carichi di lavoro ad alto rendimento.
La cache dei suggerimenti e l'orchestrazione programmatica degli strumenti mirano al sovraccarico del sistema attorno ai modelli stessi.
Il risultato è una famiglia di modelli progettata non solo attorno ai punteggi dei benchmark, ma anche all'economia della produzione.
Domande frequenti
Cos'è GPT-5.6?
GPT-5.6 è la famiglia di modelli di OpenAI per ragionamento complesso, programmazione, lavoro specialistico, flussi di lavoro agenziali e applicazioni IA ad alto rendimento. La serie attualmente include Sol, Terra e Luna.
Qual è la differenza tra GPT-5.6 Sol, Terra e Luna?
Sol è il livello di punta con la massima capacità. Terra bilancia intelligenza e costo, mentre Luna è ottimizzato per carichi di lavoro a basso costo e alto rendimento.
Quanto costa utilizzare GPT-5.6 tramite API?
OpenAI ha fissato il prezzo di Sol a 5 dollari per milione di token di input e 30 dollari per token di output, Terra a 2,50/15 dollari, Luna a 1/6 dollari. I prezzi per input in cache sono più bassi, e prompt molto lunghi potrebbero avere regole di prezzo diverse.
Qual è la finestra di contesto di GPT-5.6?
La pagina corrente dei modelli API di OpenAI elenca una finestra di contesto di 1.050.000 token per Sol, Terra e Luna. Ogni modello supporta fino a 128.000 token di output.
GPT-5.6 Sol è migliore di GPT-5.5 nella programmazione?
OpenAI riporta che Sol ottiene punteggi più alti in diverse valutazioni di agenti di programmazione, tra cui l'Artificial Analysis Programming Agent Index, SWE-Bench Pro, DeepSWE e Terminal-Bench 2.1. Le prestazioni effettive in produzione dipendono ancora dal repository, dal framework agenziale, dai prompt e dagli strumenti.
Cosa sono le chiamate a strumenti programmatiche?
Le chiamate a strumenti programmatiche consentono a GPT-5.6 di scrivere codice per orchestrare strumenti idonei e gestire risultati intermedi in un runtime ospitato. Possono ridurre i cicli del modello e l'uso di token in flussi di lavoro dai confini ben definiti.
Come operazioni di filtraggio, join, ordinamento e aggregazione.
GPT-5.6 supporta la cache dei suggerimenti?
Sì. GPT-5.6 supporta la memorizzazione nella cache automatica e i punti di interruzione espliciti della cache. OpenAI afferma che le letture dalla cache usufruiscono di uno sconto del 90% sull'input, mentre le nuove scritture nella cache costano 1,25 volte il prezzo dell'input non memorizzato nella cache.
Dovrei usare Sol per ogni richiesta?
Generalmente no. Se Terra o Luna possono soddisfare gli stessi criteri di valutazione a un costo inferiore, l'utilizzo del livello di modello più piccolo migliora l'economia dell'applicazione. I compiti complessi dovrebbero essere instradati a Sol solo quando una maggiore capacità porta benefici misurabili.
Strumenti correlati
- OpenAI API: Piattaforma ufficiale per sviluppatori per accedere ai modelli GPT-5.6 e agli strumenti OpenAI.
- Guida ai modelli GPT-5.6: Guida di OpenAI alla migrazione e all'ottimizzazione per la serie GPT-5.6.
- GPT-5.6 Sol: Specifiche ufficiali del modello, prezzi, limiti di contesto e funzionalità supportate da Sol.
- GPT-5.6 Terra: Pagina ufficiale del modello per il livello bilanciato GPT-5.6.
- GPT-5.6 Luna: Pagina ufficiale del modello per il livello a costo più basso di GPT-5.6.
- OpenAI Codex: Ambiente di programmazione intelligente di OpenAI per flussi di lavoro di sviluppo software.
Collegamenti correlati
- Annuncio di OpenAI GPT-5.6: Annuncio ufficiale di lancio di OpenAI, con tabelle di benchmark, dettagli sulla sicurezza, prezzi e disponibilità del prodotto.
- Anteprima di GPT-5.6 Sol: Annuncio di anteprima di OpenAI su Sol, Terra e Luna.
- Modelli API OpenAI: Modelli attuali dell'API OpenAI.
Catalogo ufficiale dei modelli e loro specifiche principali.
- Guida al modello GPT-5.6: Istruzioni ufficiali su consumo di ragionamento, cache dei prompt, ragionamento continuo e chiamate a strumenti di programmazione.
- Pagina API GPT-5.6 Sol: Prezzi correnti di Sol, finestra di contesto, data di scadenza delle conoscenze e funzionalità API supportate.
- Pagina API GPT-5.6 Terra: Prezzi e specifiche attuali del modello Terra.
- Pagina API GPT-5.6 Luna: Prezzi e specifiche attuali del modello Luna.
Riepilogo
GPT-5.6 è una famiglia di modelli composta da tre livelli, non un singolo modello universale. Sol è pensato per capacità di punta, Terra offre un equilibrio più conveniente per il lavoro di produzione standard, mentre Luna è ottimizzato per scenari ad alto volume.
Il tema principale è l'efficienza. OpenAI riduce il carico di lavoro del modello necessario per completare compiti complessi combinando modelli con maggiore efficienza di token, cache esplicita dei prompt, ragionamento continuo, consumo di ragionamento configurabile e chiamate a strumenti di programmazione.
Fonti di AIBase riferiscono anche ulteriori ottimizzazioni dello stack di ragionamento, tra cui decodifica speculativa e lavoro sui kernel GPU, che aumentano la velocità di generazione dei token di oltre il 15%.
Efficienza. A meno che non vengano riprodotti in pubblicazioni tecniche completamente documentate di OpenAI, questi dati di basso livello dovrebbero essere considerati come riportati dalle fonti.
Il modo migliore per comprendere GPT-5.6 non è come il rilascio di un modello più potente, ma come un tentativo di migliorare l'economia dell'intelligenza lungo l'intero flusso di lavoro degli agenti.