OpenAI GPT-5.6 Sol, Terra e Luna: prestazioni, prezzi ed efficienza in dettaglio

La serie GPT-5.6 di OpenAI include tre livelli di modelli: Sol, Terra e Luna. Invece di offrire un unico modello per tutti i carichi di lavoro, OpenAI suddivide la serie in base a capacità, costi e throughput: - GPT-5.6 Sol è il modello di punta, adatto per lavori professionali complessi, programmazione, ricerca, cybersecurity e attività a lungo termine. - GPT-5.6 Terra è pensato per carichi di lavoro che richiedono ancora un'intelligenza elevata ma con vincoli di costo più stringenti. - GPT-5.6 Luna è il membro più veloce ed economico della serie.

发布于 2026年7月30日generalGEO 评分: 01 次阅读
L'immagine è un visual promozionale per i contenuti di OpenAI GPT-5.6, con uno sfondo nero intenso. Al centro spicca il testo sfumato (dal blu chiaro al viola chiaro) 'GPT-5.6', sotto il quale è scritto in bianco 'Sol vs Terra vs Luna'. Nella parte inferiore sono disposti tre pianeti con anelli, rispettivamente di colore oro, blu e viola, corrispondenti ai tre modelli della serie GPT-5.6 menzionati nel documento. Lo stile complessivo è pulito, senza elementi complessi superflui, coerente con il design della copertina richiesto per il documento, utilizzato per rappresentare visivamente il tema centrale del contenuto.

OpenAI GPT-5.6 Sol, Terra e Luna: prestazioni, prezzi ed efficienza in dettaglio

Introduzione

La serie GPT-5.6 di OpenAI comprende tre livelli di modelli: Sol, Terra e Luna.

Invece di offrire un unico modello per tutti i carichi di lavoro, OpenAI differenzia la serie in base a capacità, costo e produttività:

  • GPT-5.6 Sol è il modello di punta, progettato per lavori complessi e specialistici, programmazione, ricerca, cybersecurity e attività agente di lunga durata.
  • GPT-5.6 Terra è pensato per carichi di lavoro che richiedono comunque un'intelligenza potente, ma con vincoli di costo più stringenti.
  • GPT-5.6 Luna è il membro più veloce ed economico della serie, adatto a carichi di lavoro sensibili ai costi e ad alta produttività.

OpenAI ha presentato per la prima volta la serie a giugno 2026, con il lancio completo avvenuto il 9 luglio. L'articolo originale di AIBase è stato pubblicato il 30 luglio, evidenziando i miglioramenti di efficienza alla base del lancio: migliori prestazioni per token, livelli di modello a costo inferiore e ottimizzazioni dell'infrastruttura e dei cicli agente progettate per ridurre il costo totale per completare il lavoro utile.

Questo focus è cruciale. Per i sistemi AI di livello produttivo, la metrica rilevante è sempre meno quanto un modello appare intelligente in isolamento, ma quanto lavoro utile può completare in un dato tempo, con determinate risorse computazionali e budget.

Tre Modelli GPT-5.6 per Diversi Carichi di Lavoro

OpenAI descrive Sol, Terra e Luna come livelli di capacità persistenti, non suffissi temporanei.

Il numero generazionale identifica la serie GPT-5.6, mentre i nomi distinguono i livelli di prestazioni e costo previsti.

Modello Posizionamento Prezzo Input API Prezzo Output API Finestra di Contesto Output Massimo
GPT-5.6 Sol Modello di punta per lavori complessi e specialistici $5 per milione di token $30 per milione di token 1.050.000 token 128.000 token
GPT-5.6 Terra Equilibrio tra intelligenza e costo $2,50 per milione di token $15 per milione di token 1.050.000 token 128.000 token
GPT-5.6 Luna Carichi di lavoro ad alta produttività e sensibili ai costi $1 per milione di token $6 per milione di token 1.050.000 token 128.000 token

Tutte e tre le pagine dei modelli elencano una data di cut-off della conoscenza al 16 febbraio 2026 e supportano input di testo e immagini nonché output di testo.

L'alias API gpt-5.6 instrada a GPT-5.6 Sol.

GPT-5.6 Sol: Il Modello di Punta

Sol è il livello GPT-5.6 più capace di OpenAI.

OpenAI lo posiziona per:

  • Programmazione complessa
  • Flussi di lavoro agente di lunga durata
  • Lavoro conoscitivo specialistico
  • Ricerca scientifica
  • Cybersecurity
  • Utilizzo del computer
  • Analisi multimodale
  • Attività di ragionamento ad alto valore

Sull'Artificial Analysis Coding Agent Index v1.1, OpenAI riporta che GPT-5.6 Sol ottiene un punteggio di 80 in modalità di ragionamento massimo, rispetto al punteggio di 77,2 di Claude Fable 5 nella stessa tabella.

OpenAI afferma inoltre che in questo confronto, Sol ha utilizzato meno della metà dei token di output e meno della metà del tempo, con un costo stimato per attività inferiore.

Ciò non significa che Sol sia universalmente superiore in ogni benchmark. Le stesse tabelle di lancio di OpenAI mostrano che i modelli concorrenti sono in vantaggio in alcune valutazioni. Il punto di forza più coerente di GPT-5.6 sono le prestazioni per token e per dollaro, non il primato assoluto in ogni categoria di attività.

GPT-5.6 Terra: Il Livello Bilanciato

Terra è il modello intermedio della serie.

OpenAI ne descrive le capacità come paragonabili a quelle di GPT-5.5, con una tariffazione di:

  • $2,50 per milione di token di input
  • $15 per milione di token di output

Si tratta della metà del prezzo di $5 / $30 corrispondente al precedente livello di punta.

Pertanto, Terra è adatto per team che necessitano di solide capacità di ragionamento e agente, ma per carichi di lavoro che non richiedono di attivare Sol per ogni richiesta.

Esempi tipici includono:

  • Agenti aziendali interni
  • Sottoagenti di codifica
  • Analisi documentale
  • Flussi di ricerca
  • Automazione ad alta intensità di strumenti
  • Attività specialistiche ad alto volume

Il modello supporta la stessa finestra di contesto di 1,05 milioni di token e un output massimo di 128.000 token di Sol.

GPT-5.6 Luna: Il Livello GPT-5.6 a Costo Inferiore

Luna è progettato per carichi di lavoro in cui la produttività e il costo sono fondamentali.

I prezzi API sono:

  • $1 per milione di token di input
  • $6 per milione di token di output

Ciò rende la tariffazione sia di input che di output l'80% inferiore rispetto a Sol.

OpenAI descrive Luna come il modello GPT-5.6 più veloce e più conveniente. È adatto per carichi di lavoro quali:

  • Classificazione
  • Estrazione
  • Instradamento
  • Elaborazione ad alto volume
  • Agenti leggeri
  • Attività strutturate ripetitive
  • Applicazioni che possono trasferire i casi difficili a Terra o Sol

Il prezzo più basso non significa che Luna sia solo un modello utilitario senza ragionamento. Supporta comunque le funzionalità di ragionamento GPT-5.6 e l'ecosistema di strumenti di OpenAI, ma con un tetto di capacità inferiore rispetto a Sol.

Immagine che mostra l'efficienza di GPT-5.6 a ogni livello. Divisa in tre parti: 1. Agent harness locale, 2. Orchestrazione API CPU, 3. Inferenza modello GPU. L'agent harness è responsabile della costruzione delle richieste e dell'esecuzione dei cicli, includendo Context + cache, Lazy tools + code mode, ecc. L'orchestrazione API converte le richieste in lavoro eseguibile, coinvolgendo Render → Tokenize → Route, Stateful connection + model routing, ecc. L'inferenza modello esegue il modello sulla GPU, includendo KV cache + memory, memory management, ecc. L'immagine evidenzia anche direzioni di miglioramento del modello, come Reasoning + Generation, Tool Orchestration, Adaptive Compute, ecc., nonché risultati composti, come Less network data, Less CPU work, More output from the same GPUs, ecc.

L'Efficienza è il Tema Centrale di GPT-5.6

L'articolo di AIBase sottolinea che GPT-5.6 non è solo un aggiornamento della qualità del modello.

L'obiettivo ingegneristico più ampio è aumentare la quantità di lavoro utile prodotto per token e ridurre il sovraccarico dell'esecuzione agente.

I materiali di lancio ufficiali di OpenAI supportano questa direzione più ampia.

L'azienda afferma che GPT-5.6 è stato addestrato per completare lavoro utile con meno token di output e la sua guida per sviluppatori suggerisce, quando si migra da GPT-5.5 o GPT-5.4, di testare il medesimo livello di sforzo di ragionamento—spesso riducendo di un livello.

Questo è importante perché il prezzo pubblicizzato per token è solo una parte del costo agente.

Un flusso di lavoro multi-step può consumare risorse attraverso:

  • Prompt lunghi
  • Contesto ripetuto
  • Token di ragionamento
  • Definizioni di strumenti
  • Output di strumenti
  • Cicli di riprova
  • Turni multipli del modello
  • Sottoagenti
  • Risposte finali lunghe

Pertanto, un modello che richiede meno passaggi, anche se la sua tariffa nominale per token sembra simile, può essere più economico nell'uso reale.

Le Prestazioni di Codifica di Sol Migliorano il Rapporto Prestazioni per Dollaro

L'articolo originale mette in evidenza le prestazioni dell'agente di codifica Sol.

Tabella comparativa attuale di OpenAI

Rapporto:

Valutazione di codifica GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5
Indice di intelligenza di codifica AI v1.1 80 77,4 74,6 76,4
SWE-Bench Pro 64,6% 63,4% 62,7% 59,4%
DeepSWE v1.1 72,7% 69,6% 67,2% 67,0%
Terminal-Bench 2.1 88,8% 87,4% 84,7% 85,6%

Questi dati provengono dalle tabelle di avvio pubblicate da OpenAI e devono essere letti nel contesto di specifici framework di valutazione e impostazioni.

Ad esempio, i risultati dei benchmark possono variare in base a:

  • Profondità di ragionamento
  • Framework dell'agente
  • Disponibilità di strumenti
  • Limiti di tempo
  • Numero di seed di valutazione
  • Snapshot del modello
  • Formato del prompt

OpenAI sottolinea inoltre che alcuni dei suoi confronti di costi e latenza si basano su stime offline del comportamento produttivo e non su fatture dirette di ciascun servizio concorrente.

La lezione pratica è che i modelli dovrebbero essere testati su carichi di lavoro rappresentativi, non scelti solo in base alle classifiche.

Lo stack di inferenza viene ottimizzato, non solo il modello

La fonte AIBase descrive l'ottimizzazione dell'intero stack di servizi, tra cui:

  • Bilanciamento del carico
  • Decodifica speculativa
  • Ottimizzazione della cache
  • Kernel GPU ottimizzati

Riporta anche che il lavoro di inferenza ha migliorato l'efficienza di generazione dei token di oltre il 15%.

Questi dettagli sui servizi di base sono presentati nel report AIBase. L'attuale pagina di lancio pubblica di GPT-5.6 di OpenAI conferma gli sforzi più ampi per migliorare il servizio e l'efficienza della ricerca, ma i dati sottostanti esatti dovrebbero essere considerati come riportati dalla fonte, a meno che non vengano riprodotti in pubblicazioni tecniche di OpenAI o in benchmark con metodologia completa documentata.

Ciò che può essere confermato indipendentemente dalla documentazione OpenAI è che GPT-5.6 aggiunge vari meccanismi volti a ridurre il lavoro non necessario del modello.

Questi includono:

  • Generazione di token più efficiente
  • Caching esplicito dei prompt
  • Ragionamento persistente
  • Chiamate di strumenti programmatiche
  • Esecuzione multi-agente per carichi di lavoro appropriati
  • Profondità di ragionamento configurabile

La direzione ingegneristica è coerente: ridurre il lavoro ridondante attorno a ogni attività completata con successo.

Il caching dei prompt diventa più esplicito

GPT-5.6 introduce un caching dei prompt più prevedibile.

La documentazione OpenAI supporta punti di interruzione di cache espliciti, consentendo agli sviluppatori di decidere quali prefissi di prompt riutilizzabili devono essere memorizzati nella cache.

Per i modelli GPT-5.6:

  • La scrittura nella cache viene fatturata a 1,25 volte la tariffa normale di input non memorizzato nella cache.
  • La lettura dalla cache può ottenere uno sconto del 90% sull'input memorizzato nella cache.
  • La documentazione OpenAI indica una durata di vita minima della cache di 30 minuti per il nuovo comportamento di caching.

Questo cambia il modo in cui gli sviluppatori pensano agli agenti a lungo termine.

Se prompt di sistema di grandi dimensioni, cataloghi di strumenti, sezioni di policy o contesti di progetto stabili vengono inviati ripetutamente come input non memorizzati nella cache, i costi possono essere elevati.

Quando i prefissi riutilizzabili rimangono stabili, la cache può ridurre tali costi.

Allo stesso tempo, scritture nella cache non necessarie possono aumentare i costi. Pertanto, OpenAI consiglia di monitorare sia l'utilizzo dei token memorizzati nella cache che l'utilizzo dei token di scrittura nella cache, piuttosto che presumere che la cache sia sempre più economica.

L'orchestrazione degli strumenti può ridurre le chiamate di andata e ritorno del modello

La seconda area principale di efficienza è il framework dell'agente.

Il ciclo tradizionale degli strumenti segue solitamente questo schema:

  1. Il modello decide di effettuare una chiamata

  2. L'applicazione esegue lo strumento.

  3. Il risultato completo dello strumento viene restituito al modello.

  4. Il modello legge il risultato e decide il passo successivo.

  5. Viene chiamato un altro strumento.

  6. Il ciclo si ripete.

L'immagine mostra il flusso del ciclo tradizionale degli strumenti. L'attività dell'utente avvia il ciclo, il modello decide l'azione successiva, lo strumento viene eseguito, il risultato dello strumento viene restituito e il ciclo si ripete. Il ciclo contiene più chiamate di strumenti e dopo ogni chiamata vengono restituite nuove osservazioni. Questa figura è strettamente correlata al contesto, che menziona che il ciclo tradizionale degli strumenti può essere costoso, con output intermedi di grandi dimensioni che possono entrare ripetutamente nel contesto del modello, mentre le chiamate di strumenti programmatiche di GPT-5.6 offrono un'alternativa che può ridurre i round del modello, la crescita del prompt, i token intermedi, ecc., adatta per casi in cui il codice può gestire più risultati prevedibili di strumenti.

Sebbene flessibile, questo approccio può diventare costoso.

Output intermedi di grandi dimensioni possono entrare ripetutamente nel contesto del modello, anche se è necessaria solo una piccola parte dei dati.

Le chiamate di strumenti programmatiche di GPT-5.6 offrono un'alternativa.

La documentazione OpenAI mostra che GPT-5.6 può scrivere JavaScript in un ambiente di esecuzione gestito per:

  • Chiamare gli strumenti che soddisfano le condizioni
  • Passare i risultati tra le chiamate
  • Filtrare i dati intermedi
  • Unire i record
  • Ordinare i risultati
  • Deduplicare i dati
  • Convalidare i dati
  • Restituire al modello risultati strutturati più piccoli

Per i flussi di lavoro vincolati, questo può ridurre:

  • I round del modello
  • La crescita del prompt
  • I token intermedi
  • Il numero di viaggi di andata e ritorno di rete

OpenAI afferma che questo schema è particolarmente utile quando il codice può gestire più risultati prevedibili di strumenti senza dover ripetere il giudizio semantico dopo ogni chiamata.

Non è adatto per tutte le attività degli agenti.

L'interazione diretta modello-strumento rimane la scelta migliore quando:

  • Una singola chiamata di strumento è sufficiente
  • Ogni risultato può portare a un cambiamento sostanziale nel ragionamento successivo
  • È necessaria l'approvazione umana
  • I risultati intermedi sono già piccoli
  • La risposta finale deve mantenere riferimenti o artefatti nativi

L'obiettivo non è ridurre il numero di chiamate a tutti i costi, ma evitare di trasmettere informazioni non necessarie attraverso il modello.

La cronologia della conversazione e il ragionamento possono essere gestiti in modo più granulare

L'articolo di AIBase sottolinea anche che una gestione più rigorosa della cronologia della conversazione è un metodo per migliorare il tasso di riutilizzo della cache.

Le attuali linee guida per lo sviluppo di GPT-5.6 di OpenAI forniscono un meccanismo ufficiale correlato: ragionamento persistente.

Gli sviluppatori possono configurare come mantenere disponibile il ragionamento dei turni precedenti.

Questo è importante per i flussi di lavoro a lungo termine, poiché non tutte le idee precedenti sono ugualmente utili per sempre.

Se l'attività rimane stabile, il ragionamento precedente può migliorare la continuità.

Se l'obiettivo cambia, mantenere tutto il ragionamento precedente aumenta i costi e introduce presupposti obsoleti.

Pertanto, OpenAI consente alle applicazioni di controllare il contesto di ragionamento e suggerisce di conservare correttamente gli elementi di risposta necessari quando si gestisce manualmente la cronologia.

Questo offre agli sviluppatori un'altra leva per bilanciare:

  • Continuità
  • Efficienza della cache
  • Dimensione del contesto
  • Costo
  • Qualità

Prompt semplificati possono anche ridurre i costi dell'agente

Le linee guida per lo sviluppo di GPT-5.6 di OpenAI raccomandano in particolare prompt semplificati.

In un campione di valutazioni interne di agenti di codifica, OpenAI riporta che la semplificazione dei prompt e delle descrizioni degli strumenti:

  • Ha migliorato i punteggi di valutazione di circa il 10-15%
  • Ha ridotto il numero totale di token del 41-66%
  • Ha ridotto i costi del 33-67%

OpenAI afferma esplicitamente che questi numeri sono solo a scopo di riferimento e che i risultati variano in base al carico di lavoro.

Il suggerimento non è quello di rimuovere vincoli utili.

Il suo scopo è eliminare contenuti duplicati.

Un flusso di migrazione pratico è il seguente:

  1. Partire da un prompt e un set di strumenti che funzionano già correttamente.
  2. Rimuovere un insieme di istruzioni duplicate alla volta.
  3. Rieseguire la stessa attività di valutazione.
  4. Conservare i vincoli che migliorano la qualità misurabile.
  5. Eliminare le istruzioni che aumentano i token senza migliorare i risultati.

Questo è particolarmente importante per i prodotti basati su agenti, poiché lo stesso prompt di sistema e le stesse descrizioni degli strumenti possono essere inviati migliaia di volte al giorno.

La scelta del modello dovrebbe corrispondere al carico di lavoro

La serie GPT-5.6 offre agli sviluppatori tre opzioni principali di rapporto costo-qualità.

Utilizzare Sol quando la qualità è il vincolo principale

Scegliere Sol quando l'attività beneficia sostanzialmente di capacità all'avanguardia.

Casi d'uso appropriati includono:

  • Ingegneria del software di elevata difficoltà
  • Ricerca complessa
  • Pianificazione a lungo termine
  • Lavoro di cybersecurity
  • Analisi professionale ad alto valore
  • Attività in cui un leggero miglioramento della qualità giustifica il costo maggiore del modello

Utilizzare Terra per potenti carichi di lavoro produttivi generici

Quando l'attività richiede una buona capacità di ragionamento ma non necessita di Sol, Terra è la scelta pragmatica.

È adatta per:

  • Agenti aziendali quotidiani
  • Assistenza alla codifica
  • Flussi di lavoro di documenti
  • Subagenti di ricerca
  • Utilizzo di strumenti di media complessità
  • Attività professionali ad alto volume

Utilizzare Luna quando costi e volume sono predominanti

Luna è la scelta naturale per i seguenti scenari:

  • Classificazione
  • Estrazione
  • Instradamento
  • Trasformazione dei dati
  • Flussi di lavoro con strumenti leggeri
  • Automazione batch ad alto volume

Un'architettura comune prevede di instradare il lavoro ordinario verso Luna o Terra, inoltrando solo i compiti più difficili a Sol.

Il prezzo è solo l'inizio

Per i sistemi agenziali, un semplice confronto per token può essere fuorviante.

Consideriamo due modelli.

Il modello A ha un costo per token di output inferiore, ma richiede:

  • Il doppio dei token di ragionamento
  • Più chiamate a strumenti
  • Più tentativi
  • Più contesto
  • Più cicli

Il modello B ha un prezzo nominale più alto, ma completa il compito con la metà dei passaggi.

Il secondo modello potrebbe comunque risultare più economico in termini di costo per compito completato.

Pertanto, i team che valutano GPT-5.6 dovrebbero monitorare:

  • Tasso di successo dei compiti
  • Token di input totali
  • Token di output totali
  • Token nella cache
  • Scritture nella cache
  • Numero di cicli del modello
  • Numero di chiamate a strumenti
  • Latenza
  • Tasso di ripetizione
  • Tempo di correzione manuale
  • Costo totale per compito riuscito

Questo è il vero significato di "intelligenza per token".

Test di migrazione pratici

Per i team che utilizzano già GPT-5.5 o modelli precedenti, un confronto controllato è più utile di una migrazione completa immediata.

Passo 1: Costruire un set di valutazione rappresentativo

Includere:

  • Richieste semplici
  • Richieste difficili
  • Compiti con contesto lungo
  • Flussi di lavoro intensivi di strumenti
  • Casi di fallimento noti
  • Istanze di produzione

Passo 2: Utilizzare l'attuale sforzo di ragionamento come base

OpenAI consiglia di iniziare con lo stesso sforzo di ragionamento utilizzato per il modello precedente.

Quindi, testare scendendo di un livello.

GPT-5.6 potrebbe mantenere la qualità utilizzando meno token di ragionamento, ma questo va verificato sul tuo carico di lavoro.

Passo 3: Confrontare Sol, Terra e Luna

Non dare per scontato che il modello di punta sia automaticamente la scelta migliore per la produzione.

Valuta se Terra o Luna possono soddisfare gli stessi criteri di accettazione a un costo inferiore.

Passo 4: Testare la cache dei suggerimenti

Monitora le letture e le scritture nella cache.

Quando il tasso di riutilizzo è alto, un contesto stabile può diventare significativamente più economico, ma prefissi di suggerimento che cambiano frequentemente potrebbero non trarne grandi benefici.

Passo 5: Testare le chiamate a strumenti programmatiche dove appropriato

Applicarle a fasi di elaborazione dai confini ben definiti, come:

  • Filtraggio
  • Aggregazione
  • Ordinamento
  • Join
  • Deduplicazione

Confrontare i risultati con le chiamate a strumenti dirette e normali.

Passo 6: Misurare l'economia del completamento del compito

Una fattura più bassa per i token ha senso solo se il compito finale raggiunge comunque gli standard di qualità.

L'obiettivo di ottimizzazione corretto non è il minor numero di token.

Ma ottenere un risultato positivo al costo affidabile più basso.

Perché GPT-5.6 riflette un più ampio spostamento verso l'efficienza

Per anni, la competizione tra i modelli all'avanguardia è stata dominata da una domanda: quale modello è più capace?

Questa domanda è ancora importante.

Ma con l'ingresso dell'IA nella produzione su larga scala, un'altra domanda è altrettanto importante:

Quanto lavoro utile il sistema può completare per unità di calcolo e per dollaro speso?

I sistemi agenziali amplificano questa pressione.

Una singola richiesta utente può innescare:

  • Più cicli di ragionamento
  • Ricerche
  • Esecuzione di codice
  • API esterne
  • Sotto-agenti
  • Finestre di contesto ampie
  • Validazioni ripetute

Senza un'accurata orchestrazione, la fattura totale può crescere rapidamente.

GPT-5.6 riflette un passaggio più ampio dalla semplice capacità di intelligenza alla rendere l'implementazione dell'intelligenza più economica.

Sol spinge le capacità di intelligenza verso l'alto.

Terra riduce il costo del lavoro generico potente.

Luna porta la famiglia di modelli verso carichi di lavoro ad alto rendimento.

La cache dei suggerimenti e l'orchestrazione programmatica degli strumenti mirano al sovraccarico del sistema attorno ai modelli stessi.

Il risultato è una famiglia di modelli progettata non solo attorno ai punteggi dei benchmark, ma anche all'economia della produzione.

Domande frequenti

Cos'è GPT-5.6?

GPT-5.6 è la famiglia di modelli di OpenAI per ragionamento complesso, programmazione, lavoro specialistico, flussi di lavoro agenziali e applicazioni IA ad alto rendimento. La serie attualmente include Sol, Terra e Luna.

Qual è la differenza tra GPT-5.6 Sol, Terra e Luna?

Sol è il livello di punta con la massima capacità. Terra bilancia intelligenza e costo, mentre Luna è ottimizzato per carichi di lavoro a basso costo e alto rendimento.

Quanto costa utilizzare GPT-5.6 tramite API?

OpenAI ha fissato il prezzo di Sol a 5 dollari per milione di token di input e 30 dollari per token di output, Terra a 2,50/15 dollari, Luna a 1/6 dollari. I prezzi per input in cache sono più bassi, e prompt molto lunghi potrebbero avere regole di prezzo diverse.

Qual è la finestra di contesto di GPT-5.6?

La pagina corrente dei modelli API di OpenAI elenca una finestra di contesto di 1.050.000 token per Sol, Terra e Luna. Ogni modello supporta fino a 128.000 token di output.

GPT-5.6 Sol è migliore di GPT-5.5 nella programmazione?

OpenAI riporta che Sol ottiene punteggi più alti in diverse valutazioni di agenti di programmazione, tra cui l'Artificial Analysis Programming Agent Index, SWE-Bench Pro, DeepSWE e Terminal-Bench 2.1. Le prestazioni effettive in produzione dipendono ancora dal repository, dal framework agenziale, dai prompt e dagli strumenti.

Cosa sono le chiamate a strumenti programmatiche?

Le chiamate a strumenti programmatiche consentono a GPT-5.6 di scrivere codice per orchestrare strumenti idonei e gestire risultati intermedi in un runtime ospitato. Possono ridurre i cicli del modello e l'uso di token in flussi di lavoro dai confini ben definiti.

Come operazioni di filtraggio, join, ordinamento e aggregazione.

GPT-5.6 supporta la cache dei suggerimenti?

Sì. GPT-5.6 supporta la memorizzazione nella cache automatica e i punti di interruzione espliciti della cache. OpenAI afferma che le letture dalla cache usufruiscono di uno sconto del 90% sull'input, mentre le nuove scritture nella cache costano 1,25 volte il prezzo dell'input non memorizzato nella cache.

Dovrei usare Sol per ogni richiesta?

Generalmente no. Se Terra o Luna possono soddisfare gli stessi criteri di valutazione a un costo inferiore, l'utilizzo del livello di modello più piccolo migliora l'economia dell'applicazione. I compiti complessi dovrebbero essere instradati a Sol solo quando una maggiore capacità porta benefici misurabili.

Strumenti correlati

  • OpenAI API: Piattaforma ufficiale per sviluppatori per accedere ai modelli GPT-5.6 e agli strumenti OpenAI.
  • Guida ai modelli GPT-5.6: Guida di OpenAI alla migrazione e all'ottimizzazione per la serie GPT-5.6.
  • GPT-5.6 Sol: Specifiche ufficiali del modello, prezzi, limiti di contesto e funzionalità supportate da Sol.
  • GPT-5.6 Terra: Pagina ufficiale del modello per il livello bilanciato GPT-5.6.
  • GPT-5.6 Luna: Pagina ufficiale del modello per il livello a costo più basso di GPT-5.6.
  • OpenAI Codex: Ambiente di programmazione intelligente di OpenAI per flussi di lavoro di sviluppo software.

Collegamenti correlati

Catalogo ufficiale dei modelli e loro specifiche principali.

Riepilogo

GPT-5.6 è una famiglia di modelli composta da tre livelli, non un singolo modello universale. Sol è pensato per capacità di punta, Terra offre un equilibrio più conveniente per il lavoro di produzione standard, mentre Luna è ottimizzato per scenari ad alto volume.

Il tema principale è l'efficienza. OpenAI riduce il carico di lavoro del modello necessario per completare compiti complessi combinando modelli con maggiore efficienza di token, cache esplicita dei prompt, ragionamento continuo, consumo di ragionamento configurabile e chiamate a strumenti di programmazione.

Fonti di AIBase riferiscono anche ulteriori ottimizzazioni dello stack di ragionamento, tra cui decodifica speculativa e lavoro sui kernel GPU, che aumentano la velocità di generazione dei token di oltre il 15%.

Efficienza. A meno che non vengano riprodotti in pubblicazioni tecniche completamente documentate di OpenAI, questi dati di basso livello dovrebbero essere considerati come riportati dalle fonti.

Il modo migliore per comprendere GPT-5.6 non è come il rilascio di un modello più potente, ma come un tentativo di migliorare l'economia dell'intelligenza lungo l'intero flusso di lavoro degli agenti.