Anthropic rivela il Modello 2 interno: capacità complessive leggermente superiori a Claude Mythos 5
Anthropic ha silenziosamente rivelato un modello AI interno non pubblicato, chiamato Modello 2, nel suo rapporto sui rischi di agosto 2026. Questo modello non è una versione pubblica di Claude e Anthropic non ne ha annunciato...

Anthropic rivela il modello interno 2: capacità complessiva leggermente superiore a Claude Mythos 5
Introduzione
Anthropic ha rivelato silenziosamente un modello AI interno non pubblicato chiamato Model 2 nel suo rapporto sui rischi dell'agosto 2026.
Questo modello non è una versione pubblica di Claude e Anthropic non lo ha rilasciato come prodotto. Esso appare nel rapporto perché l'azienda ha incluso sistemi interni all'avanguardia e quasi all'avanguardia nella valutazione dei rischi dell'AI avanzata.
Secondo Anthropic, il Model 2 è complessivamente leggermente più capace di Claude Mythos 5.
Il miglioramento è reale, ma l'azienda ha prudentemente evitato di descriverlo come un salto generazionale significativo.
Il riepilogo di Anthropic sottolinea che su molti compiti rilevanti per l'uso interno, il Model 2 è chiaramente superiore al Mythos 5, ma è ancora molto lontano dal salto di capacità osservato dall'azienda quando è passata da Claude Opus 4.6 a Claude Mythos Preview.
Questo rende il Model 2 interessante da una prospettiva diversa.
Più che segnare l'arrivo di una nuova generazione, sembra un continuo perfezionamento delle capacità dei modelli all'avanguardia da parte di Anthropic.
Il rapporto fornisce anche un dato specifico: nella valutazione interna CoBench di Anthropic, il Model 2 ha ottenuto un punteggio del 62,8%, superando il 50,3% di Claude Mythos 5 e il 54,8% di Claude Mythos Preview.

Lo stesso rapporto menziona anche un altro sistema interno, il Model 1, suscitando speculazioni sul fatto che Anthropic stia sviluppando una serie di modelli interni prima di assegnare loro nomi di prodotto Claude pubblici.
Il rapporto ufficiale supporta solo parzialmente questa interpretazione.
Anthropic conferma che Model 1 e Model 2 sono modelli interni, ma non ha dichiarato che il Model 2 sia il successore ufficiale del Model 1, né che uno dei due diventerà una futura versione di Claude.
Il Model 2 è complessivamente leggermente più forte di Claude Mythos 5
Il punto centrale riportato da AIBase è accurato: Anthropic afferma che il Model 2 è complessivamente più forte di Claude Mythos 5.
Il rapporto sui rischi dell'agosto descrive il Model 2 come:
- Superiore al Mythos 5 in alcune aree.
- Inferiore al Mythos 5 in altre aree.
- Complessivamente leggermente più capace.
Anthropic ha anche affermato che la sua valutazione qualitativa approssimativa è che il Model 2 offre miglioramenti evidenti su molti compiti rilevanti per l'uso interno.
Questa formulazione è importante.
Il Model 2 non dovrebbe essere descritto come superiore al Mythos 5 in ogni benchmark o in ogni ambito legato ai rischi.
Il rapporto stesso mostra che i risultati variano a seconda del compito.
Ad esempio, in alcune valutazioni del rischio chimico e biologico, Anthropic afferma che i risultati limitati del Model 2 sono paragonabili o inferiori a quelli di Claude Mythos 5.
In un'altra valutazione sul comportamento ingannevole, il Model 2 è leggermente più forte del Mythos 5, ma ancora chiaramente più debole del Mythos Preview.
Pertanto, il riepilogo più equo è:
Model 2
= complessivamente leggermente più capace
≠ superiore in ogni valutazione
Il miglioramento non è un salto generazionale significativo
Il testo originale sottolinea che questo miglioramento è relativamente limitato.
Anthropic afferma che, rispetto a...
la stessa situazione.
L'azienda confronta specificamente il Model 2 con il salto precedente, ovvero il passaggio da Claude Opus 4.6 a Claude Mythos Preview.
Quell'aggiornamento ha rappresentato un aumento di capacità molto più ampio.
Non è così per il Model 2.
Anthropic afferma che questo modello interno più recente offre miglioramenti evidenti su molti compiti interni, ma non è un cambiamento dirompente della stessa portata.
Ciò si riflette anche in un altro indicatore di capacità interno.
Anthropic mantiene una versione interna dell'Epoch Capability Index chiamata AECI, che combina le prestazioni su diversi benchmark interni.
Secondo i dati limitati, il punteggio del Model 2 è di circa:
1,5 punti AECI
superiore a quello di Claude Mythos 5.
Anthropic precisa che questa stima ha un ampio margine di errore.
Aggiunge inoltre che questo incremento è inferiore al miglioramento osservato dal Mythos Preview al Mythos 5.
Ciò supporta la principale qualificazione dell'articolo: il Model 2 sembra essere un miglioramento incrementale dei modelli all'avanguardia, non un nuovo stadio di capacità chiaramente distinto.
CoBench fornisce il confronto pubblico più chiaro
La prova più concreta nel rapporto proviene da CoBench.
Anthropic descrive CoBench come una valutazione interna progettata per testare la capacità dei modelli di risolvere problemi reali di ricerca e sviluppo dell'azienda, invece di utilizzare benchmark generici come proxy.
La valutazione colloca il modello in un punto specifico nel tempo della storia dell'infrastruttura di Anthropic.
Il modello riceve un'istantanea delle risorse, tra cui:
- Codice.
- Log.
- Documentazione interna.
- Messaggi interni storici.
Successivamente, deve diagnosticare la causa principale di problemi tecnici che gli ingegneri di Anthropic hanno già risolto.
La versione corrente descritta nel rapporto di agosto include:
449 problemi
derivati principalmente da problemi risolti tra febbraio e aprile 2026.
Questi problemi provengono da dipartimenti dell'organizzazione tecnica di Anthropic coinvolti in:
- Addestramento dei modelli.
- Gestione dell'infrastruttura dei modelli.
- Debug di sistemi tecnici.
- Ingegneria della ricerca.
Ciò rende CoBench particolarmente rilevante per l'attenzione di Anthropic sull'automazione della ricerca e sviluppo AI tramite AI.
Il Model 2 ottiene il 62,8% su CoBench
I punteggi di confronto presentati nel rapporto sono i seguenti:
| Modello | Punteggio CoBench |
|---|---|
| Claude Sonnet 4.6 | 12,0% |
| Claude Opus 4.6 | 15,6% |
| Claude Opus 4.7 | 27,4% |
| Claude Mythos 5 | 50,3% |
| Claude Mythos Preview | 54,8% |
| Model 2 | 62,8% |
Pertanto, il Model 2 è in testa tra i modelli mostrati nel grafico.
Il suo vantaggio rispetto al Mythos 5 è:
62,8% - 50,3% = 12,5 punti percentuali
Su questo specifico benchmark interno, si tratta di un divario significativo.
Ma è ancora molto lontano dal punteggio che Anthropic ritiene sufficiente per sostituire completamente il proprio personale tecnico.
Anthropic stima che la sostituzione completa dei ricercatori richieda circa l'85% del punteggio
Anthropic afferma che, sulla base della revisione manuale dei compiti e dei processi di valutazione, un sistema in grado di sostituire veramente e completamente gli scienziati e gli ingegneri ricercatori di Anthropic dovrebbe ottenere un punteggio su CoBench di almeno circa:
85%
Il 62,8% del Model 2 lascia quindi ancora un divario considerevole.
Anthropic ricorda inoltre che questo benchmark non misura perfettamente l'equivalenza con gli esseri umani.
Il dataset è stato
deliberatamente filtrato per includere problemi difficili.
La maggior parte dei compiti è stata selezionata perché Mythos Preview aveva fallito almeno una volta su tre tentativi.
Anthropic afferma che senza questo filtraggio, il dataset sarebbe circa il doppio.
Ci sono anche altre limitazioni:
- Alcune conclusioni umane storiche potrebbero non essere ottimali.
- Alcune risposte potrebbero essere ambigue.
- La valutazione automatica potrebbe commettere errori.
I modelli non ottengono realmente tutti i permessi o il supporto infrastrutturale di cui potrebbe disporre un vero ingegnere Anthropic.
Pertanto, CoBench è meglio considerarlo un segnale interno utile, piuttosto che uno standard generale per valutare se un modello di IA possa sostituire i ricercatori.
Dare più token a Mythos 5 non colma completamente il divario
Anthropic ha anche testato se i risultati di CoBench riflettessero semplicemente un budget di ragionamento insufficiente.
Il budget di token utilizzato per il grafico è di circa:
300.000 token
per le configurazioni valutate.
Quando Anthropic ha aumentato il budget di Mythos 5 a:
900.000 token
il suo punteggio è migliorato solo di circa:
3 punti percentuali
Ciò indica che almeno parte del vantaggio di Model 2 non può essere spiegata semplicemente dando più token a Mythos 5.
Anthropic ritiene comunque che una migliore strutturazione (scaffolding) e framework di valutazione migliori possano migliorare i risultati, quindi questo benchmark non misura puramente i pesi del modello in sé.
L'architettura dell'agente è importante.
Model 2 è già ampiamente utilizzato internamente da Anthropic
Model 2 non è stato ancora rilasciato, ma non è solo un checkpoint di laboratorio inutilizzato.
Anthropic afferma che Model 2 e Claude Mythos 5 sono tra i modelli interni più capaci e maggiormente utilizzati.
Sono ampiamente impiegati per:
- Programmazione.
- Generazione di dati.
- Altri flussi di lavoro con agenti.
- Ricerca.
- Ingegneria.
Anthropic afferma inoltre che entrambi i modelli sono utilizzati tramite distribuzioni di agenti persistenti, non solo sessioni di chat interattive.
Questo è importante perché la sezione sui rischi del rapporto si concentra in parte su come i sistemi di IA potrebbero automatizzare porzioni sempre più ampie del lavoro di ricerca e sviluppo di Anthropic stessa.
Il rapporto afferma che Claude ora scrive la stragrande maggioranza del codice integrato nel codebase di produzione di Anthropic.
Tuttavia, Anthropic non giunge alla conclusione che i suoi modelli possano attualmente sostituire completamente i suoi ricercatori.
L'azienda ritiene che l'IA stia accelerando sostanzialmente il lavoro interno, ma la sua valutazione di agosto rimane al di sotto della soglia della Politica di Espansione Responsabile relativa a un'accelerazione significativa della ricerca e sviluppo guidata dall'IA.
Model 2 non ha ancora completato la suite completa di valutazioni pre-distribuzione di Anthropic
Il rapporto contiene anche un'altra importante avvertenza.
Model 2 ha superato il processo di revisione interna per la distribuzione di Anthropic, ma non ha ancora superato la suite completa di valutazioni che l'azienda di solito esegue prima della distribuzione esterna.
Pertanto, Anthropic afferma di avere una fiducia leggermente inferiore nella propria comprensione di Model 2 rispetto a quella che ha nei modelli rilasciati completamente valutati.
Questo è importante quando si interpretano i confronti dei benchmark.
Un singolo risultato CoBench può indicare che Model 2 ha buone prestazioni nei compiti di ricerca e sviluppo interni.
Ma non stabilisce un quadro completo delle prestazioni, che copra:
- Ragionamento generale.
- Programmazione.
- Sicurezza informatica.
- Biologia.
- Sicurezza (safety).
- Allineamento.
- Autonomia a lungo ciclo.
- Uso consumer.
- Ambienti aziendali.
Lavoro.
La conclusione attuale di Anthropic è volutamente ampia: Model 2 nel complesso sembra leggermente superiore a Mythos 5.
Anthropic attualmente non ha piani per rilasciare pubblicamente Model 2
Nel breve articolo di AIBase, il dettaglio pratico più importante è facile da trascurare.
Anthropic afferma chiaramente:
Attualmente non abbiamo piani
per rilasciare pubblicamente questo modello.
Pertanto, Model 2 non deve essere considerato un prossimo prodotto Claude con una data di rilascio implicita.
Attualmente non esiste alcuna informazione ufficiale su:
- Data di rilascio.
- Nome pubblico del modello.
- ID del modello API Claude.
- Prezzo.
- Specifiche della finestra di contesto.
- Piani di disponibilità per i consumatori.
- Piani di distribuzione aziendale.
Qualsiasi affermazione secondo cui Model 2 diventerà "Claude Mythos 6", "Claude Opus 6" o un altro prodotto con nome è pura speculazione.
Anthropic divulga questo modello perché i suoi modelli interni sono rilevanti per la valutazione del rischio aziendale.
Questo è diverso dal rilasciare un prodotto.
Claude Mythos 5 in realtà non è un modello pubblico ampiamente disponibile
Il titolo originale di AIBase afferma che Claude Mythos 5 è il modello pubblico più forte di Anthropic.
Questo punto richiede una piccola correzione.
Claude Mythos 5 non è ampiamente disponibile.
Anthropic attualmente fornisce questo modello solo a un gruppo limitato di clienti approvati tramite Project Glasswing e programmi di accesso fidato correlati.
La versione ampiamente disponibile corrispondente è Claude Fable 5.
Anthropic afferma che Fable 5 e Mythos 5 utilizzano lo stesso modello sottostante.
La differenza è che Fable 5 include misure di sicurezza più forti in aree sensibili come la sicurezza informatica e la biologia, mentre Mythos 5 è fornito a utenti verificati che necessitano di meno restrizioni per il lavoro autorizzato.
La relazione attuale del prodotto è:
Claude Mythos 5
= Accesso fidato limitato
Claude Fable 5
= Stesso modello sottostante
+ Misure di sicurezza più forti
+ Ampia disponibilità
Pertanto, per il lettore medio, l'affermazione più accurata è: Mythos 5 è il modello frontier ad accesso limitato più forte di Anthropic, mentre Fable 5 è il suo modello pubblicamente rilasciato più capace.
Model 1 è reale, ma la storia del prodotto "Model 1 → Model 2" è pura speculazione
Il rapporto menziona anche Model 1.
Questo è naturalmente sufficiente a scatenare speculazioni:
Model 1
→ Model 2
→ Future versioni di Claude?
Ma Anthropic non fa questa affermazione.
In realtà, la sua descrizione di Model 1 è piuttosto sobria.
L'azienda afferma che Model 1 è approssimativamente equivalente in capacità a:
- Claude Mythos Preview.
- Claude Mythos 5.
Ha avuto una distribuzione interna relativamente limitata.
Anthropic afferma che la stragrande maggioranza degli utenti interni preferisce Mythos 5 e che l'utilizzo di Model 1 era già basso e in calo alla data di copertura del rapporto, il 15 luglio.
L'azienda afferma inoltre:
Prevede che Model 1 in futuro
non verrà distribuito esternamente
né ampiamente utilizzato internamente
Pertanto, Model 1 sembra più un ramo di sviluppo interno o un checkpoint, piuttosto che un predecessore chiaramente definito in attesa di rilascio pubblico.
Model 2 differisce da Model 1 in un aspetto importante
L'approccio di Anthropic a Model 2 è chiaramente più cauto.
Model 1 è menzionato brevemente e poi in gran parte escluso dall'analisi dei rischi, perché Anthropic
ritiene che Mythos 5 sia un limite superiore ragionevole per il proprio rischio.
Al contrario, Model 2 è utilizzato in gran parte del rapporto, perché:
- È complessivamente più capace.
- È utilizzato più frequentemente internamente.
- È rilevante per l'analisi dei rischi frontier di Anthropic.
Il rapporto afferma che l'utilizzo interno di Model 2 è simile a quello di Mythos 5.
Questo non prova un imminente rilascio pubblico.
Ma indica che Model 2 ha una posizione operativa significativa all'interno di Anthropic.
Il rapporto sui rischi è il motivo per cui il modello è stato reso noto al pubblico
Model 2 non è stato introdotto tramite un tradizionale post di blog di rilascio.
È emerso perché la Politica di Espansione Responsabile di Anthropic richiede all'azienda di condurre analisi dei rischi sui sistemi effettivamente sviluppati e distribuiti internamente.
Il rapporto sui rischi dell'agosto 2026 copre le attività di Anthropic fino al 15 luglio 2026.
Anthropic elenca i modelli interni quando sono rilevanti per questioni come:
- Problemi di disallineamento in ambienti ad alto rischio.
- Automazione della ricerca e sviluppo IA.
- Rischi biologici e chimici.
- Sicurezza dei modelli.
- Monitoraggio interno.
Ecco perché nel rapporto
Le informazioni a cui ha accesso sono superiori a quelle che riceverebbe un normale modello non pubblicato.
Questa divulgazione è principalmente il prodotto della governance di sicurezza, e solo secondariamente una fuga di prodotto.
Cosa il rapporto ci dice e cosa non ci dice
| Affermazione | Stato |
|---|---|
| Anthropic ha un modello interno chiamato Modello 2 | Confermato |
| Il Modello 2 non è ancora stato rilasciato | Confermato |
| Il Modello 2 è complessivamente leggermente superiore a Mythos 5 | Confermato da Anthropic |
| Il Modello 2 è migliore di Mythos 5 in ogni ambito | No |
| Il Modello 2 ottiene un punteggio del 62,8% nel confronto CoBench mostrato nel rapporto | Confermato nei dati del rapporto |
| Mythos 5 ottiene un punteggio del 50,3% nello stesso confronto | Confermato nei dati del rapporto |
| Anthropic stima che il tasso di sostituzione completa del personale tecnico su CoBench sia di circa l'85% | Confermato |
| Il Modello 2 è ampiamente utilizzato internamente | Confermato |
| Il Modello 2 ha completato l'intera suite di valutazioni standard per il rilascio esterno | No |
| Anthropic ha attualmente in programma di rilasciare pubblicamente il Modello 2 | No |
| Il Modello 2 ha un nome di prodotto Claude ufficiale | No |
| Il Modello 1 è un vero modello interno | Confermato |
| Il Modello 1 è sicuramente il diretto predecessore del Modello 2 | Non ancora determinato |
| Si prevede che il Modello 1 venga rilasciato pubblicamente | No |
| Claude Mythos 5 è disponibile a tutti | No |
| Claude Fable 5 è la versione ampiamente distribuita corrispondente a Mythos 5 | Confermato |
Domande frequenti
Cos'è il Modello 2 di Anthropic?
Il Modello 2 è un modello di frontiera interno non pubblicato, divulgato nel rapporto sui rischi di Anthropic dell'agosto 2026. Anthropic ha dichiarato che è complessivamente leggermente superiore a Claude Mythos 5 ed è già ampiamente utilizzato internamente per codifica, generazione di dati, ricerca, ingegneria e altri lavori da agente.
Il Modello 2 è migliore di Claude Mythos 5?
Nel complesso, Anthropic dice di sì, ma solo leggermente. L'azienda ha anche affermato che il Modello 2 è più forte in alcuni ambiti e più debole in altri, quindi non dovrebbe essere descritto come superiore in modo completo.
Qual è il punteggio CoBench del Modello 2?
Il confronto mostrato nel rapporto indica che il Modello 2 ottiene un punteggio del 62,8%, superando il 54,8% di Mythos Preview e il 50,3% di Mythos 5. Anthropic stima che un modello con piena capacità
di sostituzione del personale tecnico richieda almeno circa l'85% nelle valutazioni attuali.
Cosa valuta CoBench?
CoBench è una valutazione interna progettata da Anthropic basata su problemi storici di ricerca e ingegneria risolti in precedenza dal proprio personale tecnico. Il modello riceve snapshot storici, inclusi codice, log, messaggi interni e documentazione, e deve diagnosticare i problemi tecnici sottostanti.
Anthropic rilascerà il Modello 2?
Anthropic ha dichiarato che attualmente non ha piani per rilasciare pubblicamente il Modello 2. L'azienda non ha ancora annunciato nome del prodotto, data di rilascio, identificatori API, prezzi o piani di accesso pubblico.
Il Modello 2 è il prossimo modello Claude Mythos?
Anthropic non lo ha affermato. Il Modello 2 è un identificativo interno utilizzato nel rapporto sui rischi; associarlo a un futuro nome di prodotto Claude è pura speculazione.
Cos'è il Modello 1 di Anthropic?
Il Modello 1 è un altro modello interno divulgato nello stesso rapporto. Anthropic ha dichiarato che è approssimativamente simile a Mythos Preview e Mythos 5, con un utilizzo interno relativamente basso e in calo, e non è previsto per la distribuzione esterna.
Claude Mythos 5 è stato rilasciato pubblicamente?
Non è generalmente disponibile. Mythos 5 è accessibile tramite programmi di accesso fidato limitato come Project Glasswing, mentre Claude Fable 5 utilizza lo stesso modello di base ma con protezioni di sicurezza più forti ed è ampiamente disponibile.
Strumenti correlati
- Claude: L'assistente AI generale di Anthropic per consumatori e professionisti.
- API Claude: La piattaforma per sviluppatori di Anthropic per i modelli Claude generalmente disponibili.
- Console Anthropic: Lo spazio di lavoro ufficiale per testare i modelli API Claude e gestire l'accesso degli sviluppatori.
- Project Glasswing: Il programma di accesso fidato di Anthropic per capacità avanzate di sicurezza informatica di livello Mythos.
- Anthropic Transparency Hub: Risorsa centrale per valutazioni di sicurezza dei modelli, schede di sistema e informazioni sui rischi.
Link correlati
- Rapporto sui rischi di Anthropic dell'agosto 2026: Fonte primaria per la divulgazione del Modello 1, Modello 2, CoBench, utilizzo interno e piani di rilascio attuali.
- Claude Fable 5 e Claude Mythos 5: Annuncio ufficiale di rilascio in cui Anthropic spiega la relazione tra i due modelli.
- Panoramica dei modelli Claude: Informazioni ufficiali aggiornate su disponibilità e API dei modelli rilasciati da Anthropic.
- Claude Mythos: Informazioni ufficiali su disponibilità di Mythos 5, protezioni di sicurezza, prezzi e Project Glasswing.
- Politica di scaling responsabile di Anthropic: Il quadro di governance alla base del processo di reporting periodico dei rischi di Anthropic.
- Anthropic Transparency Hub: Informazioni ufficiali su sicurezza e capacità dei modelli Claude attuali.
Riepilogo
Il rapporto sui rischi di Anthropic dell'agosto 2026 rivela un modello interno chiamato Modello 2, che è già
attualmente ampiamente utilizzato per ricerca, ingegneria, codifica, generazione di dati e flussi di lavoro persistenti da agente.
Il modello è più forte di Claude Mythos 5 nella valutazione interna CoBench di Anthropic, con punteggi rispettivamente del 62,8% e del 50,3%. Anthropic ha inoltre dichiarato che il Modello 2 sembra complessivamente leggermente superiore, sebbene in alcuni ambiti sia più debole di Mythos 5, e il miglioramento è di gran lunga inferiore rispetto ai precedenti balzi di capacità significativi.
Il rapporto menziona anche il Modello 1, ma le prove non sono sufficienti per considerare Modello 1 e Modello 2 come una sequenza di prodotti pubblici confermata. L'utilizzo interno del Modello 1 è in calo, mentre Anthropic ha chiaramente dichiarato che attualmente non ha piani per rilasciare pubblicamente il Modello 2.
La conclusione più chiara è che il livello di frontiera interno di Anthropic ha già leggermente superato Mythos 5, ma il Modello 2 è un sistema di ricerca interno, non il prossimo prodotto Claude di nuova generazione rilasciato.