OpenAI Astra annuncia dieci progressi matematici, Claude Fable 5 sostiene di aver completato cinque repliche in 24 ore

In un fine settimana di agosto 2026, si è verificato uno dei segnali più chiari finora che l'IA all'avanguardia sta superando i benchmark matematici per entrare nella ricerca attiva. Il 1° agosto, OpenAI ha pubblicato dieci

发布于 2026年8月5日generalGEO 评分: 06 次阅读
文章封面:OpenAI Astra 发布十项数学进展,Claude Fable 5 声称在24小时内完成五项复现

Dieci progressi matematici di OpenAI Astra e la dichiarazione di replica in 24 ore di Claude Fable 5

Introduzione

In un fine settimana di agosto 2026, si è verificato uno dei segnali più chiari finora che l'IA all'avanguardia sta superando la matematica di riferimento, entrando nel campo della ricerca attiva.

Il 1° agosto, OpenAI ha pubblicato "Dieci progressi in matematica e informatica teorica". Questi risultati sono stati generati da una versione interna di Astra, che OpenAI descrive come il suo prossimo modello principale.

Il pacchetto di risultati include:

  • Un manoscritto di 249 pagine.
  • Dieci risultati che coprono matematica e informatica teorica.
  • Una spiegazione dettagliata del processo di scoperta di 62 pagine.
  • Dieci dimostrazioni formalizzate in Lean 4.
  • Codice sorgente pubblico per ricostruzione e certificati di verifica indipendente.

Meno di 24 ore dopo, il ricercatore Anthropic Levent Alpöge ha dichiarato che il modello disponibile pubblicamente Claude Fable 5 aveva replicato cinque dei dieci risultati.

Ha confermato che questi cinque erano i problemi dal 4 all'8:

  1. Congettura di rigidità di Connes.
  2. Complessità dei circuiti aritmetici.
  3. Ripetizione parallela quantistica.
  4. Problema del vettore più vicino.
  5. Congettura del volume di Ehrhart.

Alpöge ha affermato che queste esecuzioni erano autonome, utilizzavano prompt generici, non avevano accesso a Internet e includevano precauzioni progettate per impedire che le soluzioni di OpenAI trapelassero nel contesto.

Se queste cinque dimostrazioni supereranno una revisione pubblica completa, l'evento indicherà che la ricerca prodotta da un modello all'avanguardia può talvolta essere riscoperta in modo indipendente da un altro modello quasi immediatamente.

Tuttavia, le prove non sono simmetriche. OpenAI ha pubblicato manoscritti, spiegazioni dei processi e certificati verificabili meccanicamente. Le dichiarazioni di Fable, invece, sono attualmente supportate principalmente da dichiarazioni pubbliche, non da pacchetti di dimostrazioni completi.

Pertanto, la conclusione utile non è semplicemente che un modello ha vinto.

L'IA è ora in grado di generare matematica di livello di ricerca abbastanza rapidamente che la verifica, l'interpretazione, l'attribuzione e la revisione potrebbero essere più difficili da scalare rispetto alla produzione stessa delle dimostrazioni.

Immagine di un tweet di Sebastien Bubeck del 1° agosto 2026 sui progressi matematici del modello OpenAI Astra. Bubeck afferma che Astra ha dimostrato l'esistenza di gruppi non sofici tra molti altri nuovi risultati, e ha pubblicato 10 dimostrazioni Astra di questo tipo, ciascuna con certificato Lean e ragionamento CoT. Questi risultati spaziano dall'algebra degli operatori di von Neumann (negando la congettura di rigidità di Connes) a migliori limiti superiori per l'impacchettamento di sfere in alta dimensione. Sotto l'immagine è scritto "Dieci progressi in matematica e informatica teorica", in sintonia con il contenuto del documento che presenta i progressi matematici del modello Astra.

OpenAI pubblica dieci risultati di livello di ricerca

OpenAI descrive questi lavori come dieci risultati che risolvono o compiono progressi significativi su problemi aperti di lunga data.

Gli argomenti spaziano dalla geometria ad alta dimensione, teoria dei codici, teoria dei gruppi, algebre di operatori, complessità dei circuiti aritmetici, complessità quantistica, problemi reticolari, geometria convessa, teoria di Ramsey e teoria degli estremi dei grafi.

OpenAI afferma che questi argomenti matematici sono stati generati dal modello Astra interno. Successivamente, gli esseri umani hanno utilizzato lo stesso modello per assistere nell'organizzazione di questi argomenti in manoscritti, dopodiché il modello ha formalizzato ogni risultato in Lean.

Il flusso di lavoro più accurato è:

Astra cerca argomenti matematici
→ Seleziona argomenti di successo
→ Umani e modello preparano manoscritti leggibili
→ Il modello formalizza

Risultato in Lean
→ Certificati formali e codice sorgente pubblicati
→ Matematici esterni verificano correttezza, novità e importanza

Il contributo del modello è centrale, ma il risultato finale di ricerca include ancora preparazione umana, infrastruttura formale, librerie software e revisione di esperti.

I dieci risultati

Questa immagine presenta il contenuto centrale dei dieci progressi matematici pubblicati da OpenAI Astra, ciascuno corrispondente a un dominio matematico specifico e a un risultato concreto. Il contenuto copre dieci direzioni: impacchettamento di sfere ad alta dimensione, codici binari e sferici, gruppi non sofici, congettura di rigidità di Connes, complessità dei circuiti aritmetici, ripetizione parallela quantistica, problema del vettore più vicino, congettura del volume di Ehrhart, numeri di Ramsey multicolore, e compattezza e teoria degli estremi dei grafi degenerati. Ogni dominio è etichettato con conclusioni rivoluzionarie specifiche, come la costruzione di controesempi che risolvono congetture aperte di lunga data, risultati di durezza con approssimazione polinomiale, dimostrazione di limiti inferiori esponenziali, ecc. Questi risultati corrispondono esattamente ai dieci progressi matematici di OpenAI Astra menzionati nel documento, mostrando chiaramente le scoperte chiave dell'istituzione nel campo della matematica.

N. Dominio Risultato pubblicato da OpenAI
1 Impacchettamento di sfere ad alta dimensione Determinata la forza asintotica della programmazione lineare di Cohn–Elkies e migliorato il limite universale di impacchettamento in alta dimensione
2 Codici binari e sferici Migliorati i limiti classici dei codici a distanza fissa con un fattore esponenziale
3 Gruppi non sofici Costruito un gruppo non sofico esplicito, risolvendo la questione se ogni gruppo numerabile ammetta un'approssimazione di permutazione finita
4 Congettura di rigidità di Connes Costruiti gruppi con proprietà (T) aventi la stessa algebra di von Neumann del gruppo ma non isomorfi, negando così la congettura
5 Complessità dei circuiti aritmetici Stabiliti nuovi limiti inferiori per il calcolo del permanente, inclusi limiti inferiori per formule aritmetiche di ordine (n^4/\log n)
6 Ripetizione parallela quantistica Dimostrata la proprietà di ripetizione parallela esponenziale per giochi di intreccio a due giocatori finiti generali
7 Problema del vettore più vicino Fornita durezza di approssimazione con fattore polinomiale per il CVP euclideo e problemi reticolari correlati
8 Congettura del volume di Ehrhart Dimostrato il limite di volume massimo ottimale per una classe specificata di corpi convessi in ogni dimensione
9 Numeri di Ramsey multicolore Dimostrato il limite inferiore superesponenziale per i numeri di Ramsey triangolari multicolore, risolvendo il problema 183 di Erdős
10 Teoria degli estremi dei grafi Costruiti esempi che negano le congetture di compattezza e degenerazione associate ai problemi 146 e 180 di Erdős

Questi non sono problemi olimpici di routine. Diversi riguardano problemi rimasti aperti per anni e richiedono profonda competenza per essere valutati.

L'articolo è solo una parte della pubblicazione

OpenAI ha anche pubblicato un documento di 62 pagine intitolato "Come si sono formate le idee: note sulla scoperta matematica".

Le dimostrazioni rispondono a:

Perché questo teorema è vero?

Il resoconto della scoperta cerca di rispondere:

Come ha fatto il sistema a trovare questo argomento?

Queste sono due domande diverse.

L'analisi passo-passo può aiutare i ricercatori a determinare se il modello ha ricombinato idee note, riconosciuto un'analogia, effettuato una ricerca estesa, trovato una nuova costruzione o utilizzato teoremi noti in modi inaspettati.

Questi contenuti richiedono ancora cautela. Le narrazioni generate dal modello non sono necessariamente una registrazione causale perfetta di ogni calcolo interno.

OpenAI ha pubblicato dieci certificati Lean

Il repository ufficiale openai/ten-proofs contiene un modulo Lean per ciascun risultato.

Il progetto utilizza:

Lean 4.32.0
mathlib
Lake

Dopo l'installazione di elan, il README ufficiale istruisce gli utenti a costruire tutte le dieci dimostrazioni formalizzate con il comando:

lake exe cache get
lake build All

È anche possibile costruire un singolo modulo:

lake build SpherePacking

Il repository contiene:

SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.lean

lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean

Il codice è rilasciato sotto licenza Apache 2.0 e include risorse di verifica indipendenti.

Cosa dimostra un certificato Lean

Lean è un dimostratore interattivo di teoremi basato sulla teoria dei tipi dipendenti.

Una dimostrazione verificata dal kernel di Lean stabilisce che un teorema formalizzato deriva da definizioni, assunzioni, assiomi e librerie importate, nonché dal termine di dimostrazione formalizzato.

Ciò esclude molti errori che possono verificarsi in argomenti informali:

  • Passaggi logici mancanti.
  • Trasformazioni algebriche non valide.
  • Contraddizioni nascoste.
  • Casi infondati.
  • Disallineamenti di quantificatori.
  • Lemmi intermedi errati.

Il certificato può essere controllato meccanicamente, anziché essere accettato perché l'autore sembra convincente.

Cosa un certificato Lean non può dimostrare

La verifica formale non elimina tutti i problemi di revisione.

La dichiarazione formale corrisponde all'affermazione informale?

Il dimostratore di teoremi controlla la dichiarazione codificata. Gli esseri umani devono ancora giudicare se essa cattura accuratamente il problema matematico.

Le definizioni e le assunzioni sono appropriate?

Lean verifica le conseguenze delle definizioni formalizzate. Non può decidere se queste riflettano concetti accettati o se esistano assunzioni nascoste che indeboliscono il risultato principale.

Il risultato è nuovo?

La correttezza formale non equivale alla novità. Una revisione della letteratura e conoscenze esperte restano necessarie.

Il risultato è importante?

La macchina può verificare che il teorema sia valido. Ma non può giudicare se il risultato cambia il campo o introduce idee di valore.

La dimostrazione ci insegna qualcosa?

Due dimostrazioni formalmente corrette possono differire notevolmente in valore esplicativo. Una può rivelare principi riutilizzabili; l'altra può essere difficile da interiorizzare per gli esseri umani.

La verifica formale affronta questioni di correttezza. La comprensione matematica rimane un compito separato.

Claude Fable 5 afferma di aver riprodotto cinque risultati in 24 ore

Meno di un giorno dopo l'annuncio di OpenAI, Alpöge ha scritto di aver "completato metà di esso con Fable".

Ha descritto la configurazione come:

  • Completamente autonoma.
  • Con prompt generici.
  • Senza accesso a Internet.
  • Con ulteriori precauzioni contro la fuga di informazioni.

Questa immagine è un tweet pubblicato dall'account utente @_alpoge su X (ex Twitter), in risposta all'annuncio di OpenAI Astra riguardante dieci progressi matematici, affermando di aver completato metà del contenuto con Claude Fable in 24 ore, spiegando che ha utilizzato una configurazione completamente autonoma, con prompt generici, nessun accesso a Internet e ulteriori precauzioni contro la fuga di informazioni. Il tweet include anche una risposta incorporata dall'account di Sebastien Bubeck, in cui Bubeck menziona che OpenAI Astra ha annunciato dieci dimostrazioni matematiche, con piani di pubblicare contenuti con certificati Lean e processi CoT, con una vasta gamma di risultati, e la risposta di @_alpoge corrisponde ai contenuti relativi alle cinque riproduzioni di Claude Fable nel documento.

Alpöge ha successivamente confermato che i cinque erano i numeri dal 4 all'8.

L'immagine è un tweet pubblicato da Levent Alpöge su Twitter.Il contenuto menziona che OpenAI Astra ha pubblicato 10 progressi matematici, mentre Claude Fable 5 afferma di averne riprodotti 5 in 24 ore. Alpöge afferma di aver riprodotto la "metà", con una configurazione completamente autonoma, prompt generici, nessun accesso a Internet e prevenzione della fuga di informazioni. In seguito ha indicato che i 5 risultati riprodotti da Fable sono il 4, 5, 6, 7 e 8, e che il risultato di Ehrhart è l'unico in cui entrambi i modelli hanno proposto argomenti quasi identici. L'immagine è strettamente correlata al contesto e costituisce una spiegazione di Alpöge sui progressi della riproduzione di Fable.

Progetto OpenAI Argomento Stato pubblico delle affermazioni di Fable
4 Congettura di rigidità di Connes Riproduzione dichiarata
5 Complessità dei circuiti aritmetici Riproduzione dichiarata
6 Ripetizione parallela quantistica Riproduzione dichiarata
7 Problema del vettore più vicino Riproduzione dichiarata
8 Congettura del volume di Ehrhart Riproduzione dichiarata

Alpöge ha affermato che il risultato di Ehrhart è l'unico in cui Astra e Fable sembrano aver usato essenzialmente lo stesso argomento.

Se accurato, gli altri quattro potrebbero essere dimostrazioni alternative, piuttosto che ricostruzioni del percorso di OpenAI.

L'evidenza di Fable non equivale ancora alla pubblicazione di OpenAI

Per i dieci risultati di OpenAI, il pacchetto pubblico include dichiarazioni dei teoremi, manoscritti completi, processi di ragionamento, codice sorgente Lean, istruzioni di build e risorse di verifica indipendenti.

Per i cinque di Fable, posso verificare le dichiarazioni di Alpöge, i numeri dei problemi menzionati, le condizioni sperimentali da lui descritte e la sua osservazione sull'argomento di Ehrhart.

Non posso verificare un pacchetto pubblico che includa:

  • Cinque manoscritti completi.
  • Il prompt generico esatto.
  • Log di esecuzione completi.
  • Utilizzo di token.
  • Configurazione del modello.
  • Metodi di prevenzione della fuga.
  • Certificati Lean.
  • Revisione esterna di ciascun argomento.

Una descrizione rigorosa è:

Un ricercatore Anthropic ha riferito pubblicamente che Fable 5 ha completato indipendentemente cinque dei dieci problemi in condizioni controllate, ma al momento della verifica, le prove dettagliate necessarie per una valutazione indipendente completa non erano ancora state rese pubbliche.

Ciò non dimostra che l'affermazione sia falsa. Significa che l'affermazione non ha ancora raggiunto lo stesso stadio probatorio del pacchetto pubblicato da OpenAI.

Perché 24 ore contano comunque

Anche con le riserve sopra menzionate, la tempistica è degna di nota.

Nella matematica tradizionale, un nuovo risultato importante può richiedere mesi o anni per essere ricostruito in modo indipendente.

I ricercatori devono prima apprendere il contesto, leggere il manoscritto, esaminare i dettagli tecnici, ricostruire gli argomenti, provare alternative, discutere i problemi e pubblicare una revisione o un articolo successivo.

Un modello capace può comprimere parte di questo processo.

Se il risultato di un modello può essere raggiunto indipendentemente da un altro modello in un giorno, la finestra di priorità per le scoperte generate dall'IA potrebbe ridursi drasticamente.

Il primo team merita comunque credito per aver scelto il problema, presentato la prima argomentazione pubblica, preparato il manoscritto, formalizzato il risultato e creato un registro a cui altri possono fare riferimento.

Tuttavia, quando altri ricercatori possono immediatamente assegnare problemi simili a sistemi all'avanguardia, il vantaggio del primo arrivato potrebbe durare solo giorni piuttosto che anni.

Questo è più simile a una replica che a una competizione di benchmark

La maggior parte dei benchmark per modelli confronta sistemi su problemi con risposte note.

Il benchmark chiede:

Dato lo stesso test set, quale modello ottiene un punteggio più alto?

Questa raccolta pone una domanda diversa:

Due sistemi possono arrivare indipendentemente allo stesso nuovo risultato all'avanguardia?

Questo è simile alla replica scientifica.

La replica indipendente può rivelare se un risultato dipende da un errore di un singolo modello, da un prompt fragile, da una fuga di informazioni o da un percorso dimostrativo insolito.

Due argomenti indipendenti possono aumentare la fiducia, specialmente quando seguono percorsi diversi.

Ma devono comunque essere revisionati.

Due modelli potrebbero condividere fonti di addestramento simili, incomprensioni matematiche, bias di ottimizzazione o assunzioni implicite.

L'indipendenza dei modelli non equivale automaticamente all'indipendenza cognitiva.

Come valutare una dichiarazione di riproduzione dell'IA

Un pacchetto di riproduzione credibile dovrebbe divulgare informazioni sufficienti affinché altri possano ripetere l'esperimento.

Definizione del problema

  • La dichiarazione esatta del teorema.
  • Le assunzioni esatte.
  • La versione del problema sorgente.
  • Riferimenti che dimostrano che il problema era precedentemente aperto.

Configurazione del modello

  • Nome e versione del modello.
  • Impostazioni di inferenza o sforzo.
  • Lunghezza del contesto.
  • Accesso agli strumenti.
  • Impostazioni di campionamento pertinenti.

Progettazione del prompt

  • Prompt iniziale.
  • Prompt successivi.
  • Correzioni umane.
  • Eventuali prompt di dominio.
  • Eventuali scaffolding.

Controllo della fuga

  • Accesso a rete e ricerca.

  • Documenti sorgente inclusi nel contesto.

  • Momento dello snapshot del modello.

  • Metodo utilizzato per rilevare linguaggio o struttura copiati.

Registro di esecuzione

  • Trascrizione completa.
  • Chiamate agli strumenti.
  • Tentativi falliti.
  • Tempo di esecuzione.
  • Utilizzo dei token.
  • Numero di esecuzioni parallele.

Evidenza matematica

  • Dimostrazione completa.
  • Certificati formali verificabili.
  • Elenco delle dipendenze.
  • Confronto con la prima dimostrazione.

Revisione esterna

  • Revisori nominati.
  • Pareri di revisione.
  • Correzioni apportate.
  • Obiezioni residue.
  • Stato della pubblicazione.

Senza queste informazioni, una "riproduzione indipendente" resta difficile da distinguere da un rapporto preliminare promettente.

Fable 5 è un modello avanzato disponibile pubblicamente

Anthropic ha rilasciato Claude Fable 5 a giugno 2026.

Anthropic lo descrive come un modello di livello Mythos progettato per l'uso pubblico con salvaguardie di sicurezza.

L'azienda afferma che il modello eccelle particolarmente in lavoro autonomo a lungo termine, ingegneria del software, lavoro di conoscenza, visione, ricerca scientifica e attività con contesto lungo.

L'identificatore ufficiale del modello API è:

claude-fable-5

I prezzi pubblicati da Anthropic sono:

$10 per milione di token di input
$50 per milione di token di output

Il rilascio pubblico di Fable è strettamente legato alla vicenda matematica.

Astra rimane un modello non pubblicato internamente da OpenAI.

Fable è accessibile a ricercatori e sviluppatori tramite i prodotti e le API supportate da Anthropic.

Ciò rende più facile per i team esterni provare le proprie domande di ricerca, sebbene l'accesso al modello non garantisca le competenze necessarie per selezionare buoni problemi o validare gli output.

La cifra di 2000 dollari è una stima del costo marginale di ricerca

OpenAI afferma che il numero totale di token necessari per trovare quelle dieci soluzioni ai prezzi dell'API Sol è di circa 2000 dollari.

![Tweet di Noam Brown datato 1 agosto, che mostra che al prezzo dell'API Sol, il costo totale per generare le dimostrazioni dei risultati di svolta è stato inferiore a 2000 dollari, e che non vede l'ora di vedere scienziati e ricercatori creare risultati con il prossimo modello Astra di OpenAI.](segnaposto immagine)

La cifra è sorprendente, ma richiede un'etichetta precisa.

È meglio intenderla come una stima del costo in token per trovare con successo le soluzioni.

Non è il costo economico totale del progetto di ricerca.

La struttura dei costi più ampia potrebbe includere:

  • Addestramento di Astra.
  • Costruzione e gestione dell'infrastruttura di inferenza.
  • Ricercatori che selezionano i problemi candidati.
  • Esecuzioni di prova su problemi non risolti.
  • Approcci falliti utilizzati sui problemi risolti.
  • Scrittura manuale del manoscritto.
  • Lavoro di formalizzazione.
  • Ingegneria del software.
  • Revisione matematica esterna.
  • Pubblicazione e manutenzione.

OpenAI afferma di aver tentato altri importanti problemi senza successo e di non aver risolto alcun problema del Millennium Prize.

Pertanto, la stima di 2000 dollari risponde a:

Qual è il costo in token di una ricerca riuscita, alle tariffe API pubbliche?

Non risponde a:

Qual è il costo per creare il modello e generare, validare e pubblicare i risultati della ricerca?

Entrambe le cifre sono utili, ma misurano cose diverse.

Perché il costo marginale può comunque cambiare il modo di fare ricerca

Anche tenendo conto dei costi indiretti, il basso costo marginale di un nuovo tentativo serio potrebbe cambiare il modo in cui la ricerca viene condotta.

Un matematico umano potrebbe impiegare settimane per decidere se un percorso merita di essere esplorato.

Un sistema di intelligenza artificiale può essere incaricato di esplorare molti percorsi in parallelo.

I ricercatori potrebbero usare il modello per:

  • Cercare controesempi.
  • Testare varianti di congetture.
  • Tradurre tra linguaggi matematici.
  • Trovare lemmi correlati.
  • Formalizzare bozze di dimostrazione.
  • Generare esperimenti computazionali.
  • Confrontare strategie dimostrative.
  • Identificare lacune.
  • Cercare formulazioni più semplici.

Questo effetto potrebbe assomigliare agli esperimenti ad alta produttività in altre scienze.

Quando il costo di testare un'altra ipotesi diminuisce, il numero di ipotesi testate aumenta.

Le risorse scarse si spostano verso la selezione di problemi promettenti e la valutazione del flusso di candidati che ne deriva.

Anche i tentativi falliti devono essere conteggiati

Una contabilità che considera solo i successi potrebbe fornire un quadro fuorviante.

Supponiamo che a un sistema vengano assegnati 100 problemi aperti e ne risolva 10.

Se l'obiettivo è misurare l'economia dell'intero progetto di ricerca, il costo di ogni soluzione riuscita dovrebbe includere le risorse spese per i 90 fallimenti.

Una contabilità completa dovrebbe riportare:

Costo totale di inferenza
÷
Numero di risultati validati

Dovrebbe distinguere tra esecuzioni finali riuscite, esecuzioni complete fallite, progressi parziali, riavvii guidati da umani, candidati paralleli e costi di validazione.

Senza questo denominatore, una cifra bassa potrebbe descrivere solo i successi selezionati, non l'economia dell'intero processo di scoperta.

Fable è stato utilizzato anche per un nuovo problema aperto

Una critica al lavoro di riproduzione è diretta:

Perché far rifare a Fable i risultati di Astra, invece di assegnargli nuovi problemi aperti?

Riproduzione e scoperta servono a scopi diversi.

La riproduzione verifica l'affidabilità.

Risolvere nuovi problemi verifica la capacità alla frontiera.

Fable è stato anche

associato a un nuovo risultato matematico.

A luglio 2026, Alpöge ha riportato un controesempio alla congettura di Jacobi in dimensione tre, attribuendo a Fable un ruolo nella scoperta.

Il controesempio è stato verificato formalmente, discusso dai matematici e seguito da ulteriori lavori. Un articolo pubblicato su arXiv alla fine di luglio presenta una trattazione completa e autoconsistente e generalizza il meccanismo a dimensioni superiori.

Questo evento rivela uno schema ricorrente:

  1. L'IA produce un oggetto o un'argomentazione esplicita.
  2. Gli strumenti di formalizzazione verificano l'affermazione centrale.
  3. I matematici umani cercano una spiegazione concettuale.
  4. Il lavoro successivo generalizza il risultato.

La fase finale potrebbe essere quella in cui risiede gran parte del valore matematico duraturo.

Controesempi e dimostrazioni impongono diversi oneri di validazione

Un controesempio esplicito a volte può essere verificato rapidamente.

Se una congettura afferma che non esiste alcun oggetto con certe proprietà, un oggetto valido è sufficiente per confutarla.

Il revisore può verificare:

  • Che l'oggetto sia ben definito.
  • Che soddisfi le ipotesi.
  • Che violi la conclusione.

Un teorema generale lungo potrebbe invece richiedere centinaia di lemmi interconnessi e una vasta conoscenza della letteratura.

Questa differenza spiega in parte perché i controesempi generati dall'IA possono diffondersi rapidamente.

L'esempio di Jacobi è abbastanza compatto da consentire ai ricercatori di verificarlo e formalizzarlo rapidamente.

Alcuni dei dieci risultati di Astra coinvolgono catene teoriche più lunghe che potrebbero richiedere più tempo alla comunità per essere assimilate.

Il nuovo collo di bottiglia è la revisione umana

La domanda centrale è:

Se l'IA può generare rapidamente dimostrazioni all'avanguardia, la comunità matematica può validarle abbastanza velocemente?

Un risultato di ricerca deve ottenere diverse forme di riconoscimento.

Riconoscimento logico

La dimostrazione deriva effettivamente dalle ipotesi?

Lean può aiutare in questo.

Riconoscimento semantico

L'affermazione formalizzata corrisponde al significato che l'autore intende?

Gli esperti devono verificare questa trasposizione.

Riconoscimento storico

Il problema era effettivamente irrisolto e il risultato è nuovo?

Richiede conoscenza della letteratura.

Riconoscimento concettuale

La dimostrazione rivela nuove idee o conferma semplicemente un fatto?

Richiede giudizio matematico.

Riconoscimento della comunità

Il lavoro è stato revisionato, discusso, corretto e contestualizzato?

Richiede tempo e processi istituzionali.

L'IA accelera la generazione di dimostrazioni molto più velocemente di quanto università e riviste possano espandere il numero di esperti in grado di revisionare lavori altamente specializzati.

La maggior parte delle persone non può giudicare questi risultati in modo indipendente

Un potente modello di programmazione può essere testato chiedendogli di costruire un'applicazione.

Un potente modello di immagini può essere giudicato visivamente.

La matematica all'avanguardia è diversa.

La maggior parte dei lettori non può valutare personalmente l'esistenza di gruppi non sofici, un controesempio alla congettura di rigidità di Connes, il teorema di ripetizione parallela per i giochi di entanglement o la difficoltà sui reticoli.

Essi dipendono da una catena di fiducia:

Output del modello
→ Certificato formale
→ Assistente di dimostrazione e le sue librerie
→ Esperti di settore
→ Revisori indipendenti
→ Riviste e comunità di ricerca

Questo rende la trasparenza più importante, non meno.

Quando il pubblico non può verificare direttamente una capacità, la fiducia

deve provenire da prove e istituzioni.

Tweet di Ethan Mollick, nome utente @emollick.Il contenuto del tweet sottolinea che, per quasi ogni essere umano sulla Terra, questa situazione non solo va oltre le nostre capacità, ma anche oltre la nostra comprensione. Possiamo solo affidarci a matematici professionisti per giudicare se questo risultato sia straordinario. Questa situazione si sta verificando in molti campi, rendendo sempre più difficile percepire un miglioramento delle competenze. Il tweet riecheggia il contenuto del documento riguardante la difficoltà di valutare personalmente i risultati all'avanguardia nel campo della matematica, evidenziando l'importanza della professionalità e della trasparenza in ambito matematico.

Le prove formalizzate dipendono ancora da infrastrutture costruite dagli esseri umani

Descrivere questo evento come l'IA che sostituisce isolatamente la matematica sarebbe fuorviante.

Questi modelli dipendono da:

  • Secoli di letteratura matematica.
  • Definizioni create dagli esseri umani.
  • Teoremi pubblicati.
  • Assistenti alla dimostrazione formalizzata.
  • Mathlib.
  • Il kernel affidabile di Lean.
  • Ricercatori che selezionano i problemi.
  • Esperti che interpretano i risultati.
  • Ingegneri che costruiscono i sistemi di addestramento e inferenza.

I certificati Lean di Astra sono stati possibili grazie a una vasta comunità che ha dedicato anni a formalizzare le fondamenta della matematica e a costruire librerie riutilizzabili.

Il risultato del modello è reale.

L'infrastruttura umana che lo sostiene è altrettanto reale.

Una descrizione più onesta sarebbe:

I modelli all'avanguardia stanno diventando attori potenti all'interno di un sistema di conoscenza matematica costruito e mantenuto dagli esseri umani.

Correttezza non equivale a comprensione

Una dimostrazione può essere corretta senza essere illuminante.

I matematici spesso valutano un risultato perché introduce nuovi invarianti, costruzioni, metodi riutilizzabili, connessioni tra campi, spiegazioni più concise o domande migliori.

Quando l'IA genera una dimostrazione lunga, i revisori potrebbero chiedersi:

  • Quale passaggio contiene la vera idea centrale?
  • Perché questa costruzione funziona?
  • Quali ipotesi sono essenziali?
  • Questa dimostrazione può essere semplificata?
  • Questo metodo può risolvere problemi correlati?
  • Quali nuove congetture ne derivano?

Questa è la differenza tra verificare un teorema e integrarlo nella matematica umana.

Il numero di risultati corretti è importante.

La capacità di trasformare questi risultati in comprensione potrebbe esserlo ancora di più.

Il gusto matematico potrebbe diventare più prezioso

Se la ricerca di dimostrazioni diventa più economica, la scelta dei problemi potrebbe costituire una parte maggiore del vantaggio nella ricerca.

Le decisioni più difficili potrebbero essere:

  • Quale congettura merita di essere verificata?
  • Quale versione potrebbe essere errata?
  • Quale caso speciale potrebbe sbloccare il problema generale?
  • Quale risultato potrebbe collegare più campi?
  • Quale formalizzazione è fedele e affidabile?
  • Quale dimostrazione generata contiene idee riutilizzabili?

Queste sono questioni di gusto matematico.

I modelli possono aiutare a generare problemi, ma l'attuale ecosistema di ricerca dipende ancora fortemente dagli esperti per giudicare quali problemi siano significativi.

La revisione tra pari potrebbe richiedere una nuova infrastruttura tecnologica

La revisione tra pari tradizionale presuppone un numero relativamente limitato di manoscritti.

L'IA potrebbe produrre più risultati candidati di quanti le riviste esistenti possano gestirne.

Il processo di revisione potrebbe richiedere nuovi livelli.

Verifica formalizzata automatizzata

Ogni risultato adatto alla formalizzazione dovrebbe essere accompagnato da un certificato verificabile da macchina.

Registro riproducibile della generazione

Prompt, versioni del modello, accesso agli strumenti e condizioni di esecuzione dovrebbero essere archiviati.

Ricerca bibliografica automatizzata

I sistemi dovrebbero confrontare le nuove affermazioni con database di articoli e teoremi.

Riproduzione con modelli indipendenti

Modelli diversi o gruppi di ricerca diversi potrebbero tentare di risolvere lo stesso problema senza vedere la dimostrazione proposta.

Triage degli esperti

Gli esperti identificano quali risultati meritano una revisione approfondita.

Riscrittura esplicativa

Le dimostrazioni corrette vengono convertite in forme che gli esseri umani possono apprendere.

Revisione post-pubblicazione

Repository aperti consentono di registrare continuamente errori, semplificazioni e argomenti alternativi.

Questo non sostituisce le riviste o gli esperti, ma fornisce loro strumenti migliori per gestire volumi di lavoro più ampi.

La Dichiarazione di Leida solleva questioni di governance

La Dichiarazione di Leida sull'IA e la matematica invita a un uso responsabile dell'IA nella ricerca matematica.

Le sue preoccupazioni includono:

  • Argomenti plausibili ma inaffidabili.
  • Trasparenza sulla partecipazione dell'IA.
  • Attribuzione della paternità.
  • Responsabilità per la correttezza.
  • Accesso ineguale a sistemi proprietari costosi.
  • Eccessiva enfasi pubblicitaria.
  • Controllo umano sull'agenda di ricerca.

La pubblicazione di OpenAI ha risposto ad alcuni di questi punti con un'insolita franchezza.

Attribuisce gli argomenti matematici al modello, spiega il ruolo degli umani nella preparazione del manoscritto, pubblica certificati formalizzati e invita la comunità alla revisione.

Domande ancora aperte:

  • Chi dovrebbe essere elencato come autore?
  • Chi è responsabile degli errori?
  • Come dovrebbero essere citate le fonti di addestramento per le scoperte generate dal modello?
  • Come dovrebbe essere distribuito l'accesso?
  • Quando un risultato è pronto per essere annunciato pubblicamente?
  • Quali prove dovrebbero accompagnare le affermazioni di scoperta autonoma?

Queste non sono più questioni politiche ipotetiche.

Ora si applicano a risultati di ricerca reali.

Checklist pratica di verifica

Passo 1: Confermare il problema

  • Trovare la formulazione autorevole.
  • Controllare le ipotesi esatte.
  • Verificare che la versione dichiarata sia pubblica.
  • Identificare eventuali risultati preliminari esistenti.

Passo 2: Distinguere le tappe

Distinguere tra:

  • Il modello propone un'idea.
  • Il modello scrive una dimostrazione.
  • Un umano modifica la dimostrazione.
  • La dimostrazione viene formalizzata.
  • La verifica formalizzata supera la compilazione.
  • Un esperto accetta il risultato.
  • Il risultato supera la revisione per la pubblicazione.

Passo 3: Leggere la dimostrazione non formalizzata

Cercare ipotesi nascoste, ragionamenti circolari, transizioni non spiegate, citazioni errate, cambi di ambito e simboli ambigui.

Passo 4: Controllare l'enunciato formalizzato

Confermare che il teorema in Lean esprima fedelmente il contenuto matematico previsto.

Passo 5: Ricostruire i certificati

Per il repository di OpenAI:

git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All

Passo 6: Controllare le dipendenze

Esaminare i moduli importati, gli assiomi, i placeholder, le dichiarazioni non sicure, le definizioni personalizzate e il codice esterno affidabile.

Passo 7: Confrontare le dimostrazioni non formalizzata e formalizzata

La dimostrazione formalizzata potrebbe stabilire il teorema attraverso un percorso diverso rispetto al manoscritto.

Passo 8: Tentare una riproduzione indipendente

Consegnare l'enunciato del teorema — ma non la dimostrazione proposta — a un altro modello o gruppo di ricerca.

Passo 9: Ricercare la letteratura

Confermare la novità e identificare lavori sovrapposti.

Passo 10: Riflettere su ciò che si è appreso

Un risultato corretto dovrebbe essere seguito da domande concettuali:

  • Perché funziona?
  • Può essere semplificato?
  • Cosa generalizza?
  • Quali convinzioni precedenti dovrebbero cambiare?

Cosa confermerebbe la favola cinque?

Se Alpöge o Anthropic pubblicassero quanto segue, l'affermazione sarebbe notevolmente rafforzata:

  1. La formulazione precisa del teorema utilizzato.
  2. I prompt e la configurazione del modello.
  3. I manoscritti delle dimostrazioni per tutti e cinque i risultati.
  4. Timestamp e log completi di esecuzione.
  5. Dettagli dell'ambiente offline.
  6. Metodi di prevenzione delle perdite.
  7. Il confronto con gli argomenti di Astra.
  8. Certificati Lean o altri formati verificabili da macchina.
  9. Revisione indipendente da parte di esperti.

Il risultato più interessante non è necessariamente l'insieme identico di cinque dimostrazioni.

Quattro argomenti veramente diversi potrebbero essere più preziosi, perché potrebbero rivelare strutture alternative alla base dello stesso risultato.

Cosa ha già stabilito la pubblicazione di OpenAI

OpenAI ha reso pubblicamente disponibili:

  • Dieci risultati matematici dettagliati.
  • Manoscritti completi.
  • Un'analisi passo passo del processo di scoperta.
  • Dieci file formalizzati.
  • Istruzioni di compilazione.
  • Un repository con licenza Apache.
  • Dichiarazioni chiare sui contributi di IA e umani.

Questo non sostituisce la revisione tra pari.

Ma crea un pacchetto di ricerca serio e verificabile.

La responsabilità è passata da "mostrateci le prove" a "valutate un'ampia mole di prove".

Cosa rivela la risposta in 24 ore

La risposta riportata dalla favola suggerisce che le capacità di ricerca all'avanguardia potrebbero diffondersi più velocemente delle pubblicazioni dei modelli.

Un'azienda può mantenere privato il proprio modello.

Ma non può presumere che i risultati matematici prodotti da quel modello rimangano esclusivi a lungo dopo la pubblicazione.

Una volta che l'enunciato del teorema è pubblico, altri sistemi capaci possono attaccarlo immediatamente.

Pertanto, le organizzazioni potrebbero scegliere di pubblicare rapidamente prove complete, formalizzare prima dell'annuncio, invitare alla riproduzione indipendente e coordinarsi con esperti del settore prima della divulgazione.

La priorità conta ancora.

Il pacchetto di prove attorno alle rivendicazioni di priorità potrebbe essere altrettanto importante.

Domande frequenti

Cosa ha dimostrato OpenAI Astra?

OpenAI ha pubblicato dieci risultati nei campi della matematica e dell'informatica teorica, inclusi lavori sull'impaccamento di sfere, teoria dei codici, gruppi non sofici, congettura di rigidità di Connes, circuiti aritmetici, ripetizione parallela quantistica, difficoltà reticolare, congettura del volume di Ehrhart, numeri di Ramsey e teoria degli estremali nei grafi. OpenAI li descrive come risultati che risolvono o fanno avanzare significativamente problemi aperti di lunga data.

Astra di OpenAI è disponibile pubblicamente?

No. OpenAI descrive Astra come una versione interna del suo prossimo modello principale. I documenti, le analisi dettagliate del ragionamento e le certificazioni Lean sono pubbliche, ma il modello Astra utilizzato per generare gli argomenti non è stato rilasciato.

Claude Fable 5 ha davvero riprodotto cinque delle dimostrazioni di Astra?

Il ricercatore di Anthropic Levent Alpöge ha dichiarato pubblicamente che Fable ha completato i problemi 4-8 in 24 ore in condizioni autonome e offline. Durante la verifica, i manoscritti completi, i log, i prompt e le certificazioni Lean di queste cinque esecuzioni non sono stati trovati pubblicamente, quindi questa affermazione dovrebbe essere considerata preliminare finché non verranno pubblicate prove più complete.

Quali cinque problemi Fable avrebbe completato?

Alpöge ha confermato la congettura di rigidità di Connes, la complessità dei circuiti aritmetici, la ripetizione parallela quantistica, il problema del vettore più vicino e la congettura del volume di Ehrhart. Ha affermato che il risultato di Ehrhart sembra utilizzare essenzialmente lo stesso argomento di Astra, mentre gli altri quattro risultati potrebbero differire.

Le dimostrazioni di OpenAI sono state verificate formalmente?

OpenAI ha pubblicato le dimostrazioni formali in Lean 4 per tutti e dieci i risultati, accompagnate da istruzioni di compilazione e risorse per la verifica indipendente. Le certificazioni Lean compilate possono verificare i teoremi formali, ma gli esperti devono ancora confermare che le affermazioni codificate corrispondano fedelmente alle proposizioni matematiche previste.

Questi dieci risultati sono costati solo 2.000 dollari?

OpenAI afferma che, secondo le tariffe dell'API Sol, i token necessari per trovare le soluzioni di successo sono costati circa 2.000 dollari. Questa stima non include l'addestramento del modello, i tentativi di ricerca falliti, il lavoro manuale sui manoscritti, le infrastrutture, la verifica formale o la revisione matematica esterna.

Perché le certificazioni Lean sono importanti?

Le certificazioni Lean consentono a un piccolo kernel affidabile di verificare meccanicamente che i teoremi formali siano derivati dalle loro ipotesi e dipendenze. Esse riducono il rischio di lacune logiche nascoste, ma non confermano la novità, l'importanza o la fedeltà delle traduzioni matematiche non formali.

L'IA sostituirà i matematici?

Le evidenze attuali supportano un cambiamento nel modo di fare matematica, piuttosto che una semplice tesi di sostituzione. I modelli possono accelerare la ricerca, la generazione di dimostrazioni, la scoperta di controesempi e la formalizzazione, mentre gli esseri umani rimangono indispensabili nella scelta dei problemi, nell'interpretazione, nel contesto bibliografico, nella revisione e nella trasformazione delle dimostrazioni in comprensione.

Strumenti correlati

  • Lean: un dimostratore interattivo di teoremi e linguaggio di programmazione per la matematica formalizzata e la verifica del software.
  • Mathlib: libreria matematica mantenuta dalla comunità, utilizzata da molti progetti di formalizzazione in Lean.
  • OpenAI Ten Proofs: repository ufficiale contenente le certificazioni Lean 4 dei dieci risultati pubblicati da Astra.
  • Elan: gestore di strumenti per installare e gestire le versioni di Lean.
  • Lake: sistema di build e gestore di pacchetti di Lean, utilizzato per compilare le dimostrazioni formali di OpenAI.
  • Claude Fable 5: modello pubblico di Anthropic per attività a lungo termine di conoscenza, codifica, visione e scienza.
  • Formal Conjectures: repository contenente affermazioni di congetture matematiche formalizzate, a supporto di flussi di lavoro di ricerca verificabili automaticamente.

Collegamenti correlati

Sintesi

OpenAI ha pubblicato un pacchetto di ricerca eccezionalmente completo che copre dieci progressi generati da Astra: un manoscritto di 249 pagine, una spiegazione dettagliata del processo di scoperta e dieci dimostrazioni formali in Lean che possono essere ricostruite da ricercatori esterni.

Claude Fable 5 avrebbe completato cinque di questi problemi in 24 ore, il che potrebbe rappresentare un nuovo tipo di replica assistita da modelli. Questa affermazione è significativa, ma le sue prove pubbliche sono attualmente meno complete rispetto ai manoscritti e alle certificazioni formali fornite da OpenAI, pertanto dovrebbe essere chiaramente etichettata come conclusione in attesa di verifica.

La stima di 2.000 dollari è meglio intesa come: il costo in token di una ricerca di soluzioni riuscita alle tariffe dell'API Sol, non il costo totale dell'intero progetto di ricerca. Addestramento, tentativi falliti, preparazione umana, formalizzazione, infrastrutture e revisione rimangono parte del costo economico reale.

Il cambiamento più grande è da una "scarsità di dimostrazioni" a una "scarsità di revisione". I modelli potrebbero presto generare affermazioni matematiche più velocemente di quanto gli esperti possano verificarle, interpretarle e contestualizzarle.

Quando le dimostrazioni diventano economiche e abbondanti, il lavoro più prezioso potrebbe consistere nel determinare quali siano corrette, significative, nuove e degne di essere comprese.

OpenAI Astra 发布十项数学进展,Claude Fable 5 声称在24小时内完成五项复现