OpenAI Astra publica diez avances matemáticos, y Claude Fable 5 afirma haber reproducido cinco en 24 horas
Un fin de semana de agosto de 2026 produjo una de las señales más claras hasta ahora de que la IA de vanguardia está superando los puntos de referencia matemáticos para adentrarse en la investigación activa. El 1 de agosto, OpenAI publicó diez

Diez avances matemáticos de OpenAI Astra y la declaración de reproducción en 24 horas de Claude Fable 5
Introducción
Un fin de semana de agosto de 2026 produjo una de las señales más claras hasta la fecha de que la IA de vanguardia está superando las matemáticas de referencia para adentrarse en la investigación activa.
El 1 de agosto, OpenAI publicó «Diez avances en matemáticas y ciencias de la computación teórica». Estos resultados fueron generados por una versión interna de Astra, a la que OpenAI describe como su próximo modelo principal.
El paquete de resultados incluye:
- Un manuscrito de 249 páginas.
- Diez resultados que abarcan matemáticas y ciencias de la computación teórica.
- Una explicación detallada del proceso de descubrimiento de 62 páginas.
- Diez demostraciones formales en Lean 4.
- Código fuente público para reconstrucción y certificados de verificación independiente.
Menos de 24 horas después, el investigador de Anthropic Levent Alpöge afirmó que el modelo disponible públicamente Claude Fable 5 había reproducido cinco de los diez resultados.
Confirmó que estos cinco eran los problemas 4 a 8:
- Conjetura de rigidez de Connes.
- Complejidad de circuitos aritméticos.
- Repetición paralela cuántica.
- Problema del vector más cercano.
- Conjetura del volumen de Ehrhart.
Alpöge afirmó que estas ejecuciones fueron autónomas, utilizaron indicaciones genéricas, no tuvieron acceso a internet y tomaron precauciones diseñadas para evitar que las soluciones de OpenAI se filtraran al contexto.
Si estas cinco demostraciones resisten una revisión pública exhaustiva, este evento indicaría que los resultados de investigación producidos por un modelo de vanguardia a veces pueden ser redescubiertos de forma independiente por otro modelo casi de inmediato.
Sin embargo, la evidencia no es simétrica. OpenAI ha publicado manuscritos, explicaciones del proceso y certificados verificables por máquina. Las declaraciones de Fable, por ahora, se apoyan principalmente en afirmaciones públicas más que en paquetes de demostración completos.
Por lo tanto, la conclusión útil no es simplemente que un modelo ganó.
La IA ahora es capaz de generar matemáticas de nivel de investigación a una velocidad tal que la verificación, la explicación, la atribución y la revisión pueden resultar más difíciles de escalar que la propia producción de demostraciones.

OpenAI publica diez resultados de nivel investigador
OpenAI describe estos trabajos como diez resultados que resuelven o logran avances significativos en problemas abiertos de larga data.
Los temas abarcan geometría de altas dimensiones, teoría de códigos, teoría de grupos, álgebras de operadores, complejidad de circuitos aritméticos, complejidad cuántica, problemas de retículas, geometría convexa, teoría de Ramsey y teoría extremal de grafos.
OpenAI afirma que los argumentos matemáticos fueron generados por el modelo interno Astra. Posteriormente, humanos asistidos por el mismo modelo ayudaron a reorganizar estos argumentos en manuscritos, y luego el modelo formalizó cada resultado en Lean.
El flujo de trabajo más preciso es:
Astra busca argumentos matemáticos
→ Selección de argumentos exitosos
→ Humanos y modelo preparan un manuscrito legible
→ El modelo formaliza los resultados en Lean
→ Certificados formales y código fuente publicados
→ Matemáticos externos verifican corrección, novedad e importancia
La contribución del modelo es central, pero el resultado final de la investigación sigue incluyendo preparación humana, infraestructura formal, bibliotecas de software y revisión por expertos.
Los diez resultados

| N.º | Área | Resultado publicado por OpenAI |
|---|---|---|
| 1 | Empaquetamiento de esferas en altas dimensiones | Determinó la fuerza asintótica de la programación lineal de Cohn–Elkies y mejoró las cotas universales de empaquetamiento en altas dimensiones |
| 2 | Códigos binarios y esféricos | Mejoró las cotas clásicas para códigos de distancia fija mediante un factor exponencial |
| 3 | Grupos no sóficos | Construyó un grupo no sófico explícito, resolviendo si todo grupo numerable admite aproximaciones por permutaciones finitas |
| 4 | Conjetura de rigidez de Connes | Construyó grupos con propiedad (T) que tienen la misma álgebra de von Neumann de grupo pero no son isomorfos, refutando así la conjetura |
| 5 | Complejidad de circuitos aritméticos | Estableció nuevas cotas inferiores para el cálculo del permanente, incluyendo cotas inferiores para fórmulas aritméticas de orden (n^4/\log n) |
| 6 | Repetición paralela cuántica | Demostró la propiedad de repetición paralela exponencial para juegos de entrelazamiento finitos bipersonales generales |
| 7 | Problema del vector más cercano | Proporcionó dureza de aproximación con factor polinómico para el CVP euclidiano y problemas de retículas relacionados |
| 8 | Conjetura del volumen de Ehrhart | Demostró la cota óptima de volumen máximo para una clase específica de cuerpos convexos en cada dimensión |
| 9 | Números de Ramsey multicolores | Demostró una cota inferior superexponencial para los números de Ramsey de triángulos multicolores, resolviendo el problema 183 de Erdős |
| 10 | Teoría extremal de grafos | Construyó ejemplos que refutan las conjeturas de compacidad y degeneración relacionadas con los problemas 146 y 180 de Erdős |
Estos no son problemas ordinarios de olimpiadas. Varios de ellos involucran problemas que han permanecido abiertos durante años y requieren experiencia profunda para ser evaluados.
El artículo es solo parte de lo publicado
OpenAI también publicó un documento de 62 páginas titulado «Cómo se formaron las ideas: notas sobre el descubrimiento matemático».
La demostración responde a:
¿Por qué es cierto este teorema?
El registro del descubrimiento intenta responder:
¿Cómo encontró el sistema este argumento?
Son dos preguntas diferentes.
El desglose paso a paso puede ayudar a los investigadores a determinar si el modelo recombina ideas conocidas, identifica algún tipo de analogía, realiza una búsqueda exhaustiva, encuentra nuevas construcciones o utiliza teoremas conocidos de maneras inesperadas.
Estos contenidos aún deben tratarse con cautela. Las narrativas generadas por el modelo no son necesariamente un registro causal perfecto de cada cálculo interno.
OpenAI publicó diez certificados Lean
El repositorio oficial openai/ten-proofs contiene un módulo Lean para cada resultado.
El proyecto utiliza:
Lean 4.32.0
mathlib
Lake
Con elan instalado, el README oficial indica a los usuarios que construyan las diez demostraciones formalizadas mediante el siguiente comando:
lake exe cache get
lake build All
También es posible construir un módulo individual:
lake build SpherePacking
El repositorio contiene:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.
lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
El código se publica bajo la licencia Apache 2.0 e incluye recursos de verificación independientes.
## Qué demuestra un certificado de Lean
Lean es un demostrador interactivo de teoremas basado en teoría de tipos dependientes.
Una prueba verificada por el núcleo de Lean establece que el teorema formalizado se deriva de definiciones, supuestos, axiomas y bibliotecas importados, así como de los términos de prueba formalizados.
Esto excluye muchos errores que pueden aparecer en argumentos informales:
- Pasos lógicos faltantes.
- Transformaciones algebraicas inválidas.
- Contradicciones ocultas.
- Casos sin fundamento.
- Discrepancias de cuantificadores.
- Lemas intermedios incorrectos.
El certificado puede ser revisado mecánicamente, en lugar de ser aceptado porque el autor suena convincente.
## Qué no demuestra un certificado de Lean
La verificación formal no elimina todas las cuestiones de revisión.
### ¿El enunciado formal coincide con la afirmación informal?
El demostrador de teoremas verifica el enunciado codificado. Los humanos aún deben juzgar si captura con precisión el problema matemático.
### ¿Son adecuadas las definiciones y los supuestos?
Lean verifica las consecuencias de las definiciones formalizadas. No puede decidir si esas definiciones reflejan conceptos aceptados, o si hay supuestos ocultos que debilitan el resultado principal.
### ¿El resultado es novedoso?
La corrección formal no equivale a novedad. La revisión bibliográfica y el conocimiento experto siguen siendo necesarios.
### ¿El resultado es importante?
Una máquina puede verificar que el teorema es válido. Pero no puede determinar si el resultado transforma el campo o introduce ideas valiosas.
### ¿La prueba nos permite aprender?
Dos pruebas formalmente correctas pueden diferir enormemente en su valor explicativo. Una puede revelar principios reutilizables; otra puede ser difícil de interiorizar para los humanos.
La verificación formal aborda el problema de la corrección. La comprensión matemática sigue siendo una tarea independiente.
## Claude Fable 5 afirma haber reproducido cinco resultados en 24 horas
Menos de un día después del anuncio de OpenAI, Alpöge escribió que había "completado la mitad con Fable".
Describió la configuración como:
- Totalmente autónoma.
- Con un mensaje genérico.
- Sin acceso a internet.
- Con precauciones adicionales para prevenir la fuga de información.

Alpöge confirmó más tarde que los cinco resultados son los números 4 a 8.

| Proyecto de OpenAI | Tema | Estado público de la afirmación de Fable |
|-|-|-|
| 4 | Conjetura de rigidez de Connes | Afirma haber reproducido |
| 5 | Complejidad de circuitos aritméticos | Afirma haber reproducido |
| 6 | Repetición paralela cuántica | Afirma haber reproducido |
| 7 | Problema del vector más cercano | Afirma haber reproducido |
| 8 | Conjetura del volumen de Ehrhart | Afirma haber reproducido |
Alpöge indicó que el resultado de Ehrhart es el único en el que Astra y Fable parecen haber usado esencialmente el mismo argumento.
Si es preciso, los otros cuatro podrían ser pruebas alternativas, no una reconstrucción del camino de OpenAI.
## La evidencia de Fable aún no equivale a la publicación de OpenAI
Para los diez resultados de OpenAI, el paquete público incluye enunciados de teoremas, manuscritos completos, procesos de razonamiento, código fuente de Lean, instrucciones de compilación y recursos de verificación independientes.
Para los cinco de Fable, puedo verificar las declaraciones de Alpöge, los números de problemas mencionados, las condiciones experimentales que describió y su observación sobre el argumento de Ehrhart.
No puedo verificar un paquete público que incluya:
- Cinco manuscritos completos.
- El mensaje genérico exacto.
- Registros de ejecución completos.
- Uso de tokens.
- Configuración del modelo.
- Métodos de prevención de fugas.
- Certificados de Lean.
- Revisión externa de cada argumento.
La descripción rigurosa es:
> Un investigador de Anthropic informó públicamente que Fable 5 completó de forma independiente cinco de los diez problemas en condiciones controladas, pero que, al verificar, la evidencia detallada necesaria para una evaluación independiente integral aún no se ha hecho pública.
Esto no demuestra que la afirmación sea falsa. Significa que la afirmación aún no ha alcanzado la misma etapa de evidencia que el paquete publicado por OpenAI.
## Por qué las 24 horas siguen siendo importantes
Incluso con las reservas anteriores, el momento es notable.
En matemáticas tradicionales, un resultado nuevo importante puede requerir meses o incluso años para ser reconstruido de forma independiente.
Los investigadores primero necesitan aprender el contexto, leer el manuscrito, examinar los detalles técnicos, reconstruir el argumento, probar alternativas, discutir el problema y publicar una revisión o un artículo de seguimiento.
Un modelo capaz puede comprimir partes de ese proceso.
Si el resultado de un modelo puede ser alcanzado de forma independiente por otro modelo en un día, la ventana de prioridad para los descubrimientos generados por IA podría acortarse drásticamente.
El primer equipo aún merece crédito por elegir los problemas, presentar el primer argumento público, preparar el manuscrito, formalizar los resultados y crear un registro que otros puedan consultar.
Sin embargo, cuando otros investigadores pueden asignar inmediatamente problemas similares a sistemas de vanguardia, la ventaja del primero puede durar solo días, no años.
## Esto se acerca más a la reproducción que a una competencia de referencia
La mayoría de los puntos de referencia de modelos comparan sistemas en problemas con respuestas conocidas.
El punto de referencia pregunta:
```texto plano
Dado el mismo conjunto de pruebas, ¿qué modelo obtiene una puntuación más alta?
Este conjunto plantea una pregunta diferente:
¿Pueden dos sistemas llegar de forma independiente al mismo resultado nuevo de frontera?
Esto se asemeja a la reproducción científica.
La reproducción independiente puede revelar si un resultado depende de un error de un solo modelo, de un mensaje frágil, de una fuga de información o de una ruta de prueba inusual.
Dos argumentos independientes pueden aumentar la confianza, especialmente cuando utilizan enfoques diferentes.
Pero aún requieren revisión.
Dos modelos pueden compartir fuentes de entrenamiento similares, malentendidos matemáticos, sesgos de optimización o supuestos implícitos.
La independencia de los modelos no equivale automáticamente a independencia cognitiva.
Cómo evaluar una afirmación de reproducción por IA
Un paquete de reproducción creíble debe divulgar suficiente información para que otros repitan el experimento.
Definición del problema
- Enunciado exacto del teorema.
- Supuestos exactos.
- Versión del problema fuente.
- Referencias que demuestren que el problema estaba abierto anteriormente.
Configuración del modelo
- Nombre y versión del modelo.
- Configuración de razonamiento o esfuerzo.
- Longitud del contexto.
- Acceso a herramientas.
- Configuración de muestreo relevante.
Diseño del mensaje
- Mensaje inicial.
- Mensajes posteriores.
- Correcciones humanas.
- Cualquier indicación de dominio.
- Cualquier andamiaje.
Control de fugas
Acceso a internet y búsqueda.
Documentos fuente incluidos en el contexto.
Momento de la instantánea del modelo.
Método utilizado para detectar lenguaje o estructura copiada.
Registro de ejecución
- Transcripción completa.
- Llamadas a herramientas.
- Intentos fallidos.
- Tiempo de ejecución.
- Uso de tokens.
- Número de ejecuciones en paralelo.
Evidencia matemática
- Demostración completa.
- Certificados formales viables.
- Lista de dependencias.
- Comparación con la primera demostración.
Revisión externa
- Revisores nombrados.
- Opiniones de revisión.
- Correcciones realizadas.
- Objeciones restantes.
- Estado de publicación.
Sin esta información, una “reproducción independiente” sigue siendo difícil de distinguir de un informe preliminar prometedor.
Fable 5 es un modelo de vanguardia disponible públicamente
Anthropic lanzó Claude Fable 5 en junio de 2026.
Anthropic lo describió como un modelo de nivel Mythos orientado al uso general y con salvaguardas de seguridad.
La compañía afirma que el modelo destaca especialmente en trabajo autónomo de larga duración, ingeniería de software, trabajo de conocimiento, visión, investigación científica y tareas de contexto extenso.
El identificador oficial del modelo en la API es:
claude-fable-5
El precio anunciado por Anthropic es:
10 dólares por millón de tokens de entrada
50 dólares por millón de tokens de salida
La publicación pública de Fable está estrechamente relacionada con la historia matemática.
Astra sigue siendo un modelo interno no publicado de OpenAI.
Fable está disponible para investigadores y desarrolladores a través de los productos y la API compatibles de Anthropic.
Esto facilita que equipos externos prueben sus propias preguntas de investigación, aunque el acceso al modelo no garantiza la experiencia necesaria para seleccionar buenos problemas ni para validar los resultados.
La cifra de 2000 dólares es una estimación del costo marginal de búsqueda
OpenAI indica que el número total de tokens necesarios para encontrar esas diez soluciones a los precios de la API de Sol asciende aproximadamente a 2000 dólares.

Esta cifra es sorprendente, pero necesita una etiqueta precisa.
Lo mejor es entenderla como una estimación del costo en tokens de encontrar soluciones con éxito.
No es el costo económico total del proyecto de investigación.
La pila de costos más amplia puede incluir:
- Entrenar a Astra.
- Construir y operar la infraestructura de inferencia.
- Investigadores que filtran problemas candidatos.
- Ejecuciones de prueba sobre problemas no resueltos.
- Enfoques fallidos aplicados a problemas que sí se resolvieron.
- Redacción manual del manuscrito.
- Trabajo de formalización.
- Ingeniería de software.
- Revisión matemática externa.
- Publicación y mantenimiento.
OpenAI afirma que intentó otros problemas importantes sin éxito y que no resolvió ningún Premio del Milenio.
Por lo tanto, esta estimación de 2000 dólares responde a:
¿Cuál es el costo en tokens de una búsqueda exitosa, según las tarifas públicas de la API?
No responde a:
¿Cuál es el costo de crear el modelo y de generar, verificar y publicar los resultados de investigación?
Ambas cifras son útiles, pero miden cosas distintas.
Por qué el costo marginal puede cambiar la forma de investigar
Incluso teniendo en cuenta los costos indirectos, el bajo costo marginal de volver a intentar seriamente puede cambiar la forma en que se realiza la investigación.
Un matemático humano puede dedicar semanas a decidir si una vía merece la pena explorarse.
Un sistema de IA puede verse obligado a explorar muchas vías en paralelo.
Los investigadores podrían usar el modelo para:
- Buscar contraejemplos.
- Probar variantes de conjeturas.
- Traducir entre lenguajes matemáticos.
- Encontrar lemas relevantes.
- Formalizar demostraciones candidatas.
- Generar experimentos computacionales.
- Comparar estrategias de demostración.
- Identificar lagunas.
- Buscar formulaciones más simples.
Este efecto podría ser similar a la experimentación de alto rendimiento en otras ciencias.
Cuando el costo de probar otra hipótesis disminuye, el número de hipótesis probadas aumenta.
El recurso escaso se desplaza hacia la selección de problemas prometedores y la evaluación del torrente de candidatas que llega después.
Los intentos fallidos también deben contabilizarse
Una contabilidad que solo cuente los éxitos puede ofrecer una imagen engañosa.
Supongamos que un sistema recibe 100 problemas abiertos y resuelve 10 de ellos.
Si el objetivo es medir la economía del proyecto de búsqueda completo, el costo de cada solución exitosa debería incluir los recursos gastados en los 90 fracasos.
La contabilidad completa debería informar:
Costo total de inferencia
÷
Número de resultados verificados
Debería distinguir entre ejecuciones finales exitosas, ejecuciones completas fallidas, progreso parcial, reinicios guiados por humanos, candidatos en paralelo y costos de verificación.
Sin este denominador, una cifra baja podría describir solo los éxitos seleccionados, no la economía del proceso de descubrimiento en su conjunto.
Fable también se ha utilizado para un nuevo problema abierto
Una crítica al trabajo de reproducción es directa:
¿Por qué hacer que Fable repita los resultados de Astra en lugar de asignarle nuevos problemas abiertos?
La reproducción y el descubrimiento cumplen propósitos distintos.
La reproducción pone a prueba la fiabilidad.
Resolver nuevos problemas pone a prueba la capacidad de vanguardia.
Fable también se ha relacionado
con un nuevo resultado matemático.
En julio de 2026, Alpöge informó de un contraejemplo a la conjetura de Jacobi en el caso tridimensional, atribuyendo a Fable el papel que desempeñó en el proceso de descubrimiento.
El contraejemplo fue verificado formalmente, discutido por matemáticos, y después se realizaron trabajos de seguimiento. Un artículo publicado en arXiv a finales de julio presentaba una exposición completa y autocontenida y generalizaba el mecanismo a dimensiones superiores.
Este evento revela un patrón recurrente:
- La IA produce un objeto o argumento concreto.
- Las herramientas formales verifican el núcleo de la afirmación.
- Los matemáticos buscan una explicación a nivel conceptual.
- El trabajo posterior generaliza el resultado.
La fase final puede ser donde reside gran parte del valor matemático duradero.
Los contraejemplos y las demostraciones imponen cargas de verificación distintas
Un contraejemplo concreto a veces puede comprobarse rápidamente.
Si una conjetura afirma que no existe ningún objeto con ciertas propiedades, un objeto válido es suficiente para refutarla.
El revisor puede verificar:
- Que el objeto está bien definido.
- Que satisface las hipótesis.
- Que viola la conclusión.
En cambio, un teorema general extenso puede requerir cientos de lemas interrelacionados y un amplio conocimiento de la bibliografía.
Esta diferencia explica en parte por qué los contraejemplos generados por IA pueden difundirse rápidamente.
El ejemplo de Jacobi es lo bastante compacto como para que los investigadores puedan comprobarlo y formalizarlo rápidamente.
Algunos de los diez resultados de Astra implican cadenas teóricas más largas que pueden requerir más tiempo para que la comunidad los asimile.
El nuevo cuello de botella está en la revisión humana
La cuestión central es:
Si la IA puede generar demostraciones de vanguardia rápidamente, ¿puede la comunidad matemática verificarlas con la suficiente rapidez?
Un resultado de investigación necesita obtener diversas formas de reconocimiento.
Reconocimiento lógico
¿La demostración se sigue realmente de las hipótesis?
Lean puede ayudar en esto.
Reconocimiento semántico
¿La afirmación formalizada coincide con el significado que el autor pretende comunicar?
Los expertos deben examinar esa traducción.
Reconocimiento histórico
¿El problema estaba realmente sin resolver y el resultado es novedoso?
Esto requiere conocimiento de la bibliografía.
Reconocimiento conceptual
¿La demostración revela nuevas ideas o solo confirma un hecho?
Esto requiere criterio matemático.
Reconocimiento comunitario
¿El trabajo ha sido revisado, discutido, corregido y situado en su contexto adecuado?
Esto requiere tiempo y procesos institucionales.
La IA acelera la generación de demostraciones mucho más rápido de lo que las universidades y las revistas pueden ampliar el grupo de expertos capaces de revisar trabajos altamente especializados.
La mayoría de las personas no pueden evaluar estos resultados de forma independiente
Un modelo de programación potente puede ponerse a prueba pidiéndole que construya una aplicación.
Un modelo de imagen potente puede evaluarse visualmente.
Pero las matemáticas de vanguardia son diferentes.
La mayoría de los lectores no pueden evaluar personalmente la existencia de grupos no sóficos, un contraejemplo de la conjetura de rigidez de Connes, el teorema de repetición paralela para juegos de enredo o la dureza en retículos.
Dependen de una cadena de confianza:
Salida del modelo
→ Certificado formal
→ Asistente de demostraciones y sus bibliotecas
→ Expertos en el dominio
→ Revisores independientes
→ Revistas y comunidad investigadora
Esto hace que la transparencia sea más importante, no menos.
Cuando el público no puede comprobar directamente una capacidad, la confianza
debe provenir de la evidencia y de las instituciones.
![Es una publicación en Twitter del autor Ethan Mollick, usuario @emollick.
El contenido del tuit señala que, para casi todos los seres humanos en la Tierra, esta situación no solo supera nuestra capacidad, sino también nuestra comprensión. Solo podemos recurrir a matemáticos profesionales para juzgar si este logro es asombroso. Esta situación está apareciendo en muchos campos, por lo que cada vez resulta más difícil sentir una mejora en las habilidades. El tuit coincide con el contenido del documento sobre la dificultad de juzgar personalmente los resultados de vanguardia en matemáticas, enfatizando la importancia de la especialización y la transparencia en el campo matemático.
La demostración formal sigue dependiendo de la infraestructura construida por humanos
Describir este evento como que la IA reemplaza a las matemáticas de forma aislada sería engañoso.
Estos modelos dependen de:
- Siglos de literatura matemática.
- Definiciones creadas por humanos.
- Teoremas publicados.
- Asistentes de demostración formal.
- Mathlib.
- El núcleo de confianza de Lean.
- Investigadores que seleccionan problemas.
- Expertos que interpretan resultados.
- Ingenieros que construyen sistemas de entrenamiento e inferencia.
El certificado Lean de Astra fue posible gracias a que una gran comunidad dedicó años a formalizar los fundamentos matemáticos y a construir bibliotecas reutilizables.
El logro del modelo es real.
La infraestructura humana que lo sustenta es igualmente real.
Una descripción más honesta sería:
Los modelos de vanguardia se están convirtiendo en actores poderosos dentro del sistema de conocimiento matemático construido y mantenido por humanos.
Corrección no equivale a comprensión
Una demostración puede ser correcta sin ser esclarecedora.
Los matemáticos suelen valorar un resultado porque introduce nuevos invariantes, construcciones, métodos reutilizables, conexiones entre dominios, explicaciones más concisas o mejores preguntas.
Cuando la IA genera una demostración extensa, los revisores podrían preguntarse:
- ¿Qué paso contiene la idea central real?
- ¿Por qué funciona esta construcción?
- ¿Qué hipótesis son esenciales?
- ¿Puede simplificarse esta demostración?
- ¿Puede este método resolver problemas relacionados?
- ¿Qué nuevas conjeturas se derivan de esto?
Esa es la diferencia entre verificar un teorema e integrarlo en las matemáticas humanas.
La cantidad de resultados correctos importa.
La capacidad de convertir esos resultados en comprensión puede importar aún más.
El gusto matemático puede volverse más valioso
Si la búsqueda de demostraciones se vuelve más barata, la selección de problemas podría convertirse en una parte mayor de la ventaja investigadora.
Las decisiones más difíciles podrían ser:
- ¿Qué conjetura merece ser verificada?
- ¿Qué versión podría ser falsa?
- ¿Qué caso especial podría desbloquear el problema general?
- ¿Qué resultado puede conectar múltiples dominios?
- ¿Qué formalización es fiel y confiable?
- ¿Qué demostración generada contiene ideas reutilizables?
Estas son cuestiones de gusto matemático.
Los modelos pueden ayudar a generar problemas, pero el ecosistema de investigación actual sigue dependiendo en gran medida de expertos para juzgar qué problemas son significativos.
La revisión por pares puede necesitar una nueva pila tecnológica
La revisión por pares tradicional asume un número relativamente pequeño de manuscritos.
La IA puede producir más resultados candidatos de los que las revistas actuales pueden procesar.
El proceso de revisión puede necesitar nuevas capas.
Verificación formal automatizada
Todo resultado susceptible de formalización debería incluir un certificado verificable por máquina.
Registro de generación reproducible
Los prompts, versiones de modelo, acceso a herramientas y condiciones de ejecución deberían archivarse.
Búsqueda bibliográfica automatizada
Los sistemas deberían contrastar nuevas afirmaciones con bases de datos de artículos y teoremas.
Reproducción con modelos independientes
Diferentes modelos o equipos de investigación podrían intentar resolver el mismo problema sin ver la demostración propuesta.
Triaje de expertos
Los expertos identifican qué resultados merecen una revisión profunda.
Reescritura explicativa
Las demostraciones correctas se convierten en formas que los humanos pueden aprender.
Revisión posterior a la publicación
Los repositorios abiertos permiten registrar continuamente errores, simplificaciones y argumentos alternativos.
Esto no reemplaza a las revistas ni a los expertos, sino que les proporciona mejores herramientas para manejar cargas de trabajo a mayor escala.
La Declaración de Leiden plantea cuestiones de gobernanza
La Declaración de Leiden sobre IA y Matemáticas pide un uso responsable de la IA en la investigación matemática.
Sus preocupaciones incluyen:
- Argumentos plausibles pero poco fiables.
- Transparencia en la participación de la IA.
- Atribución de autoría.
- Responsabilidad sobre la corrección.
- Acceso desigual a sistemas propietarios costosos.
- Exageración excesiva.
- Control humano sobre la agenda de investigación.
La publicación de OpenAI respondió a algunas de estas cuestiones con un grado inusual de franqueza.
Atribuyó los argumentos matemáticos al modelo, explicó el papel humano en la preparación de los manuscritos, publicó certificados formales e invitó a la comunidad a revisarlos.
Preguntas que siguen abiertas:
- ¿Quién debe figurar como autor?
- ¿Quién es responsable de los errores?
- ¿Cómo deberían citarse las fuentes de entrenamiento en los hallazgos generados por modelos?
- ¿Cómo debería distribuirse el acceso?
- ¿Cuándo es apropiado anunciar públicamente un resultado?
- ¿Qué evidencia debería acompañar a las afirmaciones de descubrimiento autónomo?
Estas preguntas ya no son temas políticos hipotéticos.
Ahora se aplican a resultados de investigación reales.
Lista de verificación práctica
Paso uno: Confirmar el problema
- Encontrar la formulación autorizada.
- Comprobar sus hipótesis exactas.
- Verificar que la versión reclamada sea pública.
- Identificar resultados preliminares parciales existentes.
Paso dos: Distinguir los hitos
Distinguir entre:
- El modelo propuso una idea.
- El modelo redactó la demostración.
- Un humano editó la demostración.
- La demostración fue formalizada.
- La verificación formal pasó la compilación.
- Un experto aceptó el resultado.
- El resultado superó la revisión de publicación.
Paso tres: Leer la demostración no formal
Buscar hipótesis ocultas, razonamientos circulares, transiciones sin explicar, citas erróneas, cambios de alcance y notación ambigua.
Paso cuatro: Examinar la formulación formal
Confirmar que el teorema en Lean expresa fielmente el contenido matemático previsto.
Paso cinco: Reconstruir el certificado
Para el repositorio de OpenAI:
git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All
Paso seis: Comprobar las dependencias
Revisar los módulos importados, axiomas, placeholders, declaraciones inseguras, definiciones personalizadas y código externo de confianza.
Paso siete: Comparar la demostración no formal con la formal
La demostración formal puede establecer el teorema por una vía diferente a la del manuscrito.
Paso ocho: Intentar una reproducción independiente
Entregar el enunciado del teorema, sin la demostración propuesta, a otro modelo o equipo de investigación.
Paso nueve: Buscar en la literatura
Confirmar la novedad e identificar trabajos superpuestos.
Paso diez: Reflexionar sobre lo aprendido
Un resultado correcto debería ir seguido de preguntas conceptuales:
- ¿Por qué funciona?
- ¿Puede simplificarse?
- ¿Qué generaliza?
- ¿Qué creencias previas deberían cambiar?
¿Qué confirmaría la anécdota cinco?
Si Alpöge o Anthropic publicaran lo siguiente, la afirmación se vería enormemente reforzada:
- La formulación precisa del teorema utilizado.
- Los prompts y la configuración del modelo.
- Manuscritos de demostración de los cinco resultados completos.
- Registros de tiempo y registros de ejecución completos.
- Detalles del entorno sin conexión.
- Métodos de prevención de fugas.
- Comparación con el argumento de Astra.
- Certificados Lean u otro formato verificable por máquina.
- Revisión independiente de expertos.
Los resultados más interesantes no son necesariamente cinco demostraciones idénticas.
Cuatro argumentos genuinamente diferentes podrían ser más valiosos, porque podrían revelar estructuras alternativas subyacentes al mismo resultado.
Lo que la publicación de OpenAI ya ha establecido
OpenAI ha puesto a disposición del público:
- Diez resultados matemáticos detallados.
- Manuscritos completos.
- Un desglose paso a paso del proceso de descubrimiento.
- Diez archivos formalizados.
- Instrucciones de compilación.
- Un repositorio de código con licencia Apache.
- Declaraciones claras sobre las contribuciones de la IA y los humanos.
Esto no sustituye a la revisión por pares.
Pero sí crea un paquete de investigación serio y comprobable.
La responsabilidad ha pasado de "muéstrennos la evidencia" a "evalúen la gran cantidad de evidencia".
Lo que revela la respuesta en 24 horas
La respuesta reportada en la anécdota sugiere que las capacidades de investigación de vanguardia pueden difundirse más rápido que las publicaciones de los modelos.
Las empresas pueden mantener sus modelos en privado.
Pero no pueden asumir que los resultados matemáticos producidos por esos modelos sigan siendo exclusivos mucho tiempo después de su publicación.
Una vez que el enunciado del teorema es público, otros sistemas capaces pueden atacarlo de inmediato.
Por lo tanto, las organizaciones pueden optar por publicar rápidamente la evidencia completa, formalizar antes de anunciar, invitar a la reproducción independiente y coordinarse con expertos del dominio antes de hacer público.
La prioridad sigue importando.
El paquete de evidencia en torno a las reclamaciones de prioridad puede importar igualmente.
Preguntas frecuentes
¿Qué demostró OpenAI Astra?
OpenAI ha publicado diez resultados en matemáticas y ciencias de la computación teórica, incluidos trabajos sobre empaquetamiento de esferas, teoría de códigos, grupos no sofic, la conjetura de rigidez de Connes, circuitos aritméticos, repetición paralela cuántica, dificultad de retículos, la conjetura del volumen de Ehrhart, números de Ramsey y teoría de grafos extremal. OpenAI los describe como resultados que resuelven o avanzan significativamente problemas abiertos de larga data.
¿Está OpenAI Astra disponible públicamente?
No. OpenAI describe a Astra como una versión interna de su próximo modelo principal. Los artículos, los desgloses paso a paso del razonamiento y los certificados de Lean son públicos, pero el modelo Astra utilizado para generar los argumentos no ha sido publicado.
¿El Claude Fable 5 realmente reprodujo las cinco demostraciones de Astra?
El investigador de Anthropic, Levent Alpöge, declaró públicamente que Fable completó los problemas 4 a 8 en 24 horas en condiciones autónomas y sin conexión. Durante la verificación, no se encontraron públicamente los manuscritos completos, registros, indicaciones y certificados de Lean de esas cinco ejecuciones, por lo que esta afirmación debe considerarse preliminar hasta que se publique esa evidencia más completa.
¿Qué cinco problemas supuestamente completó Fable?
Alpöge confirmó la conjetura de rigidez de Connes, la complejidad de circuitos aritméticos, la repetición paralela cuántica, el problema del vector más cercano y la conjetura del volumen de Ehrhart. Afirmó que el resultado de Ehrhart parece usar esencialmente el mismo argumento que Astra, mientras que los otros cuatro resultados podrían diferir.
¿Las demostraciones de OpenAI están verificadas formalmente?
OpenAI publicó pruebas formales en Lean 4 de los diez resultados, junto con instrucciones de compilación y recursos para verificación independiente. Los certificados de Lean que compilan pueden verificar los teoremas formales, pero los expertos aún deben confirmar que los enunciados codificados corresponden fielmente a las afirmaciones matemáticas previstas.
¿Estos diez resultados costaron solo 2000 dólares?
OpenAI indicó que, según las tarifas de la API de Sol, los tokens necesarios para encontrar las soluciones exitosas costaron aproximadamente 2000 dólares. Esa estimación no incluye el entrenamiento del modelo, los intentos de investigación fallidos, el trabajo manual del manuscrito, la infraestructura, la verificación formal ni la revisión matemática externa.
¿Por qué son importantes los certificados de Lean?
Los certificados de Lean permiten que un pequeño núcleo confiable verifique mecánicamente si un teorema formal se deriva de sus hipótesis y dependencias. Reducen el riesgo de fallos lógicos ocultos, pero no confirman la novedad, la importancia ni la fidelidad de las traducciones matemáticas no formales.
¿La IA reemplazará a los matemáticos?
La evidencia actual respalda una transformación en la forma de trabajar en matemáticas, más que una simple afirmación de reemplazo. Los modelos pueden acelerar la búsqueda, la generación de demostraciones, el descubrimiento de contraejemplos y la formalización, mientras que los humanos siguen siendo indispensables en la selección de problemas, la interpretación, el contexto bibliográfico, la revisión y la conversión de demostraciones en comprensión.## Herramientas relacionadas
- Lean: un demostrador interactivo de teoremas y lenguaje de programación para matemáticas formales y verificación de software.
- Mathlib: biblioteca matemática mantenida por la comunidad, utilizada por muchos proyectos de formalización en Lean.
- OpenAI Ten Proofs: repositorio oficial que contiene los certificados de Lean 4 de los diez resultados publicados por Astra.
- Elan: gestor de cadena de herramientas para instalar y administrar versiones de Lean.
- Lake: sistema de construcción y gestor de paquetes de Lean, utilizado para compilar las demostraciones formales de OpenAI.
- Claude Fable 5: modelo público de Anthropic para tareas prolongadas de conocimiento, programación, visión y ciencia.
- Formal Conjectures: repositorio con enunciados de conjeturas matemáticas formalizadas, que respalda flujos de trabajo de investigación verificables por máquina.
Enlaces relacionados
- OpenAI: Diez avances en matemáticas: anuncio oficial de OpenAI, resumen de teoremas, declaraciones de atribución y enlaces a materiales de respaldo.
- Manuscrito completo de 249 páginas: compilación completa de los resultados en matemáticas y ciencias de la computación teórica.
- Desglose paso a paso del descubrimiento matemático: explicación de 62 páginas de OpenAI sobre cómo surgieron las ideas del modelo.
- Certificados de Lean de OpenAI: código fuente, comandos de compilación, módulos de teoremas individuales e instrucciones de verificación independiente.
- Anthropic: Claude Fable 5 y Claude Mythos 5: capacidades oficiales, disponibilidad, medidas de seguridad, identificadores de API y precios de Fable 5.
- Declaración de Leiden sobre IA y matemáticas: iniciativa de la comunidad matemática que abarca confiabilidad, atribución, transparencia, accesibilidad y responsabilidad humana.
- Contraejemplos a la conjetura de Jacobi en dimensión dos o superior: artículo posterior que describe y generaliza el mecanismo detrás de los contraejemplos recientes.
Resumen
OpenAI publicó un paquete de investigación inusualmente completo que abarca diez avances generados por Astra: un manuscrito de 249 páginas, explicaciones detalladas del proceso de descubrimiento y diez demostraciones formales en Lean que pueden ser reconstruidas por investigadores externos.
Se informa que Claude Fable 5 completó cinco de esos problemas en 24 horas, lo que podría representar un nuevo tipo de replicación asistida por modelos. Esta afirmación es significativa, pero su evidencia pública es actualmente menos completa que el manuscrito y los certificados formales proporcionados por OpenAI, por lo que debe etiquetarse claramente como una conclusión pendiente de verificación.
La estimación de 2,000 dólares se entiende mejor como el costo en tokens de una búsqueda exitosa de soluciones a las tarifas de la API de Sol, no como el costo total de todo el proyecto de investigación. El entrenamiento, los intentos fallidos, la preparación manual, la formalización, la infraestructura y la revisión siguen formando parte del costo económico real.
La transformación más amplia es el paso de la "escasez de demostraciones" a la "escasez de revisión". Los modelos pueden generar afirmaciones matemáticas más rápido de lo que los expertos pueden verificar, explicar y contextualizar.
Cuando las demostraciones se vuelven baratas y abundantes, el trabajo más valioso quizás consista en determinar cuáles son correctas, significativas, novedosas y dignas de ser comprendidas.