OpenAI Astra, 10가지 수학적 진전 발표, Claude Fable 5는 24시간 내 5가지 재현 완료 주장
2026년 8월의 한 주말, 최첨단 AI가 벤치마크 수학을 넘어 능동적 연구 영역으로 진입하고 있음을 보여주는 가장 명확한 징후 중 하나가 나타났습니다. 8월 1일, OpenAI는 10가지를 발표했으며

OpenAI Astra의 10가지 수학적 진전과 Claude Fable 5의 24시간 재현 선언
서론
2026년 8월의 한 주말, 최첨단 AI가 벤치마크 수학을 넘어 능동적 연구 영역으로 진입하고 있음을 보여주는 가장 명확한 신호 중 하나가 나타났다.
8월 1일, OpenAI는 《수학 및 이론 컴퓨터 과학의 10가지 진전》을 발표했다. 이러한 성과들은 OpenAI가 차세대 주요 모델로 설명하는 Astra의 내부 버전에 의해 생성되었다.
해당 성과 패키지에는 다음이 포함된다:
- 249페이지 분량의 원고.
- 수학 및 이론 컴퓨터 과학을 아우르는 10가지 성과.
- 62페이지 분량의 발견 과정 상세 설명.
- 10개의 Lean 4 형식 증명.
- 재구성 및 독립 검증을 위한 공개 소스 코드.
24시간도 채 지나지 않아, Anthropic 연구원 Levent Alpöge는 공개적으로 사용 가능한 모델 Claude Fable 5가 10가지 성과 중 5가지를 재현했다고 밝혔다.
그는 해당 5가지가 각각 4번째부터 8번째 문제라고 확인했다:
- Connes 강성 추측.
- 산술 회로 복잡도.
- 양자 병렬 반복.
- 최근접 벡터 문제.
- Ehrhart 부피 추측.
Alpöge는 이러한 실행이 자율적으로 이루어졌으며, 일반적인 프롬프트를 사용했고, 인터넷 접근 권한이 없었으며, OpenAI의 해결책이 컨텍스트에 유출되는 것을 방지하기 위한 조치가 취해졌다고 말했다.
만약 이 다섯 가지 증명이全面的인 공개 검증을 통과한다면, 이 사건은 한 최첨단 모델에 의해 생성된 연구 결과가 때때로 거의 즉시 다른 모델에 의해 독립적으로 재발견될 수 있음을 보여줄 것이다.
그러나 증거는 비대칭적이다. OpenAI는 원고, 과정 상세 설명, 기계 검증 가능한 인증서를 공개했다. 반면 Fable의 주장은 현재 주로 완전한 증명 패키지가 아닌 공개적 진술에 의해 뒷받침된다.
따라서 유용한 결론은 단순히 어떤 모델이 이겼다는 것이 아니다.
AI는 이제 검증, 설명, 귀속 및 검토가 증명 생산 자체보다 확장하기 더 어려울 수 있을 정도로 빠르게 연구 수준의 수학을 생성할 수 있다.

OpenAI, 10가지 연구 수준 성과 발표
OpenAI는 이러한 작업을 오랜 기간 미해결된 공개 문제를 해결하거나 상당한 진전을 이룬 10가지 성과로 설명한다.
해당 주제는 고차원 기하학, 부호 이론, 군론, 작용소 대수, 산술 회로 복잡도, 양자 복잡성, 격자 문제, 볼록 기하학, Ramsey 이론 및 극값 그래프 이론을涵盖한다.
OpenAI는 이러한 수학적 논증이 내부 Astra 모델에 의해 생성되었다고 밝혔다. 이후 인간이 동일한 모델의 도움을 받아 이러한 논증을 원고로 정리했고, 그 후 모델이 Lean에서 각 성과를 형식화했다.
보다 정확한 작업 흐름은 다음과 같다:
Astra가 수학적 논증 탐색
→ 성공적인 논증 선택
→ 인간과 모델이 읽기 가능한 원고 준비
→ 모델이 형식화 수행
Lean에서의 결과
→ 공식 증명서 및 소스 코드 공개
→ 외부 수학자들이 정확성, 참신성 및 중요성 검토
모델의 기여가 핵심이지만, 최종 연구 성과에는 여전히 인간의 준비, 공식 인프라, 소프트웨어 라이브러리 및 전문가 검토가 포함된다.
10대 성과

| 번호 | 분야 | OpenAI가 발표한 결과 |
|---|---|---|
| 1 | 고차원 구체 패킹 | Cohn–Elkies 선형 계획법의 점근적 강도를 결정하고 일반 고차원 패킹 경계를 개선 |
| 2 | 이진 부호 및 구형 부호 | 고전적 고정 거리 부호 경계를 지수적 인자로 개선 |
| 3 | 비sofic 군 | 명시적 비sofic 군을 구성하여 모든 가산 군이 유한 치환 근사를 허용하는지 여부에 대한 문제를 해결 |
| 4 | Connes 강성 추측 | 동일한 군 von Neumann 대수를 갖지만 동형이 아닌 성질 (T) 군을 구성하여 해당 추측을 반증 |
| 5 | 산술 회로 복잡성 | 영구함수 계산에 대한 새로운 하한을 확립, 차수 (n^4/로그 n)의 산술 공식 하한 포함 |
| 6 | 양자 병렬 반복 | 일반 유한 2인 엉킴 게임에 대한 지수적 병렬 반복 성질을 증명 |
| 7 | 최근접 벡터 문제 | 유클리드 CVP 및 관련 격자 문제에 대한 다항식 인자 근사 경도를 제시 |
| 8 | Ehrhart 부피 추측 | 모든 차원에서 지정된 볼록체 클래스에 대한 최적 최대 부피 경계를 증명 |
| 9 | 다색 Ramsey 수 | 다색 삼각형 Ramsey 수에 대한 초지수적 하한을 증명하여 Erdős 문제 183 해결 |
| 10 | 극값 그래프 이론 | Erdős 문제 146 및 180과 관련된 컴팩트성 및 퇴화성 추측을 반증하는 예시를 구성 |
이것들은 일반적인 올림피아드 문제가 아니다. 그중 몇 가지는 수년간 미해결된 문제로, 평가를 위해 깊은 전문 지식이 필요하다.
논문은 발표 내용의 일부일 뿐
OpenAI는 또한 《아이디어는 어떻게 형성되는가: 수학적 발견 노트》라는 제목의 62페이지 문서를 공개했다.
증명이 답하는 것은:
이 정리는 왜 성립하는가?
발견 기록이 답하려고 하는 것은:
시스템은 어떻게 이 논증을 찾았는가?
이것은 서로 다른 두 가지 질문이다.
단계별 분석은 연구자들이 모델이 알려진 아이디어를 재조합했는지, 특정 유추를 식별했는지, 광범위한 탐색을 수행했는지, 새로운 구성을 찾았는지, 아니면 알려진 정리를 예상치 못한 방식으로 사용했는지 판단하는 데 도움이 될 수 있다.
이러한 내용은 여전히 주의해서 접근해야 한다. 모델이 생성한 서술이 반드시 모든 내부 계산의 완벽한 인과 기록은 아니다.
OpenAI는 10개의 Lean 인증서를 공개했다
공식 openai/ten-proofs 저장소에는 각 결과에 해당하는 Lean 모듈이 포함되어 있다.
이 프로젝트는 다음을 사용한다:
Lean 4.32.0
mathlib
Lake
elan을 설치한 후, 공식 README는 사용자에게 다음 명령을 통해 10개의 형식 증명을 모두 빌드하도록 안내한다:
lake exe cache get
lake build All
개별 모듈만 빌드할 수도 있다:
lake build SpherePacking
해당 저장소에는 다음이 포함된다:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.
lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
코드는 Apache 2.0 라이선스로 배포되며, 독립 검증 리소스를 포함합니다.
Lean 인증서가 증명하는 것
Lean은 의존 유형 이론을 기반으로 한 상호작용형 정리 증명기입니다.
Lean 커널을 통해 검증된 증명은 형식화된 정리가 정의, 가정, 가져온 공리와 라이브러리, 그리고 형식화된 증명 항에서 도출되었음을 확립합니다.
이는 비공식 논증에서 발생할 수 있는 많은 오류를 배제합니다:
- 논리적 단계의 누락.
- 잘못된 대수 변환.
- 숨겨진 모순.
- 근거 없는 경우 구분.
- 양화사 불일치.
- 잘못된 중간 보조 정리.
인증서는 저자의 주장이 설득력 있어 보인다고 해서 받아들여지는 것이 아니라 기계적으로 검사될 수 있습니다.
Lean 인증서가 증명할 수 없는 것
형식 검증이 모든 검토 문제를 제거하지는 않습니다.
형식적 진술이 비공식 주장과 일치하는가?
정리 증명기는 인코딩된 진술을 검사합니다. 인간은 여전히 그것이 수학적 문제를 정확히 포착했는지 판단해야 합니다.
정의와 가정이 적절한가?
Lean은 형식적 정의의 귀결을 검증합니다. 정의가 인정된 개념을 반영하는지, 혹은 제목 결과를 약화시키는 숨은 가정이 있는지는 결정할 수 없습니다.
결과가 새로운가?
형식적 정확성은 참신성과 같지 않습니다. 문헌 검토와 전문가 지식이 여전히 필요합니다.
결과가 중요한가?
기계는 정리가 성립함을 검증할 수 있습니다. 그러나 결과가 해당 분야를 변화시켰는지, 가치 있는 아이디어를 도입했는지는 판단할 수 없습니다.
증명이 우리에게 배움을 주는가?
형식적으로 올바른 두 증명은 설명적 가치에서 크게 다를 수 있습니다. 하나는 재사용 가능한 원리를 드러낼 수 있고, 다른 하나는 인간이 내면화하기 어려울 수 있습니다.
형식 검사는 정확성 문제를 해결합니다. 수학적 이해는 여전히 별개의 과제입니다.
Claude Fable 5가 24시간 내에 5개 성과를 재현했다고 주장
OpenAI의 발표가 있은 지 하루도 지나지 않아 Alpöge는 "Fable로 그중 절반을 완료했다"고 썼습니다.
그는 설정을 다음과 같이 설명했습니다:
- 완전 자율.
- 일반 프롬프트 사용.
- 네트워크 접근 없음.
- 정보 유출을 방지하기 위한 추가 예방 조치.

Alpöge는 이후 5건이 4번부터 8번까지임을 확인했습니다.

| OpenAI 프로젝트 | 주제 | Fable 주장의 공개 상태 |
|---|---|---|
| 4 | Connes 강성 추측 | 재현 주장됨 |
| 5 | 산술 회로 복잡도 | 재현 주장됨 |
| 6 | 양자 병렬 반복 | 재현 주장됨 |
| 7 | 최근접 벡터 문제 | 재현 주장됨 |
| 8 | Ehrhart 부피 추측 | 재현 주장됨 |
Alpöge는 Ehrhart 결과가 Astra와 Fable이 본질적으로 동일한 논증을 사용한 것으로 보이는 유일한 사례라고 밝혔습니다.
정확하다면, 나머지 4건은 OpenAI의 접근 방식을 재구성한 것이 아니라 대체 증명일 수 있습니다.
Fable의 증거는 아직 OpenAI의 발표와 동등하지 않습니다
OpenAI의 10건 결과에 대해 공개 패키지에는 정리 진술, 전체 원고, 추론 과정, Lean 소스 코드, 빌드 설명, 독립 검증 리소스가 포함되어 있습니다.
Fable의 5건에 대해 저는 Alpöge의 진술, 언급된 문제 번호, 그가 밝힌 실험 조건, 그리고 Ehrhart 논증에 대한 그의 관찰을 검증할 수 있습니다.
다음을 포함하는 공개 패키지는 검증할 수 없습니다:
- 5건의 전체 원고.
- 정확한 일반 프롬프트.
- 전체 실행 로그.
- 토큰 사용량.
- 모델 설정.
- 유출 방지 방법.
- Lean 인증서.
- 각 논증에 대한 외부 검토.
엄밀한 설명은 다음과 같습니다:
한 Anthropic 연구원이 Fable 5가 통제된 조건에서 10개 문제 중 5개를 독립적으로 완료했다고 공개적으로 보고했으나, 검증 시점에 포괄적인 독립 평가에 필요한 상세 증거는 아직 공개되지 않았습니다.
이는 주장이 거짓임을 증명하지 않습니다. 이는 해당 주장이 OpenAI가 공개한 패키지와 동일한 증거 단계에 아직 도달하지 못했음을 의미합니다.
24시간이 여전히 중요한 이유
위의 유보 사항이 있더라도 시점은 주목할 만합니다.
전통 수학에서 중요한 새 결과는 독립적으로 재구성되는 데 수개월 또는 수년이 걸릴 수 있습니다.
연구자들은 먼저 배경 지식을 학습하고, 원고를 읽고, 기술적 세부 사항을 검토하고, 논증을 재구성하고, 대안을 시도하고, 문제를 논의하고, 검토나 후속 논문을 발표해야 합니다.
강력한 모델은 이 과정의 일부를 압축할 수 있습니다.
한 모델의 결과가 하루 만에 다른 모델에 의해 독립적으로 도달될 수 있다면, AI 생성 발견의 우선권 창은 크게 단축될 수 있습니다.
첫 번째 팀은 문제를 선택하고, 최초의 공개 논증을 제시하고, 원고를 준비하고, 결과를 형식화하고, 다른 사람들이 참조할 수 있는 기록을 만들었으므로 여전히 인정받을 만합니다.
그러나 다른 연구자들이 유사한 문제를 즉시 최첨단 시스템에 할당할 수 있다면, 선점 이점은 수년이 아닌 며칠만 지속될 수 있습니다.
이는 벤치마크 경쟁보다 재현에 더 가깝습니다
대부분의 모델 벤치마크는 알려진 답이 있는 문제에서 시스템을 비교합니다.
벤치마크는 묻습니다:
동일한 테스트 세트가 주어졌을 때, 어떤 모델이 더 높은 점수를 받는가?
이번 세트는 다른 질문을 제기합니다:
두 시스템이 독립적으로 동일한 새로운 최첨단 결과에 도달할 수 있는가?
이는 과학적 재현과 유사합니다.
독립적 재현은 어떤 결과가 단일 모델의 오류, 취약한 프롬프트, 정보 유출, 또는 비정상적인 증명 경로에 의존하는지 밝힐 수 있습니다.
두 개의 독립적인 논증은 특히 서로 다른 사고 방식을 취할 때 신뢰를 강화할 수 있습니다.
그러나 여전히 검토가 필요합니다.
두 모델이 유사한 훈련 소스, 수학적 오해, 최적화 편향, 또는 암묵적 가정을 공유할 수 있습니다.
모델 독립성은 인지적 독립성과 자동으로 동일하지 않습니다.
AI 재현 주장을 평가하는 방법
신뢰할 수 있는 재현 자료 패키지는 다른 사람들이 실험을 반복할 수 있도록 충분한 정보를 공개해야 합니다.
문제 정의
- 정확한 정리 진술.
- 정확한 가정.
- 원본 문제의 버전.
- 해당 문제가 이전에 미해결 문제였음을 보여주는 참고 문헌.
모델 구성
- 모델 이름과 버전.
- 추론 또는 노력 설정.
- 컨텍스트 길이.
- 도구 접근 권한.
- 관련 샘플링 설정.
프롬프트 설계
- 초기 프롬프트.
- 후속 프롬프트.
- 인간의 수정.
- 모든 도메인 프롬프트.
- 모든 스캐폴딩.
유출 통제
네트워크 및 검색 접근 권한.
컨텍스트에 포함된 소스 문서.
모델 스냅샷의 시점.
복제 언어 또는 구조를 감지하는 방법.
실행 기록
- 전체 전사.
- 도구 호출.
- 실패한 시도.
- 실행 시간.
- 토큰 사용량.
- 병렬 실행 횟수.
수학적 증명
- 완전한 증명.
- 검증 가능한 형식 인증서.
- 의존성 목록.
- 최초 증명과의 비교.
외부 검토
- 지정된 검토자.
- 검토 의견.
- 수정 사항.
- 남은 이의 제기.
- 발표 상태.
이러한 정보가 없으면 "독립적 재현"은 여전히 유망한 예비 보고서와 구별하기 어렵습니다.
Fable 5는 공개적으로 이용 가능한 최첨단 모델입니다
Anthropic은 2026년 6월에 Claude Fable 5를 출시했습니다.
Anthropic은 이를 대중 사용과 안전을 위해 설계된 Mythos급 모델로 설명합니다.
회사는 이 모델이 장기 자율 작업, 소프트웨어 엔지니어링, 지식 작업, 비전, 과학 연구 및 장기 컨텍스트 작업에서 특히 뛰어나다고 밝혔습니다.
공식 API 모델 식별자는 다음과 같습니다:
claude-fable-5
Anthropic이 공개한 가격은 다음과 같습니다:
입력 토큰 100만 개당 10달러
출력 토큰 100만 개당 50달러
Fable의 공개 출시는 수학적 스토리와 밀접하게 관련되어 있습니다.
Astra는 여전히 OpenAI 내부에서 미공개 모델입니다.
Fable은 지원되는 Anthropic 제품과 API를 통해 연구자와 개발자가 접근할 수 있습니다.
이를 통해 외부 팀이 자체 연구 질문을 시도하기가 더 쉬워졌지만, 모델 접근만으로 좋은 문제를 선택하거나 출력을 검증하는 데 필요한 전문성이 보장되지는 않습니다.
2000달러라는 숫자는 한계 탐색 비용의 추정치입니다
OpenAI는 Sol API 가격으로 그 10개의 해법을 찾는 데 필요한 총 토큰 수가 약 2000달러라고 밝혔습니다.

이 숫자는 놀랍지만 정확한 라벨이 필요합니다.
이는 해법을 성공적으로 찾는 데 드는 토큰 비용의 추정치로 이해하는 것이 가장 좋습니다.
이는 해당 연구 프로젝트의 총 경제적 비용이 아닙니다.
더 큰 비용 구조는 다음을 포함할 수 있습니다:
- Astra 훈련.
- 추론 인프라 구축 및 운영.
- 연구자의 후보 문제 선별.
- 해결되지 않은 문제에 대한 시도 실행.
- 성공한 문제에 적용했던 실패한 접근 방식.
- 수동 원고 작성.
- 형식화 작업.
- 소프트웨어 엔지니어링.
- 외부 수학 검토.
- 출판 및 유지 관리.
OpenAI는 다른 주요 문제를 시도했지만 성공하지 못했으며, 밀레니엄 문제를 해결하지 못했다고 밝혔습니다.
따라서 이 2000달러 추정치는 다음 질문에 답합니다:
공개 API 요율로 계산할 때 성공적인 탐색의 토큰 비용은 얼마인가?
그러나 다음 질문에는 답하지 않습니다:
모델을 만들고 연구 결과를 생성, 검증 및 출판하는 비용은 얼마인가?
두 숫자 모두 유용하지만 서로 다른 것을 측정합니다.
한계 비용이 여전히 연구 방식을 바꾸는 이유
간접 비용을 고려하더라도, 다시 진지하게 시도하는 낮은 한계 비용은 연구 수행 방식을 바꿀 수 있습니다.
인간 수학자는 특정 경로를 탐색할 가치가 있는지 결정하는 데 몇 주를 보낼 수 있습니다.
반면 AI 시스템은 많은 경로를 병렬로 탐색하도록 요청받을 수 있습니다.
연구자는 모델을 사용하여 다음을 수행할 수 있습니다:
- 반례 검색.
- 추측의 변형 테스트.
- 수학 언어 간 변환.
- 관련 보조정리 탐색.
- 후보 증명 형식화.
- 계산 실험 생성.
- 증명 전략 비교.
- 허점 식별.
- 더 간결한 표현 찾기.
이 효과는 다른 과학 분야의 고처리량 실험과 유사할 수 있습니다.
또 다른 가설을 테스트하는 비용이 낮아지면 테스트되는 가설의 수가 늘어납니다.
희소한 자원은 유망한 문제를 선택하고 그에 따른 후보의 홍수 속에서 평가하는 방향으로 이동합니다.
실패한 시도도 계산에 포함되어야 합니다
성공만 세는 비용 계산은 오해를 불러일으킬 수 있습니다.
어떤 시스템이 100개의 미해결 문제를 할당받아 그중 10개를 해결했다고 가정해 봅시다.
목표가 전체 탐색 프로젝트의 경제성을 측정하는 것이라면, 각 성공적인 해법의 비용에는 90개의 실패에 사용된 자원이 포함되어야 합니다.
전체 계산은 다음을 보고해야 합니다:
총 추론 비용
÷
검증된 결과의 수
성공적인 최종 실행, 실패한 전체 실행, 부분 진행, 인간이 안내한 재시작, 병렬 후보 및 검증 비용을 구분해야 합니다.
이 분모가 없으면 낮은 숫자는 전체 발견 과정의 경제성이 아니라 선별된 성공 사례만을 설명할 수 있습니다.
Fable은 새로운 미해결 문제에도 사용되었습니다
재현 작업에 대한 비판은 간단합니다:
왜 Fable로 Astra의 결과를 다시 수행하게 하는 대신 새로운 미해결 문제를 할당하지 않았는가?
재현과 발견은 서로 다른 목적을 제공합니다.
재현은 신뢰성을 테스트합니다.
새로운 문제를 해결하는 것은 최첨단 능력을 테스트합니다.
Fable은 또한 새로운 수학적 결과와 연결되었습니다.
2026년 7월, Alpöge는 야코비 추측의 3차원 경우에 대한 반례를 보고하고 발견 과정에서 Fable의 역할을 인정했습니다.
이 반례는 형식적으로 검증되었고, 수학자들이 논의했으며, 후속 작업이 이어졌습니다. 7월 말 arXiv에 게시된 논문은 일관된 전체 서술을 제공하고 그 메커니즘을 더 높은 차원으로 일반화했습니다.
이 사건은 반복되는 패턴을 드러냅니다:
- AI가 명확한 대상이나 논증을 생성합니다.
- 형식 도구가 핵심 주장을 검증합니다.
- 인간 수학자가 개념적 설명을 추구합니다.
- 후속 작업이 결과를 일반화합니다.
마지막 단계가 지속적인 수학적 가치의 대부분이 있는 곳일 수 있습니다.
반례와 증명은 서로 다른 검증 부담을 만듭니다
명확한 반례는 때때로 빠르게 검증될 수 있습니다.
어떤 추측이 특정 성질을 가진 대상이 존재하지 않는다고 주장한다면, 유효한 대상 하나로 충분히 반박할 수 있습니다.
검토자는 다음을 확인할 수 있습니다:
- 그 대상이 잘 정의되어 있는가.
- 가정 조건을 충족하는가.
- 결론을 위반하는가.
반면 길고 일반적인 정리는 수백 개의 상호 관련된 보조정리와 문헌에 대한 광범위한 이해가 필요할 수 있습니다.
이 차이는 AI 생성 반례가 빠르게 퍼질 수 있는 이유를 부분적으로 설명합니다.
야코비 사례는 연구자가 빠르게 확인하고 형식화할 수 있을 만큼 충분히 간결했습니다.
Astra의 10개 성과 중 일부는 더 긴 이론적 사슬을 포함하며 커뮤니티가 소화하는 데 더 많은 시간이 걸릴 수 있습니다.
새로운 병목 현상은 인간 검토입니다
핵심 질문은 다음과 같습니다:
AI가 최첨단 증명을 빠르게 생성할 수 있다면, 수학 커뮤니티는 충분히 빠른 속도로 검증할 수 있는가?
연구 결과는 여러 형태의 인정을 받아야 합니다.
논리적 인정
증명이 실제로 가정에서 도출되는가?
Lean이 여기서 도움을 줄 수 있습니다.
의미적 인정
형식화된 진술이 저자가 의미하는 바와 일치하는가?
전문가가 이러한 번역을 확인해야 합니다.
역사적 인정
해당 문제가 실제로 미해결이었으며 결과가 새로운 것인가?
문헌 지식이 필요합니다.
개념적 인정
증명이 새로운 아이디어를 드러내는가, 아니면 단순히 사실을 확인하는가?
수학적 판단이 필요합니다.
커뮤니티 인정
해당 작업이 검토, 논의, 수정 및 적절한 맥락에 배치되었는가?
시간과 제도적 절차가 필요합니다.
AI가 증명 생성을 가속화하는 속도는 대학과 저널이 고도로 전문화된 작업을 검토할 수 있는 전문가 팀을 확충하는 속도를 훨씬 앞지릅니다.
대부분의 사람들은 이러한 결과를 독립적으로 판단할 수 없습니다
강력한 프로그래밍 모델은 애플리케이션을 만들도록 요구하여 테스트할 수 있습니다.
강력한 이미지 모델은 시각적으로 판단할 수 있습니다.
그러나 최첨단 수학은 다릅니다.
대부분의 독자는 비소픽 군의 존재, Connes 강성 추측의 반례, 얽힘 게임의 병렬 반복 정리 또는 격자의 어려움을 직접 평가할 수 없습니다.
그들은 신뢰 체인에 의존합니다:
모델 출력
→ 형식 인증서
→ 증명 도우미 및 라이브러리
→ 분야 전문가
→ 독립 검토자
→ 저널 및 연구 커뮤니티
이것은 투명성을 더 중요하게 만듭니다.
대중이 능력을 직접 검증할 수 없을 때, 신뢰는 증거와 제도에서 나와야 합니다.
![이미지는 Ethan Mollick(@emollick)의 트윗입니다.
OpenAI Astra가 증명한 것은 무엇인가?
이 트윗 내용은 지구상의 거의 모든 인간에게 이러한 상황이 단순히 우리의 능력 범위를 넘어설 뿐만 아니라 이해 범위도 벗어난다는 점을 지적한다. 우리는 오직 전문 수학자들의 판단에 의존하여 이 성과가 놀라운 것인지 평가할 수 있을 뿐이다. 이러한 상황은 여러 분야에서 나타나고 있으며, 그 결과 사람들은 능력 향상을 체감하기 점점 어려워지고 있다. 이 트윗은 문서에서 수학 분야의 최전선 성과를 개인이 판단하기 어렵다는 내용과 맞물려, 수학 분야의 전문성과 투명성의 중요성을 강조한다.
형식적 증명은 여전히 인간이 구축한 인프라에 의존한다
이 사건을 AI가 수학을 고립적으로 대체한 것으로 묘사하는 것은 오해를 불러일으킨다.
이러한 모델들은 다음에 의존한다:
- 수백 년간의 수학 문헌.
- 인간이 만든 정의.
- 발표된 정리.
- 형식적 증명 도우미.
- Mathlib.
- Lean의 신뢰할 수 있는 커널.
- 문제를 선택한 연구자들.
- 결과를 해석하는 전문가들.
- 훈련 및 추론 시스템을 구축한 엔지니어들.
Astra의 Lean 증명서가 가능했던 이유는 방대한 커뮤니티가 수년 동안 수학 기초를 형식화하고 재사용 가능한 라이브러리를 구축했기 때문이다.
모델의 성과는 실재한다.
그것을 뒷받침하는 인간의 인프라도 그만큼 실재한다.
더 정직한 설명은 다음과 같다:
최전선 모델은 인간이 구축하고 유지하는 수학 지식 시스템에서 강력한 참여자가 되고 있다.
정확성은 이해와 같지 않다
증명이 정확할 수는 있어도 통찰력을 주지는 못할 수 있다.
수학자들은 종종 결과가 새로운 불변량, 구성, 재사용 가능한 방법, 분야 간의 연결, 더 간결한 설명, 더 나은 문제를 도입하기 때문에 그 결과를 중요하게 여긴다.
AI가 긴 증명을 생성했을 때, 검토자는 다음과 같이 물을 수 있다:
- 어느 단계에 진정한 핵심 아이디어가 있는가?
- 왜 이 구성이 유효한가?
- 어떤 가정이 필수적인가?
- 이 증명을 단순화할 수 있는가?
- 이 방법이 관련 문제를 해결할 수 있는가?
- 이로부터 어떤 새로운 추측이 도출될 수 있는가?
이것이 정리를 검증하는 것과 그것을 인간의 수학에 통합하는 것 사이의 차이이다.
올바른 결과의 수는 중요하다.
그 결과를 이해로 전환하는 능력은 더 중요할 수 있다.
수학적 취향은 더 가치 있게 될 수 있다
증명 검색이 더 저렴해지면, 문제 선택이 연구 경쟁력의 더 큰 부분이 될 수 있다.
가장 어려운 결정은 다음일 수 있다:
- 어떤 추측이 검증할 가치가 있는가?
- 어떤 버전이 틀렸을 가능성이 있는가?
- 어떤 특수 사례가 일반적인 문제를 풀 수 있는가?
- 어떤 결과가 여러 분야를 연결할 수 있는가?
- 어떤 형식화가 충실하고 신뢰할 수 있는가?
- 어떤 생성된 증명이 재사용 가능한 아이디어를 포함하는가?
이것들은 수학적 취향의 문제이다.
모델이 문제를 생성하는 데 도움이 될 수는 있지만, 현재 연구 생태계는 어떤 문제가 의미 있는지 판단하는 데 여전히 전문가에게 크게 의존한다.
동료 검토는 새로운 기술 스택이 필요할 수 있다
전통적인 동료 검토는 상대적으로 적은 수의 원고를 가정한다.
AI는 기존 저널이 처리할 수 있는 것보다 더 많은 후보 결과를 생성할 수 있다.
검토 과정에는 새로운 층위가 필요할 수 있다.
자동화된 형식 검사
형식화에 적합한 모든 결과에는 기계가 확인할 수 있는 증명서가 첨부되어야 한다.
재현 가능한 생성 기록
프롬프트, 모델 버전, 도구 접근권, 실행 조건이 모두 기록되어야 한다.
자동화된 문헌 검색
시스템은 새로운 주장을 논문 및 정리 데이터베이스와 대조해야 한다.
독립 모델 재현
다른 모델이나 연구팀이 제안된 증명을 보지 않고 동일한 문제를 해결하려 시도할 수 있다.
전문가 분류
전문가가 어떤 결과가 심층 검토할 가치가 있는지 식별한다.
설명적 재작성
올바른 증명을 인간이 학습할 수 있는 형태로 변환한다.
발표 후 검토
공개 저장소를 통해 오류, 단순화, 대체 논증이 지속적으로 기록될 수 있다.
이것이 저널이나 전문가를 대체하는 것이 아니라, 더 큰 규모의 작업량을 처리할 수 있는 더 나은 도구를 제공하는 것이다.
라이덴 선언은 거버넌스 문제를 제기한다
라이덴 AI 및 수학 선언은 수학 연구에서 AI의 책임 있는 사용을 촉구한다.
그 관심사는 다음과 같다:
- 그럴듯하지만 신뢰할 수 없는 논증.
- AI 참여의 투명성.
- 저자 표기.
- 정확성에 대한 책임.
- 고가의 독점 시스템에 대한 불평등한 접근.
- 과대 홍보.
- 연구 의제에 대한 인간의 통제.
OpenAI의 발표는 비범한 직접성으로 이러한 문제 중 일부에 응답했다.
그것은 수학적 논증을 모델에게 귀속시키고, 원고 준비에서 인간의 역할을 설명하고, 형식적 증명서를 발행하고, 커뮤니티 검토를 초대했다.
여전히 남아 있는 문제:
- 누가 저자로 기재되어야 하는가?
- 누가 오류에 책임을 지는가?
- 모델이 생성한 발견은 훈련 출처를 어떻게 인용해야 하는가?
- 접근 권한은 어떻게 배분되어야 하는가?
- 결과는 언제 공개 발표에 적합한가?
- 자율 발견 주장에는 어떤 증거가 첨부되어야 하는가?
이러한 문제는 더 이상 가상의 정책 논제가 아니다.
그것들은 이제 실제 연구 결과에 적용된다.
실용적 검증 체크리스트
1단계: 문제 확인
- 권위 있는 진술을 찾는다.
- 정확한 가정을 확인한다.
- 주장된 버전이 공개되었는지 확인한다.
- 기존의 부분적 선행 결과를 식별한다.
2단계: 이정표 구분
다음을 구분한다:
- 모델이 아이디어를 제안했다.
- 모델이 증명을 작성했다.
- 인간이 증명을 편집했다.
- 증명이 형식화되었다.
- 형식화가 컴파일을 통과했다.
- 전문가가 결과를 수용했다.
- 결과가 발표 검토를 통과했다.
3단계: 비형식 증명 읽기
숨은 가정, 순환 논증, 설명되지 않은 전환, 잘못된 인용, 범위 변화, 모호한 기호를 찾는다.
4단계: 형식적 진술 확인
Lean 정리가 의도된 수학적 내용을 충실히 표현하는지 확인한다.
5단계: 증명서 재구축
OpenAI 저장소의 경우:
git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All
6단계: 의존성 확인
가져온 모듈, 공리, 자리 표시자, 안전하지 않은 선언, 사용자 정의 정의, 신뢰할 수 있는 외부 코드를 확인한다.
7단계: 비형식 증명과 형식 증명 비교
형식 증명은 원고와 다른 경로를 통해 정리를 확립할 수 있다.
8단계: 독립적 재현 시도
정리 진술만 제시하고 제안된 증명은 제공하지 않은 채 다른 모델이나 연구팀에 넘긴다.
9단계: 문헌 검색
새로움을 확인하고 중복되는 작업을 식별한다.
10단계: 배운 것에 대한 성찰
올바른 결과 뒤에는 개념적 질문이 따라와야 한다:
- 왜 그 구성이 작동하는가?
- 단순화할 수 있는가?
- 무엇을 일반화하는가?
- 어떤 기존 신념이 바뀌어야 하는가?
비유 5를 확증할 수 있는 것은 무엇인가?
Alpöge 또는 Anthropic이 다음을 발표한다면, 그 주장은 크게 강화될 것이다:
- 사용된 정확한 정리 표현.
- 프롬프트 및 모델 구성.
- 다섯 가지 결과 전체의 증명 원고.
- 타임스탬프 및 전체 실행 로그.
- 오프라인 환경의 세부 정보.
- 누출 방지 방법.
- Astra 논증과의 비교.
- Lean 증명서 또는 기타 기계가 확인 가능한 형식.
- 독립적인 전문가 검토.
가장 흥미로운 결과는 반드시 똑같은 다섯 개의 증명이 아닐 수 있다.
서로 다른 네 개의 진정한 논증이 더 가치 있을 수 있는데, 그것은 동일한 결과의 배후에 있는 대체 구조를 드러낼 수 있기 때문이다.
OpenAI의 발표가 이미 확립한 것
OpenAI는 공개적으로 다음을 제공했다:
- 열 개의 상세한 수학적 결과.
- 완전한 원고.
- 발견 과정의 단계별 분석.
- 열 개의 형식화된 파일.
- 빌드 지침.
- Apache 라이선스 코드베이스.
- AI와 인간 기여에 대한 명확한 성명.
이것은 동료 검토를 대체할 수 없다.
그러나 진지하고 검토 가능한 연구 패키지를 생성한다.
책임은 "증거를 보여 달라"에서 "방대한 증거를 평가하라"로 이동했다.
24시간 응답이 드러낸 것
비유가 보고한 응답은 최전선 연구 능력이 모델 공개보다 빠르게 확산될 수 있음을 시사한다.
기업은 모델을 비공개로 유지할 수 있다.
그러나 그 모델이 생산한 수학적 결과가 발표 후 오랫동안 독점적으로 유지될 것이라고 가정할 수는 없다.
정리 표현이 공개되면, 다른 유능한 시스템이 즉시 그것을 공격할 수 있다.
따라서 조직은 완전한 증거를 신속하게 발표하고, 발표 전에 형식화하고, 독립적 재현을 초대하고, 공개 전에 분야 전문가와 조정하는 것을 선택할 수 있다.
우선권은 여전히 중요하다.
우선권 주장을 둘러싼 증거 패키지도 그만큼 중요할 수 있다.
자주 묻는 질문
OpenAI Astra는 무엇을 증명했는가?
OpenAI는 구면 채움, 부호 이론, 비sofic 군, Connes 강성 추측, 산술 회로, 양자 병렬 반복, 격자 난제, Ehrhart 부피 추측, Ramsey 수 및 극값 그래프 이론 분야를 포함하여 수학 및 이론 컴퓨터 과학 분야의 10가지 결과를 발표했습니다. OpenAI는 이들을 오랫동안 미해결된 열린 문제를 해결하거나 크게 진전시킨 결과로 설명합니다.
OpenAI Astra는 공개적으로 사용할 수 있나요?
아니요. OpenAI는 Astra를 차세대 주요 모델의 내부 버전으로 설명합니다. 논문, 추론 단계별 해설 및 Lean 증명서는 공개되어 있지만, 논증 생성에 사용된 Astra 모델은 아직 공개되지 않았습니다.
Claude Fable 5가 정말 Astra의 다섯 가지 증명을 재현했나요?
Anthropic 연구원 Levent Alpöge는 Fable이 자율적이고 오프라인 조건에서 24시간 이내에 문제 4~8을 완료했다고 공개적으로 밝혔습니다. 검증 과정에서 이 다섯 번의 실행에 대한 전체 원고, 로그, 프롬프트 및 Lean 증명서는 공개적으로 확인되지 않았으므로, 더 완전한 증거가 공개되기 전까지 이 주장은 잠정적인 것으로 간주해야 합니다.
Fable이 완료한 것으로 알려진 다섯 가지 문제는 무엇인가요?
Alpöge는 Connes 강성 추측, 산술 회로 복잡도, 양자 병렬 반복, 최근접 벡터 문제 및 Ehrhart 부피 추측을 확인했습니다. 그는 Ehrhart 결과는 본질적으로 Astra와 동일한 논증을 사용한 것으로 보이며, 나머지 네 가지 결과는 다를 수 있다고 밝혔습니다.
OpenAI의 증명은 형식적으로 검증되었나요?
OpenAI는 10가지 결과 모두에 대한 Lean 4 형식 증명을 빌드 지침 및 독립 검증 리소스와 함께 공개했습니다. 컴파일된 Lean 증명서는 형식적 정리를 검증할 수 있지만, 전문가들은 코딩된 진술이 의도된 수학적 주장을 충실하게 반영하는지 여전히 확인해야 합니다.
이 10가지 결과는 실제로 2,000달러만 들었나요?
OpenAI는 Sol API 요금 기준으로 성공적인 솔루션을 찾는 데 필요한 토큰 비용이 약 2,000달러였다고 밝혔습니다. 이 추정에는 모델 훈련, 실패한 연구 시도, 수동 원고 작업, 인프라, 형식 검증 또는 외부 수학 검토가 포함되지 않습니다.
Lean 증명서가 왜 중요한가요?
Lean 증명서는 소규모 신뢰할 수 있는 커널이 형식적 정리가 가정과 종속성에서 도출되었는지 기계적으로 검증할 수 있게 해줍니다. 이는 숨겨진 논리적 허점의 위험을 줄여주지만, 참신성, 중요성 또는 비형식적 수학 변환의 충실성을 확증하지는 않습니다.
AI가 수학자를 대체할 것인가?
현재 증거는 단순한 대체 주장보다는 수학 작업 방식의 변화를 지지합니다. 모델은 탐색, 증명 생성, 반례 발견 및 형식화를 가속화할 수 있는 반면, 인간은 문제 선택, 해석, 문헌 맥락, 검토 및 증명을 이해로 전환하는 데 여전히 필수적입니다.## 관련 도구
- Lean: 형식 수학 및 소프트웨어 검증에 사용되는 대화형 정리 증명기이자 프로그래밍 언어입니다.
- Mathlib: 커뮤니티가 유지 관리하는 수학 라이브러리로, 많은 Lean 형식화 프로젝트에서 사용됩니다.
- OpenAI Ten Proofs: Astra의 10가지 공개 결과에 대한 Lean 4 증명서가 포함된 공식 저장소입니다.
- Elan: Lean 버전 설치 및 관리를 위한 도구 체인 관리자입니다.
- Lake: OpenAI의 형식 증명을 컴파일하는 데 사용되는 Lean의 빌드 시스템 및 패키지 관리자입니다.
- Claude Fable 5: 장기 실행 지식, 코딩, 비전 및 과학 작업을 위한 Anthropic의 공개 모델입니다.
- Formal Conjectures: 기계 검증 가능한 연구 워크플로우를 지원하는 형식화된 수학 추측 진술을 포함하는 저장소입니다.
관련 링크
- OpenAI: 수학 분야 10가지 진전: OpenAI의 공식 발표, 정리 요약, 기여 주장 및 지원 자료 링크입니다.
- 전체 249페이지 원고: 수학 및 이론 컴퓨터 과학 결과의 전체 모음입니다.
- 수학적 발견 단계별 해설: 모델의 아이디어 생성 과정에 대한 OpenAI의 62페이지 설명입니다.
- OpenAI Lean 증명서: 소스 코드, 빌드 명령, 개별 정리 모듈 및 독립 검증 지침입니다.
- Anthropic: Claude Fable 5 및 Claude Mythos 5: Fable 5의 공식 기능, 가용성, 안전 조치, API 식별자 및 가격 정보입니다.
- 라이덴 AI 및 수학 선언: 신뢰성, 기여, 투명성, 접근성 및 인간의 책임을 포괄하는 수학계 이니셔티브입니다.
- 2차원 이상에서 야코비 추측의 반례: 최근 반례 뒤에 있는 메커니즘을 설명하고 일반화한 후속 논문입니다.
요약
OpenAI는 Astra가 생성한 10가지 진전을 포함하는 비정상적으로 완전한 연구 패키지, 즉 249페이지 분량의 원고, 상세한 발견 과정 설명, 그리고 외부 연구자가 재구성할 수 있는 10개의 Lean 형식 증명을 공개했습니다.
Claude Fable 5는 24시간 이내에 이 중 다섯 가지 문제를 완료한 것으로 알려졌으며, 이는 새로운 유형의 모델 지원 재현을 나타낼 수 있습니다. 이 주장은 중요하지만, 공개 증거는 현재 OpenAI가 제공한 원고 및 형식 증명서만큼 완전하지 않으므로 검증이 필요한 결론으로 명확히 표시해야 합니다.
2,000달러 추정치는 Sol API 요금 기준으로 성공적인 솔루션 검색에 필요한 토큰 비용으로 이해하는 것이 가장 적절하며, 전체 연구 프로젝트의 총비용은 아닙니다. 훈련, 실패한 시도, 수동 준비, 형식화, 인프라 및 검토는 여전히 실제 경제적 비용의 일부입니다.
더 큰 전환은 '증명의 희소성'에서 '검토의 희소성'으로의 이동입니다. 모델이 수학적 주장을 생성하는 속도는 곧 전문가가 이를 검증하고, 해설하고, 맥락에 배치하는 속도를 초과할 수 있습니다.
증명이 값싸고 풍부해질 때, 가장 가치 있는 작업은 어떤 증명이 올바르고, 의미 있고, 새롭고, 이해할 가치가 있는지 판단하는 것이 될 것입니다.