OpenAI Astra تنشر عشر تقدمات رياضية، وClaude Fable 5 تدّعي إنجاز خمس عمليات إعادة إنتاج في غضون 24 ساعة
في عطلة نهاية أسبوع من أغسطس 2026، ظهرت واحدة من أوضح العلامات حتى الآن على أن الذكاء الاصطناعي المتطور يتجاوز المعايير الرياضية ليدخل مجال البحث النشط. في 1 أغسطس، نشرت OpenAI عشر تقدمات

عشرة تقدمات رياضية من OpenAI Astra وادعاء إعادة إنتاجها خلال 24 ساعة من Claude Fable 5
مقدمة
في أحد عطلات نهاية الأسبوع من أغسطس 2026، ظهرت واحدة من أوضح المؤشرات حتى الآن على أن الذكاء الاصطناعي المتطور يتجاوز الرياضيات المعيارية ويتجه نحو مجال البحث النشط.
في 1 أغسطس، نشرت OpenAI وثيقة بعنوان "عشرة تقدمات في الرياضيات وعلوم الحاسوب النظرية". تم توليد هذه النتائج بواسطة نسخة داخلية من نموذج Astra، الذي تصفه OpenAI بأنه نموذجها الرئيسي من الجيل التالي.
تتضمن حزمة النتائج:
- مخطوطة من 249 صفحة.
- عشرة نتائج تغطي الرياضيات وعلوم الحاسوب النظرية.
- وثيقة من 62 صفحة تفصّل عملية الاكتشاف.
- عشرة براهين رسمية بلغة Lean 4.
- كود مصدري مفتوح لإعادة البناء والتحقق المستقل من الشهادات.
بعد أقل من 24 ساعة، صرّح الباحث في Anthropic، ليفينت ألبوغي، بأن النموذج المتاح للعموم Claude Fable 5 قد أعاد إنتاج خمسة من النتائج العشرة.
وأكد أن هذه النتائج الخمسة هي المسائل من 4 إلى 8:
- حدسية الثبات لـ Connes.
- تعقيد الدوائر الحسابية.
- التكرار المتوازي الكمومي.
- مسألة أقرب متجه.
- حدسية حجم إيرهارت.
قال ألبوغي إن هذه العمليات كانت مستقلة، واستُخدمت فيها مطالبات عامة، دون الوصول إلى الإنترنت، مع اتخاذ تدابير احترازية تهدف إلى منع تسرب حلول OpenAI إلى سياق النموذج.
إذا صمدت هذه البراهين الخمسة أمام المراجعة العامة الشاملة، فإن هذا الحدث سيشير إلى أن النتائج البحثية التي ينتجها نموذج متطور يمكن أحيانًا إعادة اكتشافها بشكل مستقل بواسطة نموذج آخر بشكل شبه فوري.
ومع ذلك، فإن الأدلة غير متماثلة. فقد نشرت OpenAI مخطوطات وتفاصيل العملية وشهادات قابلة للتحقق آليًا. بينما يعتمد ادعاء Fable حاليًا بشكل أساسي على تصريحات عامة، وليس على حزمة براهين كاملة.
لذلك، فإن الاستنتاج المفيد ليس مجرد أن نموذجًا ما تفوق على آخر.
أصبح الذكاء الاصطناعي الآن قادرًا على توليد رياضيات بمستوى بحثي بسرعة كافية بحيث قد يصبح التحقق والتفسير والإسناد والمراجعة أكثر صعوبة في التوسع من إنتاج البراهين نفسه.

OpenAI تنشر عشرة نتائج بمستوى بحثي
تصف OpenAI هذه الأعمال بأنها عشرة نتائج تحل مسائل مفتوحة أو تحقق تقدمًا كبيرًا في مسائل ظلت معلقة لفترات طويلة.
تغطي هذه الموضوعات الهندسة عالية الأبعاد، ونظرية الترميز، ونظرية الزمر، وجبر المؤثرات، وتعقيد الدوائر الحسابية، والتعقيد الكمومي، ومسائل الشبكات، والهندسة المحدبة، ونظرية رامزي، ونظرية الرسوم البيانية المتطرفة.
تقول OpenAI إن هذه البراهين الرياضية تم توليدها بواسطة نموذج Astra الداخلي. ثم قام البشر بمساعدة النموذج نفسه في تنظيم هذه البراهين في مخطوطات، وبعد ذلك قام النموذج بإضفاء الطابع الرسمي على كل نتيجة في Lean.
مسار العمل الأكثر دقة هو:
بحث Astra عن البرهان الرياضي
→ اختيار البرهان الناجح
→ إعداد البشر والنموذج لمخطوطة قابلة للقراءة
→ النموذج يقوم بالإضفاء الرسمي
النتيجة في Lean
→ نشر الشهادات الرسمية والكود المصدري
→ خبراء الرياضيات الخارجيون يتحققون من الصحة والجدة والأهمية
مساهمة النموذج هي جوهرية، لكن النتيجة البحثية النهائية لا تزال تشمل الإعداد البشري والبنية التحتية الرسمية والمكتبات البرمجية والمراجعة المتخصصة.
النتائج العشر

| الرقم | المجال | النتيجة المنشورة من OpenAI |
|---|---|---|
| 1 | تكديس الكرات عالي الأبعاد | تحديد القوة التقاربية للبرمجة الخطية لـ Cohn–Elkies وتحسين الحد العام لتكديس الأبعاد العالية |
| 2 | الترميزات الثنائية والكروية | تحسين الحدود الكلاسيكية لترميزات المسافة الثابتة بعامل أسي |
| 3 | الزمر غير sofic | بناء زمرة غير sofic صريحة، مما يحل مسألة ما إذا كانت كل زمرة قابلة للعد تقبل تقريبًا بالتباديل المنتهية |
| 4 | حدسية الثبات لـ Connes | بناء زمر من نوع (T) لها نفس جبر فون نيومان الزمري لكنها غير متشاكلة، مما يدحض الحدسية |
| 5 | تعقيد الدوائر الحسابية | إنشاء حدود دنيا جديدة لحساب الدائمات، بما في ذلك حد أدنى للصيغ الحسابية من الرتبة (n^4/log n) |
| 6 | التكرار المتوازي الكمومي | إثبات خاصية التكرار المتوازي الأسية للألعاب المتشابكة الثنائية المحدودة العامة |
| 7 | مسألة أقرب متجه | تقديم صعوبة تقريب بعامل متعدد الحدود لمسألة CVP الإقليدية ومسائل شبكات ذات صلة |
| 8 | حدسية حجم إيرهارت | إثبات الحد الأمثل الأقصى للحجم لفئة محددة من الأجسام المحدبة في كل بُعد |
| 9 | أعداد رامزي متعددة الألوان | إثبات حدود دنيا فوق أسية لأعداد رامزي الثلاثية متعددة الألوان، مما يحل مسألة Erdős رقم 183 |
| 10 | نظرية الرسوم البيانية المتطرفة | بناء أمثلة تدحض الحدسيات المتعلقة بالتراص والانحلال المرتبطة بمسألتي Erdős رقم 146 و180 |
هذه ليست مسائل أولمبياد عادية. العديد منها يتعلق بمسائل ظلت معلقة لسنوات وتتطلب خبرة عميقة لتقييمها.
المخطوطة ليست سوى جزء مما نُشر
نشرت OpenAI أيضًا وثيقة من 62 صفحة بعنوان "كيف تشكلت الأفكار: ملاحظات حول الاكتشاف الرياضي".
البرهان يجيب على:
لماذا هذه النظرية صحيحة؟
سجل الاكتشاف يحاول الإجابة على:
كيف وجد النظام هذا البرهان؟
هذان سؤالان مختلفان.
يمكن أن يساعد التحليل التدريجي الباحثين في تحديد ما إذا كان النموذج قد أعاد تجميع أفكار معروفة، أو حدد تشابهًا معينًا، أو أجرى بحثًا واسعًا، أو وجد بناءً جديدًا، أو استخدم نظريات معروفة بطريقة غير متوقعة.
لا تزال هذه المحتويات بحاجة إلى التعامل معها بحذر. فالسرد الذي يولده النموذج ليس بالضرورة سجلاً سببيًا كاملاً ودقيقًا لكل عملية حسابية داخلية.
OpenAI نشرت عشر شهادات Lean
يحتوي المستودع الرسمي openai/ten-proofs على وحدة Lean واحدة لكل نتيجة.
يستخدم المشروع:
Lean 4.32.0
mathlib
Lake
بعد تثبيت elan، يرشد ملف README الرسمي المستخدمين إلى بناء جميع البراهين الرسمية العشرة عبر الأمر:
lake exe cache get
lake build All
كما يمكن بناء وحدة معينة بشكل منفصل:
lake build SpherePacking
يحتوي المستودع على:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.lean
lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
يُصدر الكود بموجب رخصة Apache 2.0، ويتضمن موارد تحقق مستقلة.
ماذا تُثبت شهادة Lean
Lean هو مُثبّت نظريات تفاعلي قائم على نظرية الأنواع الاعتمادية.
الإثباتات التي تم التحقق منها عبر نواة Lean تُثبت أن النظرية المُعمّاة مشتقة من التعريفات والافتراضات والبديهيات والمكتبات المستوردة وعنصر الإثبات المُعمّى.
هذا يستبعد العديد من الأخطاء التي قد تظهر في الحجج غير الرسمية:
- خطوات منطقية مفقودة.
- تحويلات جبرية غير صالحة.
- تناقضات خفية.
- حالات غير مبررة.
- عدم تطابق في المُكمّمات.
- تمهيدات وسيطة خاطئة.
يمكن فحص الشهادة آليًا، بدلاً من قبولها لمجرد أن المؤلف يبدو مقنعًا.
ما لا تُثبته شهادة Lean
التحقق الرسمي لا يلغي جميع قضايا المراجعة.
هل البيان الرسمي يتوافق مع الادعاء غير الرسمي؟
مُثبّت النظريات يفحص البيان المُرمّز. لا يزال على البشر الحكم على ما إذا كان يلتقط المسألة الرياضية بدقة.
هل التعريفات والافتراضات مناسبة؟
يتحقق Lean من استنتاجات التعريفات المُعمّاة. لا يمكنه تحديد ما إذا كانت هذه التعريفات تعكس المفاهيم المقبولة، أو ما إذا كانت هناك افتراضات خفية تُضعف النتيجة المذكورة في العنوان.
هل النتيجة جديدة؟
الصحة الشكلية لا تساوي الجِدّة. لا يزال من الضروري إجراء مراجعة الأدبيات والاستعانة بالخبراء.
هل النتيجة مهمة؟
يمكن للآلة التحقق من أن النظرية قائمة. لكنها لا تستطيع الحكم على ما إذا كانت النتيجة تُحدث تغييرًا في المجال أو تُدخل أفكارًا ذات قيمة.
هل يُعلّمنا الإثبات شيئًا؟
قد يختلف إثباتان صحيحان شكليًا بشكل كبير في القيمة التفسيرية. قد يكشف أحدهما عن مبادئ قابلة لإعادة الاستخدام؛ وقد يصعب استيعاب الآخر من قبل البشر.
الفحص الشكلي يعالج مسألة الصحة. الفهم الرياضي يظل مهمة مستقلة.
Claude Fable 5 يدّعي إعادة إنتاج خمس نتائج خلال 24 ساعة
بعد أقل من يوم من إعلان OpenAI، كتب Alpöge أنه "أنجز نصفها باستخدام Fable".
وصف الإعداد على النحو التالي:
- مستقل تمامًا.
- استخدام محفزات عامة.
- لا وصول إلى الإنترنت.
- تدابير إضافية لمنع تسرب المعلومات.

أكّد Alpöge لاحقًا أن النتائج الخمس هي من الرقم 4 إلى الرقم 8.

| مشروع OpenAI | الموضوع | الحالة العلنية لادعاء Fable |
|---|---|---|
| 4 | حدسية Connes للصلابة | يُدّعى إعادة إنتاجه |
| 5 | تعقيد الدوائر الحسابية | يُدّعى إعادة إنتاجه |
| 6 | التكرار المتوازي الكمي | يُدّعى إعادة إنتاجه |
| 7 | مسألة أقرب متجه | يُدّعى إعادة إنتاجه |
| 8 | حدسية حجم Ehrhart | يُدّعى إعادة إنتاجه |
قال Alpöge إن نتيجة Ehrhart هي الوحيدة التي يبدو أن Astra وFable استخدما فيها حجة متطابقة جوهريًا.
إذا كان ذلك دقيقًا، فقد تكون النتائج الأربع الأخرى إثباتات بديلة، وليست إعادة بناء لمسار OpenAI.
أدلة Fable ليست بعد مكافئة لإصدار OpenAI
بالنسبة لنتائج OpenAI العشر، تتضمن الحزمة العلنية بيانات النظريات والمخطوطات الكاملة وعمليات الاستدلال وكود Lean المصدر وتعليمات البناء وموارد التحقق المستقلة.
بالنسبة لنتائج Fable الخمس، يمكنني التحقق من تصريحات Alpöge وأرقام المشكلات المذكورة وشروطه التجريبية الموصوفة وملاحظاته حول حجة Ehrhart.
لا يمكنني التحقق من حزمة علنية تتضمن:
- خمس مخطوطات كاملة.
- المحفز العام الدقيق.
- سجلات التنفيذ الكاملة.
- استخدام الرموز.
- إعدادات النموذج.
- طرق منع التسرب.
- شهادات Lean.
- مراجعة خارجية لكل حجة.
الوصف الدقيق هو:
باحث من Anthropic أفاد علنًا أن Fable 5 أكمل بشكل مستقل خمسًا من عشر مسائل في ظل ظروف خاضعة للرقابة، ولكن عند التحقق، فإن الأدلة التفصيلية اللازمة للتقييم المستقل الشامل لم تُنشر بعد.
هذا لا يُثبت أن الادعاء كاذب. وهذا يعني أن الادعاء لم يصل بعد إلى نفس مرحلة الأدلة التي وصلت إليها حزمة OpenAI المنشورة.
لماذا تظل 24 ساعة مهمة
حتى مع التحفظات المذكورة أعلاه، فإن التوقيت جدير بالملاحظة.
في الرياضيات التقليدية، قد تستغرق النتيجة الجديدة الكبرى شهورًا أو حتى سنوات لإعادة بنائها بشكل مستقل.
يحتاج الباحثون أولاً إلى تعلّم الخلفية وقراءة المخطوطة وفحص التفاصيل التقنية وإعادة بناء الحجة وتجربة البدائل ومناقشة المشكلات ونشر مراجعة أو ورقة متابعة.
يمكن لنموذج قوي أن يضغط أجزاءً من هذه العملية.
إذا كانت نتائج نموذج ما يمكن أن يصل إليها نموذج آخر بشكل مستقل في يوم واحد، فقد تتقلص نافذة الأولوية للاكتشافات المولّدة بالذكاء الاصطناعي بشكل كبير.
يستحق الفريق الأول التقدير لاختيارهم المشكلات وتقديم الحجة العامة الأولى وإعداد المخطوطة وتعميم النتيجة وإنشاء سجل يمكن للآخرين الرجوع إليه.
ومع ذلك، عندما يتمكن باحثون آخرون من تكليف أنظمة متطورة فورًا بمسائل مماثلة، فقد تستمر ميزة الريادة أيامًا فقط بدلاً من سنوات.
هذا أقرب إلى التكرار منه إلى المنافسة المعيارية
تقارن معظم معايير النماذج الأنظمة على مسائل ذات إجابات معروفة.
المعيار يسأل:
بالنظر إلى نفس مجموعة الاختبار، أي نموذج يحصل على درجة أعلى؟
هذه المجموعة تطرح سؤالاً مختلفًا:
هل يمكن لنظامين أن يتوصلا بشكل مستقل إلى نفس النتيجة الحدودية الجديدة؟
هذا يشبه التكرار العلمي.
يمكن للتكرار المستقل أن يكشف ما إذا كانت النتيجة تعتمد على خطأ نموذج واحد، أو محفز هش، أو تسرب معلومات، أو مسار إثبات غير معتاد.
يمكن لحجتين مستقلتين أن تعززا الثقة، خاصة عندما تسلكان مسارات مختلفة.
لكنهما لا تزالان بحاجة إلى المراجعة.
قد يتشارك النموذجان في مصادر تدريب متشابهة، أو سوء فهم رياضي، أو تحيزات تحسين، أو افتراضات ضمنية.
الاستقلالية النموذجية لا تساوي تلقائيًا الاستقلالية المعرفية.
كيفية تقييم ادعاء إعادة إنتاج بواسطة الذكاء الاصطناعي
يجب أن تكشف حزمة مواد إعادة الإنتاج ذات المصداقية عن معلومات كافية ليتمكن الآخرون من تكرار التجربة.
تعريف المشكلة
- بيان النظرية الدقيق.
- الافتراضات الدقيقة.
- نسخة المشكلة المصدرية.
- المراجع التي تُثبت أن المشكلة كانت مفتوحة سابقًا.
تكوين النموذج
- اسم النموذج والإصدار.
- إعدادات الاستدلال أو الجهد.
- طول السياق.
- صلاحيات الوصول إلى الأدوات.
- إعدادات أخذ العينات ذات الصلة.
تصميم المحفزات
- المحفز الأولي.
- المحفزات اللاحقة.
- التصحيحات اليدوية.
- أي تلميحات مجال.
- أي سقالات.
التحكم في التسرب
صلاحيات الوصول إلى الشبكة والبحث.
المستندات المصدرية المضمنة في السياق.
وقت التقاط لقطة النموذج.
الطريقة المستخدمة لكشف اللغة أو البنية المكررة.
سجل التنفيذ
- النسخ الكامل.
- استدعاءات الأدوات.
- المحاولات الفاشلة.
- وقت التشغيل.
- استخدام الرموز.
- عدد مرات التشغيل المتوازي.
الإثبات الرياضي
- الإثبات الكامل.
- الشهادات الرسمية القابلة للتحقق.
- قائمة التبعيات.
- المقارنة مع الإثبات الأول.
المراجعة الخارجية
- المراجعون المذكورون بالاسم.
- آراء المراجعين.
- التصحيحات المجراة.
- الاعتراضات المتبقية.
- حالة النشر.
بدون هذه المعلومات، يظل من الصعب التمييز بين "إعادة الإنتاج المستقلة" والتقارير الأولية الواعدة.
Fable 5 هو نموذج رائد متاح للعموم
أصدرت Anthropic نموذج Claude Fable 5 في يونيو 2026.
وصفت Anthropic النموذج بأنه من فئة Mythos موجه للاستخدام العام ومزوّد بضمانات أمان.
صرّحت الشركة أن النموذج يتميز بشكل خاص في العمل الذاتي طويل الأمد، وهندسة البرمجيات، والعمل المعرفي، والرؤية، والبحث العلمي، والمهام ذات السياقات الطويلة.
المعرّف الرسمي للنموذج في واجهة برمجة التطبيقات هو:
claude-fable-5
التسعير المعلن من Anthropic هو:
10 دولارات لكل مليون رمز إدخال
50 دولارًا لكل مليون رمز إخراج
يرتبط الإصدار العام من Fable ارتباطًا وثيقًا بقصة الرياضيات.
لا يزال Astra نموذجًا غير منشور من داخل OpenAI.
يمكن للباحثين والمطورين الوصول إلى Fable عبر منتجات Anthropic المدعومة وواجهة برمجة التطبيقات.
هذا يجعل من السهل على الفرق الخارجية تجربة أسئلتهم البحثية الخاصة، على الرغم من أن الوصول إلى النموذج لا يضمن الخبرة اللازمة لاختيار الأسئلة الجيدة أو التحقق من صحة المخرجات.
الرقم 2000 دولار هو تقدير للتكلفة الحدية للبحث
صرّحت OpenAI أن إجمالي الرموز المطلوبة للعثور على تلك الحلول العشرة بأسعار واجهة Sol يبلغ حوالي 2000 دولار.

هذا الرقم مذهل، لكنه يحتاج إلى وصف دقيق.
من الأفضل فهمه على أنه تقدير لتكلفة الرموز للوصول إلى الحل بنجاح.
إنه ليس التكلفة الاقتصادية الكلية لمشروع البحث.
قد تشمل حزمة التكاليف الأكبر:
- تدريب Astra.
- بناء وتشغيل البنية التحتية للاستدلال.
- قيام الباحثين بفرز المرشحين من المسائل.
- تشغيلات تجريبية على مسائل غير محلولة.
- الطرق الفاشلة على المسائل الناجحة.
- كتابة المخطوطة يدويًا.
- العمل الرسمي.
- هندسة البرمجيات.
- المراجعة الرياضية الخارجية.
- النشر والصيانة.
ذكرت OpenAI أنها جرّبت مسائل كبرى أخرى دون نجاح، ولم تحل أيًا من مسائل جائزة الألفية.
لذا، فإن تقدير الـ 2000 دولار يجيب على:
ما هي تكلفة رموز البحث الناجح بأسعار واجهة برمجة التطبيقات العامة؟
وهو لا يجيب على:
ما هي تكلفة إنشاء النموذج وتوليد النتائج والتحقق منها ونشرها؟
كلا الرقمين مفيد، لكنهما يقيسان شيئين مختلفين.
لماذا قد تغيّر التكلفة الحدية طريقة البحث حتى مع احتساب التكاليف غير المباشرة
حتى مع أخذ التكاليف غير المباشرة في الاعتبار، فإن انخفاض التكلفة الحدية لمحاولة جادة أخرى قد يغيّر طريقة إجراء البحث.
قد يقضي عالم الرياضيات البشري أسابيع في تحديد ما إذا كان مسار معين يستحق الاستكشاف.
بينما يمكن طلب من نظام الذكاء الاصطناعي استكشاف مسارات عديدة بالتوازي.
قد يستخدم الباحثون النموذج من أجل:
- البحث عن أمثلة مضادة.
- اختبار صيغ مختلفة من التخمينات.
- التحويل بين اللغات الرياضية.
- البحث عن مبرهنات ذات صلة.
- إضفاء الطابع الرسمي على البراهين المرشحة.
- توليد تجارب حسابية.
- مقارنة استراتيجيات الإثبات.
- تحديد الثغرات.
- البحث عن صياغات أبسط.
قد يكون هذا التأثير مشابهًا للتجارب عالية الإنتاجية في العلوم الأخرى.
عندما تنخفض تكلفة اختبار فرضية أخرى، يرتفع عدد الفرضيات التي يتم اختبارها.
تتجه الموارد النادرة نحو اختيار المسائل الواعدة وتقييم موجة المرشحين الناتجة.
المحاولات الفاشلة يجب أيضًا احتسابها
حساب التكاليف بإحصاء النجاحات فقط قد يعطي صورة مضللة.
افترض أن نظامًا خُصص له 100 مسألة مفتوحة وحلّ 10 منها.
إذا كان الهدف هو قياس اقتصاديات مشروع بحثي كامل، فإن تكلفة كل حل ناجح يجب أن تشمل الموارد المنفقة على المحاولات التسعين الفاشلة.
يجب أن يبلغ الحساب الكامل عن:
إجمالي تكلفة الاستدلال
÷
عدد النتائج الموثق نجاحها
ويجب أن يميّز بين التشغيلات النهائية الناجحة، والتشغيلات الكاملة الفاشلة، والتقدم الجزئي، وإعادة التشغيل الموجهة بشريًا، والمرشحين المتوازيين، وتكاليف التحقق.
بدون هذا المقام، قد يصف الرقم المنخفض فقط الحالات الناجحة المنتقاة، وليس اقتصاديات عملية الاكتشاف بأكملها.
تم استخدام Fable أيضًا في مسألة مفتوحة جديدة
أحد الانتقادات الموجهة لعمل إعادة الإنتاج كان مباشرًا:
لماذا لا نجعل Fable يعيد إنتاج نتائج Astra بدلًا من تكليفه بمسائل مفتوحة جديدة؟
إعادة الإنتاج والاكتشاف يخدمان أغراضًا مختلفة.
إعادة الإنتاج تختبر الموثوقية.
حل مسائل جديدة يختبر القدرات الحدودية.
ارتبط Fable أيضًا
بنتيجة رياضية جديدة.
في يوليو 2026، أفاد ألبوغي بمثال مضاد لفرضية جاكوبي في الحالة ثلاثية الأبعاد، ونسب إلى Fable الدور الذي لعبه في عملية الاكتشاف.
تم التحقق من المثال المضاد رسميًا، وناقشه علماء الرياضيات، وتلته أعمال متابعة. ورقة نُشرت على arXiv في أواخر يوليو قدمت عرضًا كاملًا متماسكًا ووسّعت الآلية إلى أبعاد أعلى.
كشفت هذه الحادثة عن نمط متكرر:
- ينتج الذكاء الاصطناعي كائنًا أو حجة محددة.
- تتحقق الأدوات الرسمية من الادعاء الأساسي.
- يبحث علماء الرياضيات البشريون عن تفسير مفاهيمي.
- تعمل الأعمال اللاحقة على تعميم النتيجة.
قد تكون المرحلة الأخيرة هي المكان الذي تكمن فيه معظم القيمة الرياضية الدائمة.
الأمثلة المضادة والبراهين تفرض أعباء تحقق مختلفة
يمكن أحيانًا فحص المثال المضاد الصريح بسرعة.
إذا كان التخمين يدّعي عدم وجود كائنات بخصائص معينة، فإن كائنًا صالحًا واحدًا يكفي لدحضه.
يمكن للمراجع التحقق من:
- أن الكائن معرّف جيدًا.
- أنه يحقق شروط الفرضية.
- أنه يخالف النتيجة.
أما النظرية العامة الطويلة فقد تتطلب مئات المبرهنات المترابطة وفهمًا واسعًا للأدبيات.
هذا الاختلاف يفسر جزئيًا سرعة انتشار الأمثلة المضادة المولدة بالذكاء الاصطناعي.
كان مثال جاكوبي مضغوطًا بما يكفي ليتمكن الباحثون من فحصه بسرعة وإضفاء الطابع الرسمي عليه.
بعض نتائج Astra العشرة تنطوي على سلاسل نظرية أطول وقد تستغرق من المجتمع وقتًا أطول لاستيعابها.
الاختناق الجديد يكمن في المراجعة البشرية
السؤال الأساسي هو:
إذا كان الذكاء الاصطناعي قادرًا على توليد براهين متقدمة بسرعة، فهل يمكن للمجتمع الرياضي التحقق منها بالسرعة الكافية؟
تحتاج النتيجة البحثية إلى أشكال متعددة من الاعتراف.
الاعتراف المنطقي
هل يستنتج البرهان فعلًا من الفرضيات؟
يمكن أن يساعد Lean في هذا.
الاعتراف الدلالي
هل يتطابق البيان الرسمي مع المعنى الذي قصده المؤلف؟
يجب على الخبراء فحص هذا التحويل.
الاعتراف التاريخي
هل كانت المسألة غير محلولة فعلًا، وهل النتيجة جديدة؟
يتطلب هذا معرفة بالأدبيات.
الاعتراف المفاهيمي
هل يكشف البرهان عن أفكار جديدة، أم يؤكد حقيقة فقط؟
يتطلب هذا حكمًا رياضيًا.
اعتراف المجتمع
هل خضع العمل للمراجعة والنقاش والتصحيح ووُضع في سياقه الصحيح؟
يتطلب هذا وقتًا وعمليات مؤسسية.
تسريع الذكاء الاصطناعي لتوليد البراهين يفوق بكثير قدرة الجامعات والمجلات على توسيع فرق الخبراء القادرين على مراجعة الأعمال المتخصصة للغاية.
معظم الناس لا يمكنهم تقييم هذه النتائج بأنفسهم
يمكن اختبار نموذج برمجة قوي بطلب بناء تطبيق.
يمكن الحكم على نموذج صور قوي بصريًا.
أما الرياضيات المتقدمة فمختلفة.
لا يمكن لمعظم القراء تقييم وجود مجموعة غير sofric، أو مثال مضاد لفرضية كونيس المتعلقة بالتراص، أو نظرية التكرار المتوازي للألعاب المتشابكة، أو صعوبة المشكلات على الشبكات.
يعتمدون على سلسلة من الثقة:
مخرجات النموذج
→ شهادة رسمية
→ مساعد البرهان ومكتباته
→ خبراء المجال
→ مراجعون مستقلون
→ المجلات والمجتمع البحثي
هذا يجعل الشفافية أكثر أهمية، وليس أقل.
عندما لا يستطيع الجمهور فحص قدرة معينة مباشرة، فإن الثقة
يجب أن تأتي من الأدلة والمؤسسات.
![تغريدة من إيثان موليك، اسم المستخدم @emollick.
يشير محتوى التغريدة إلى أن هذا الموقف، بالنسبة لكل إنسان تقريبًا على وجه الأرض، لا يتجاوز قدراتنا فحسب، بل يتجاوز قدرتنا على الفهم أيضًا. لا يمكننا الاعتماد إلا على علماء الرياضيات المتخصصين للحكم على ما إذا كان هذا الإنجاز مذهلاً. هذا الموقف يظهر في العديد من المجالات، وبالتالي يصبح من الصعب على الناس بشكل متزايد الشعور بتحسن القدرات. تتناغم التغريدة مع ما ورد في الوثيقة حول صعوبة الحكم الشخصي على الإنجازات الحدودية في مجال الرياضيات، وتؤكد على أهمية الاحترافية والشفافية في المجال الرياضي.
الإثباتات الرسمية لا تزال تعتمد على بنية تحتية بشرية
وصف هذا الحدث بأنه استبدال الرياضيات بشكل منعزل بواسطة الذكاء الاصطناعي هو وصف مضلل.
تعتمد هذه النماذج على:
- قرون من الأدبيات الرياضية.
- تعريفات أنشأها البشر.
- نظريات منشورة.
- مساعدات الإثبات الرسمي.
- مكتبة Mathlib.
- نواة Lean الموثوقة.
- باحثون يختارون المسائل.
- خبراء يفسرون النتائج.
- مهندسون يبنون أنظمة التدريب والاستدلال.
أصبحت شهادة Lean الخاصة بـ Astra ممكنة بفضل مجتمع ضخم أمضى سنوات في ترسيخ الأساسات الرياضية وبناء مكتبات قابلة لإعادة الاستخدام.
إنجازات النموذج حقيقية.
البنية التحتية البشرية الداعمة لها حقيقية بنفس القدر.
الوصف الأكثر صدقًا هو:
النماذج الحدودية أصبحت لاعبًا قويًا في نظام المعرفة الرياضية الذي يبنيه البشر ويحافظون عليه.
الصحة لا تعني الفهم
يمكن أن يكون الإثبات صحيحًا دون أن يكون ملهمًا.
غالبًا ما يقيّم علماء الرياضيات نتيجة ما لأنها تقدم ثوابت جديدة، أو إنشاءات، أو طرقًا قابلة لإعادة الاستخدام، أو روابط بين المجالات، أو تفسيرات أبسط، أو أسئلة أفضل.
عندما يولد الذكاء الاصطناعي إثباتًا طويلًا، قد يسأل المراجعون:
- أي خطوة تحتوي على الفكرة الجوهرية الحقيقية؟
- لماذا ينجح هذا الإنشاء؟
- أي الافتراضات أساسية؟
- هل يمكن تبسيط هذا الإثبات؟
- هل يمكن لهذه الطريقة حل مسائل ذات صلة؟
- ما هي التخمينات الجديدة التي يمكن استنتاجها من هذا؟
هذا هو الفرق بين التحقق من نظرية ودمجها في الرياضيات البشرية.
عدد النتائج الصحيحة مهم.
القدرة على تحويل هذه النتائج إلى فهم قد تكون أكثر أهمية.
الذوق الرياضي قد يصبح أكثر قيمة
إذا أصبح البحث عن الإثباتات أرخص، فقد يصبح اختيار المسائل جزءًا أكبر من الميزة البحثية.
أصعب القرارات قد تكون:
- أي تخمين يستحق التحقق؟
- أي نسخة قد تكون خاطئة؟
- أي حالة خاصة قد تكشف المسألة العامة؟
- أي نتيجة يمكن أن تربط مجالات متعددة؟
- أي صياغة رسمية موثوقة وأمينة؟
- أي إثبات مولّد يحتوي على أفكار قابلة لإعادة الاستخدام؟
هذه مسائل تتعلق بالذوق الرياضي.
قد تساعد النماذج في توليد المسائل، لكن النظام البيئي البحثي الحالي لا يزال يعتمد بشكل كبير على الخبراء للحكم على أي المسائل ذات معنى.
مراجعة الأقران قد تحتاج إلى مجموعة تقنيات جديدة
تفترض مراجعة الأقران التقليدية أن عدد المخطوطات محدود نسبيًا.
قد ينتج الذكاء الاصطناعي نتائج مرشحة أكثر مما يمكن للمجلات الحالية معالجته.
قد تحتاج عملية المراجعة إلى مستويات جديدة.
فحص رسمي آلي
كل نتيجة قابلة للصياغة الرسمية يجب أن تكون مصحوبة بشهادة قابلة للفحص آليًا.
سجلات توليد قابلة لإعادة الإنتاج
يجب أرشفة المطالبات وإصدارات النماذج والوصول إلى الأدوات وظروف التشغيل.
استرجاع أدبيات آلي
يجب على الأنظمة مقارنة الادعاءات الجديدة مع قواعد بيانات الأوراق والنظريات.
إعادة إنتاج بواسطة نماذج مستقلة
يمكن لنماذج مختلفة أو فرق بحثية مختلفة محاولة حل نفس المسألة دون الاطلاع على الإثبات المقترح.
فرز الخبراء
يحدد الخبراء النتائج التي تستحق مراجعة معمقة.
إعادة كتابة تفسيرية
تُحوَّل الإثباتات الصحيحة إلى أشكال يمكن للبشر التعلم منها.
مراجعة ما بعد النشر
تسمح المستودعات المفتوحة بتوثيق مستمر للأخطاء والتبسيطات والحجج البديلة.
هذا لا يحل محل المجلات أو الخبراء، بل يزودهم بأدوات أفضل للتعامل مع عبء عمل أكبر.
إعلان ليدن يطرح قضايا حوكمة
يدعو إعلان ليدن حول الذكاء الاصطناعي والرياضيات إلى استخدام مسؤول للذكاء الاصطناعي في البحث الرياضي.
تشمل اهتماماته:
- حجج تبدو معقولة لكنها غير موثوقة.
- الشفافية في مشاركة الذكاء الاصطناعي.
- نسب الإسهامات.
- المسؤولية عن الصحة.
- عدم المساواة في الوصول إلى الأنظمة الخاصة المكلفة.
- المبالغة في الترويج.
- السيطرة البشرية على الأجندات البحثية.
استجاب إصدار OpenAI لبعض هذه القضايا بشكل مباشر وغير عادي.
فهو ينسب الحجج الرياضية إلى النموذج، ويوضح دور البشر في إعداد المخطوطة، وينشر الشهادات الرسمية، ويدعو المجتمع إلى المراجعة.
الأسئلة التي لا تزال قائمة:
- من يجب أن يُدرج كمؤلف؟
- من يتحمل مسؤولية الأخطاء؟
- كيف يجب أن تُنسب الاكتشافات المولّدة بالنماذج إلى مصادر التدريب؟
- كيف يجب توزيع حقوق الوصول؟
- متى تكون النتائج مناسبة للإعلان العام؟
- ما الأدلة التي يجب أن تصاحب ادعاءات الاكتشاف المستقل؟
هذه الأسئلة لم تعد مجرد مواضيع سياسات افتراضية.
إنها تنطبق الآن على نتائج بحثية حقيقية.
قائمة تحقق عملية
الخطوة الأولى: تأكيد المسألة
- العثور على البيان الموثوق.
- التحقق من افتراضاته الدقيقة.
- التأكد من أن النسخة المدعاة متاحة للعموم.
- تحديد النتائج الأولية الجزئية الموجودة.
الخطوة الثانية: تمييز المراحل
التمييز بين:
- النموذج اقترح فكرة.
- النموذج كتب إثباتًا.
- حرر البشر الإثبات.
- تمت صياغة الإثبات رسميًا.
- نجح التحقق الرسمي في الترجمة.
- قبل الخبراء النتيجة.
- اجتازت النتيجة مراجعة النشر.
الخطوة الثالثة: قراءة الإثبات غير الرسمي
البحث عن افتراضات خفية، وحجج دائرية، وانتقالات غير مفسرة، واقتباسات خاطئة، وتغييرات في النطاق، ورموز غامضة.
الخطوة الرابعة: فحص البيان الرسمي
التأكد من أن نظرية Lean تعبر بأمانة عن المحتوى الرياضي المقصود.
الخطوة الخامسة: إعادة بناء الشهادة
لمستودع OpenAI:
git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All
الخطوة السادسة: فحص التبعيات
فحص الوحدات المستوردة، والبديهيات، والعناصر النائبة، والتصريحات غير الآمنة، والتعريفات المخصصة، والكود الخارجي الموثوق.
الخطوة السابعة: مقارنة الإثبات غير الرسمي والرسمي
قد يثبت الإثبات الرسمي النظرية عبر مسار مختلف عن المخطوطة.
الخطوة الثامنة: محاولة إعادة إنتاج مستقلة
إعطاء بيان النظرية — دون الإثبات المقترح — لنموذج آخر أو فريق بحث آخر.
الخطوة التاسعة: استرجاع الأدبيات
تأكيد الجدة وتحديد الأعمال المتداخلة.
الخطوة العاشرة: التفكير فيما تم تعلمه
ينبغي أن تتبع النتيجة الصحيحة أسئلة مفاهيمية:
- لماذا ينجح هذا؟
- هل يمكن تبسيطه؟
- ما الذي يعممه؟
- أي معتقدات سابقة يجب تغييرها؟
ما الذي يمكن أن يؤكد الحكاية الخامسة؟
إذا نشرت Alpöge أو Anthropic ما يلي، فإن هذا الادعاء سيتعزز بشكل كبير:
- الصياغة الدقيقة للنظرية المستخدمة.
- المطالبات وتكوين النموذج.
- مخطوطات إثباتات النتائج الخمس جميعها.
- الطوابع الزمنية وسجلات التشغيل الكاملة.
- تفاصيل البيئة دون اتصال.
- طرق منع التسريب.
- مقارنة مع حجة Astra.
- شهادات Lean أو صيغ أخرى قابلة للفحص آليًا.
- مراجعة خبراء مستقلة.
النتائج الأكثر إثارة للاهتمام ليست بالضرورة الإثباتات الخمسة المتطابقة.
أربعة حجج مختلفة حقًا قد تكون أكثر قيمة، لأنها قد تكشف عن بنى بديلة وراء نفس النتائج.
ما أثبته إصدار OpenAI بالفعل
وفرت OpenAI علنًا:
- عشرة نتائج رياضية مفصلة.
- مخطوطات كاملة.
- تحليلًا خطوة بخطوة لعملية الاكتشاف.
- عشرة ملفات رسمية.
- تعليمات البناء.
- قاعدة كود مرخصة بموجب Apache.
- بيانات واضحة حول مساهمات الذكاء الاصطناعي والبشر.
هذا لا يغني عن مراجعة الأقران.
لكنه ينشئ بالفعل حزمة بحثية جادة وقابلة للفحص.
تحولت المسؤولية من "أرونا الأدلة" إلى "قيّم قدرًا كبيرًا من الأدلة".
ما كشفه رد 24 ساعة
يشير الرد الذي ورد في الحكاية إلى أن القدرات البحثية الحدودية قد تنتشر أسرع من إصدارات النماذج.
يمكن للشركات إبقاء نماذجها خاصة.
لكنها لا تستطيع افتراض أن النتائج الرياضية المنتجة بواسطة هذا النموذج ستبقى حصرية لفترة طويلة بعد النشر.
بمجرد أن يصبح بيان النظرية علنيًا، يمكن لأنظمة قادرة أخرى مهاجمته فورًا.
لذلك، قد تختار المنظمات نشر الأدلة الكاملة بسرعة، وإجراء الصياغة الرسمية قبل الإعلان، ودعوة عمليات إعادة إنتاج مستقلة، والتنسيق مع خبراء المجال قبل الكشف العام.
الأولوية لا تزال مهمة.
حزمة الأدلة المحيطة بادعاء الأولوية قد تكون بنفس القدر من الأهمية.
أسئلة شائعة
ماذا أثبتت OpenAI Astra؟
نشرت OpenAI عشر نتائج في مجال الرياضيات وعلوم الحاسوب النظرية، بما في ذلك أعمال حول تكديس الكرات، ونظرية الترميز، والزمر غير السوفية، وحدسية كونيس للصلابة، والدوائر الحسابية، والتكرار الموازي الكمومي، وصعوبة الشبكات، وحدسية الحجم لإيرهارت، وأعداد رامزي، ونظرية البيان المتطرفة. وصفتها OpenAI بأنها نتائج تحل أو تدفع بشكل كبير مسائل مفتوحة طال انتظار حلها.
هل Astra من OpenAI متاح للعموم؟
لا. تصف OpenAI Astra بأنه نسخة داخلية من نموذجها الرئيسي التالي. الأوراق البحثية، والتفكيك التدريجي للاستدلال، وشهادات Lean متاحة للعموم، لكن نموذج Astra المستخدم لتوليد البراهين لم يُنشر بعد.
هل أعاد Claude Fable 5 بالفعل إنتاج براهين Astra الخمسة؟
صرّح الباحث في Anthropic، ليفينت ألبيغ، علنًا أن Fable أكمل المسائل 4-8 في غضون 24 ساعة في ظل ظروف مستقلة وغير متصلة بالإنترنت. أثناء عملية التحقق، لم يتم العثور علنًا على المخطوطات الكاملة وسجلات التشغيل والطلبات وشهادات Lean لهذه التشغيلات الخمسة، لذا ينبغي اعتبار هذا الادعاء أوليًا حتى يتم نشر هذا الدليل الأكثر اكتمالًا.
ما المسائل الخمس التي يُزعم أن Fable أكملها؟
أكّد ألبيغ حدسية كونيس للصلابة، وتعقيد الدوائر الحسابية، والتكرار الموازي الكمومي، ومسألة أقرب متجه، وحدسية الحجم لإيرهارت. وقال إن نتيجة إيرهارت تبدو جوهرية باستخدام نفس الحجج التي استخدمتها Astra، بينما قد تختلف النتائج الأربع الأخرى.
هل تم التحقق رسميًا من براهين OpenAI؟
نشرت OpenAI براهين رسمية بصيغة Lean 4 لجميع النتائج العشر، مع تعليمات البناء وموارد تحقق مستقلة. يمكن لشهادات Lean المجمَّعة التحقق من النظريات الرسمية، لكن الخبراء ما زالوا بحاجة إلى تأكيد أن البيانات المرمّزة تطابق بشكل أمين الادعاءات الرياضية المقصودة.
هل كلفت هذه النتائج العشر 2000 دولار فقط؟
قالت OpenAI إنه وفقًا لأسعار Sol API، بلغت تكلفة الرموز المطلوبة لإيجاد الحلول الناجحة حوالي 2000 دولار. لا يشمل هذا التقدير تدريب النموذج، أو محاولات البحث الفاشلة، أو العمل اليدوي على المخطوطات، أو البنية التحتية، أو التحقق الرسمي، أو المراجعة الرياضية الخارجية.
لماذا تُعد شهادات Lean مهمة؟
تسمح شهادات Lean لنواة موثوقة صغيرة بالتحقق آليًا من أن النظريات الرسمية مشتقة من فرضياتها وتبعياتها. تقلل من خطر الثغرات المنطقية الخفية، لكنها لا تؤكد الجدة أو الأهمية أو أمانة التحويل الرياضي غير الرسمي.
هل سيحل الذكاء الاصطناعي محل علماء الرياضيات؟
تدعم الأدلة الحالية تغييرًا في طريقة ممارسة الرياضيات، وليس مجرد ادعاء بالاستبدال. يمكن للنماذج تسريع البحث، وتوليد البراهين، واكتشاف الأمثلة المضادة، والتحقق الرسمي، بينما يظل البشر لا غنى عنهم في اختيار المسائل، والتفسير، والسياق الأدبي، والمراجعة، وتحويل البراهين إلى فهم.## أدوات ذات صلة
- Lean: مُثبِت نظريات تفاعلي ولغة برمجة用于 الرياضيات الرسمية والتحقق من البرمجيات.
- Mathlib: مكتبة رياضية يحافظ عليها المجتمع، وتستخدمها许多 مشاريع الإثبات الرسمي بلغة Lean.
- OpenAI Ten Proofs: المستودع الرسمي الذي يحتوي على شهادات Lean 4 لنتائج Astra العشر المنشورة.
- Elan: أداة إدارة سلاسل أدوات لتثبيت وإدارة إصدارات Lean.
- Lake: نظام البناء ومدير الحزم الخاص بـ Lean، المستخدم لتجميع البراهين الرسمية من OpenAI.
- Claude Fable 5: النموذج العام من Anthropic للمهام طويلة الأمد في المعرفة والبرمجة والرؤية والعلوم.
- Formal Conjectures: مستودع يحتوي على بيانات حدسيات رياضية رسمية، يدعم سير عمل بحثي قابل للتحقق آليًا.
روابط ذات صلة
OpenAI: عشر تقدمات في الرياضيات: الإعلان الرسمي من OpenAI، مع ملخصات النظريات، وبيانات النسبة، وروابط المواد الداعمة.
المخطوطة الكاملة المكونة من 249 صفحة: التجميع الكامل لنتائج الرياضيات وعلوم الحاسوب النظرية.
تفكيك تدريجي للاكتشاف الرياضي: شرح من OpenAI من 62 صفحة حول كيفية نشوء أفكار النموذج.
شهادات Lean من OpenAI: الشيفرة المصدرية، وأوامر البناء، ووحدات النظريات الفردية، وتعليمات التحقق المستقلة.
Anthropic: Claude Fable 5 وClaude Mythos 5: القدرات الرسمية لـ Fable 5، وتوافره، وإجراءات السلامة، ومعرفات API، والتسعير.
إعلان ليدن للذكاء الاصطناعي والرياضيات: مبادرة من المجتمع الرياضي تغطي الموثوقية، والإسناد، والشفافية، وإمكانية الوصول، والمسؤولية البشرية.
أمثلة مضادة لحدسية جاكوبي في بُعدين أو أكثر: ورقة لاحقة تصف وتعمم الآلية الكامنة وراء الأمثلة المضادة الأخيرة.
الخلاصة
نشرت OpenAI حزمة بحثية كاملة بشكل استثنائي تغطي عشر تقدمات مولّدة بواسطة Astra: مخطوطة من 249 صفحة، وشرحًا مفصلاً لعملية الاكتشاف، وعشرة براهين رسمية بلغة Lean يمكن إعادة بنائها من قبل باحثين خارجيين.
يُذكر أن Claude Fable 5 أكمل خمسًا من هذه المسائل في غضون 24 ساعة، وهو ما قد يمثل نوعًا جديدًا من النسخ بمساعدة النماذج. هذا الادعاء مهم، لكن أدلته العامة حاليًا أقل اكتمالًا من المخطوطات والشهادات الرسمية التي قدمتها OpenAI، لذا يجب وضع علامة واضحة عليه باعتباره استنتاجًا بانتظار التحقق.
التقدير البالغ 2000 دولار من الأنسب فهمه على أنه: تكلفة الرموز المميزة للبحث الناجح عن حلول بأسعار Sol API، وليس التكلفة الإجمالية لمشروع البحث بأكمله. التدريب، والمحاولات الفاشلة، والإعداد اليدوي، والتحقق الرسمي، والبنية التحتية، والمراجعة تظل جميعها جزءًا من التكلفة الاقتصادية الفعلية.
التحول الأكبر هو من "ندرة البراهين" إلى "ندرة المراجعة". قد تولّد النماذج قريبًا ادعاءات رياضية بوتيرة أسرع من قدرة الخبراء على التحقق منها وشرحها ووضعها في سياقها.
عندما تصبح البراهين رخيصة ومتاحة بسهولة، قد يكون العمل الأكثر قيمة هو تحديد أيها صحيح، وذي معنى، وجديد، ويستحق الفهم.