Anthropic تكشف عن النموذج الداخلي 2: قدرات شاملة تتجاوز قليلاً Claude Mythos 5

كشفت Anthropic بصمت في تقرير المخاطر الصادر في أغسطس 2026 عن نموذج ذكاء اصطناعي داخلي غير منشور يُدعى النموذج 2. هذا النموذج ليس إصدارًا عامًا من Claude، ولم تعلن Anthropic عنه...

发布于 2026年8月19日generalGEO 评分: 04 次阅读
Anthropic تكشف عن النموذج الداخلي 2: قدرات شاملة تتجاوز قليلاً Claude Mythos 5

أنthropic تكشف عن النموذج الداخلي 2: قدرات إجمالية أقوى قليلاً من Claude Mythos 5

مقدمة

كشفت أنthropic بهدوء عن نموذج ذكاء اصطناعي داخلي غير منشور باسم Model 2 في تقرير المخاطر الصادر في أغسطس 2026.

هذا النموذج ليس نسخة عامة من Claude، ولم تصدره أنthropic كمنتج. ظهر في التقرير لأن الشركة أدرجت الأنظمة المتطورة وشبه المتطورة الموزعة داخلياً ضمن تقييمها لمخاطر الذكاء الاصطناعي المتقدم.

وفقاً لأنthropic، فإن Model 2 أقوى قليلاً في القدرات الإجمالية من Claude Mythos 5.

التحسين حقيقي، لكن الشركة امتنعت بحذر عن وصفه بأنه قفزة جيلية كبيرة.

يشير ملخص أنthropic الخاص إلى أن Model 2 يتفوق بوضوح على Mythos 5 في العديد من المهام المتعلقة بالاستخدام الداخلي، لكنه لا يزال بعيداً عن مستوى القفزة في القدرات التي لاحظتها الشركة عند الانتقال من Claude Opus 4.6 إلى Claude Mythos Preview.

هذا يجعل Model 2 مهماً من زاوية مختلفة.

بدلاً من أن يمثل قدوم جيل جديد كلياً، يبدو أشبه بمواصلة أنthropic للتحسين المستمر لقدرات النماذج المتطورة.

كما يقدم التقرير نقطة بيانات محددة: في تقييم CoBench الداخلي لأنthropic، حصل Model 2 على 62.8%، متقدماً على Claude Mythos 5 الذي حصل على 50.3% وعلى Claude Mythos Preview الذي حصل على 54.8%.

يذكر التقرير نفسه نظاماً داخلياً آخر باسم Model 1، مما أثار تكهنات خارجية حول ما إذا كانت أنthropic تطور سلسلة من النماذج الداخلية قبل تخصيص أسماء منتجات Claude العامة لها.

التقرير الرسمي يدعم هذا التفسير جزئياً فقط.

أكدت أنthropic أن Model 1 وModel 2 هما نموذجان داخليان، لكنها لم تشير إلى أن Model 2 هو الخليفة الرسمي لـ Model 1، ولا إلى أن أياً منهما سيصبح إصداراً مستقبلياً من Claude.

Model 2 أقوى إجمالاً بشكل طفيف من Claude Mythos 5

النقطة الأساسية التي تناولها تقرير AIBase دقيقة: أنthropic ذكرت أن Model 2 أقوى إجمالاً من Claude Mythos 5.

وصف تقرير المخاطر الصادر في أغسطس Model 2 بأنه:

  • يتفوق على Mythos 5 في بعض المجالات.
  • أضعف من Mythos 5 في مجالات أخرى.
  • أقوى قليلاً في القدرات الإجمالية.

كما ذكرت أنthropic أن تقييمها النوعي التقريبي يشير إلى أن Model 2 يوفر تحسينات واضحة في العديد من المهام المتعلقة بالاستخدام الداخلي.

هذه الصياغة مهمة.

لا ينبغي وصف Model 2 بأنه يتفوق على Mythos 5 في كل معيار أو في كل مجال مرتبط بالمخاطر.

يظهر التقرير نفسه أن النتائج المقارنة تختلف باختلاف المهمة.

على سبيل المثال، في بعض تقييمات المخاطر الكيميائية والبيولوجية، ذكرت أنthropic أن النتائج المحدودة لـ Model 2 مماثلة أو أضعف من Claude Mythos 5.

في تقييم آخر للسلوك الخفي، كان Model 2 أقوى قليلاً من Mythos 5، لكنه لا يزال أضعف بوضوح من Mythos Preview.

لذلك، فإن أنصف تلخيص هو:

Model 2
= أقوى قليلاً في القدرات الإجمالية
≠ أفضل في كل تقييم

التحسين ليس قفزة جيلية كبيرة

يؤكد النص الأصلي على أن هذا التحسين محدود نسبياً.

ذكرت أنthropic أنه بالمقارنة مع...

نفس الوضع.

قارنت الشركة تحديداً Model 2 بالقفزات السابقة، أي الانتقال من Claude Opus 4.6 إلى Claude Mythos Preview.

تلك القفزة مثلت تحسناً أكبر في القدرات.

أما Model 2 فليس كذلك.

قالت أنthropic إن هذا النموذج الداخلي الأحدث يُظهر تحسينات واضحة في العديد من المهام الداخلية، لكنه ليس تغييراً جذرياً بنفس الحجم.

وينعكس ذلك أيضاً في مؤشر قدرات داخلي آخر.

تحتفظ أنthropic بنسخة داخلية من مؤشر Epoch للقدرات باسم AECI، والذي يجمع أداء عدة معايير داخلية.

بناءً على البيانات المحدودة، حصل Model 2 على نحو:

1.5 نقطة AECI

أعلى من Claude Mythos 5.

أوضحت أنthropic أن هذا التقدير ينطوي على هامش خطأ كبير.

كما ذكرت أن هذا التحسن أقل من حجم التحسن بين Mythos Preview وMythos 5.

وهذا يدعم الوصف الرئيسي للمقال: يبدو Model 2 تحسيناً تدريجياً للنموذج المتطور، وليس مرحلة قدرات جديدة واضحة.

CoBench يقدم أوضح مقارنة عامة

الدليل الأكثر تحديداً في التقرير يأتي من CoBench.

تصف أنthropic CoBench بأنه تقييم داخلي مصمم لاختبار قدرة النموذج على حل مشاكل البحث والتطوير الفعلية للشركة، بدلاً من استخدام معايير عامة كبديل.

يضع هذا التقييم النموذج في نقطة زمنية من تاريخ البنية التحتية لأنthropic.

يتلقى النموذج لقطة من الموارد، بما في ذلك:

  • الكود.
  • السجلات.
  • الوثائق الداخلية.
  • الرسائل الداخلية التاريخية.

ثم يُطلب منه تشخيص الأسباب الجذرية لمشاكل تقنية كان قد حلها مهندسو أنthropic سابقاً.

النسخة الحالية الموصوفة في تقرير أغسطس تتضمن:

449 مشكلة

مستمدة أساساً من مشاكل تم حلها بين فبراير وأبريل 2026.

تأتي هذه المشاكل من أقسام في المؤسسة التقنية لأنthropic تشمل المجالات التالية:

  • تدريب النماذج.
  • تشغيل البنية التحتية للنماذج.
  • تصحيح الأنظمة التقنية.
  • هندسة الأبحاث.

هذا يجعل CoBench ذا صلة خاصة بتركيز أنthropic على أتمتة البحث والتطوير في الذكاء الاصطناعي بواسطة الذكاء الاصطناعي.

Model 2 يحصل على 62.8% في CoBench

النتائج المقارنة المعروضة في التقرير هي كما يلي:

النموذج نتيجة CoBench
Claude Sonnet 4.6 12.0%
Claude Opus 4.6 15.6%
Claude Opus 4.7 27.4%
Claude Mythos 5 50.3%
Claude Mythos Preview 54.8%
Model 2 62.8%

لذلك، يتصدر Model 2 النماذج الموضحة في الرسم البياني.

الفارق بينه وبين Mythos 5 هو:

62.8% - 50.3% = 12.5 نقطة مئوية

على هذا المعيار الداخلي المحدد، هذه فجوة كبيرة.

لكنها لا تزال أقل بكثير من النتيجة التي تعتقد أنthropic أنها كافية للاستبدال الكامل لموظفيها التقنيين.

أنthropic تقدر أن الاستبدال الكامل للباحثين يتطلب نتيجة تبلغ حوالي 85%

ذكرت أنthropic أنه بناءً على المراجعة اليدوية للمهام وعملية التقييم، فإن النظام الذي يمكنه فعلياً استبدال علماء ومهندسي أبحاث أنthropic بالكامل يجب أن يحقق على الأقل نتيجة تقارب:

85%

لذلك، فإن نتيجة Model 2 البالغة 62.8% لا تزال بعيدة عن هذا الرقم.

كما حذرت أنthropic من أن هذا المعيار ليس مقياساً مثالياً للتكافؤ مع البشر.

مجموعة البيانات

تمت تصفيتها عمداً للمشاكل الصعبة.

تم اختيار معظم المهام لأن Mythos Preview فشل فيها على الأقل مرة واحدة من ثلاث محاولات.

ذكرت أنthropic أنه بدون هذه التصفية، كان حجم مجموعة البيانات سيتضاعف تقريباً.

هناك قيود أخرى:

  • بعض الاستنتاجات البشرية التاريخية قد لا تكون مثالية.
  • بعض الإجابات قد تكون غامضة.
  • التقييم الآلي قد يخطئ.

لن يحصل النموذج على جميع الصلاحيات أو الدعم البنيوي الذي قد يمتلكه مهندسو Anthropic الفعليون.

لذلك، من الأفضل اعتبار CoBench إشارة داخلية مفيدة، وليس معيارًا عامًا لقياس ما إذا كان نموذج الذكاء الاصطناعي قادرًا على استبدال الباحثين.

منح Mythos 5 المزيد من الرموز لا يسد الفجوة تمامًا

اختبرت Anthropic أيضًا ما إذا كانت نتائج CoBench تعكس ببساطة نقصًا في ميزانية الاستدلال.

تبلغ ميزانية الرموز المستخدمة في هذا المخطط حوالي:

300,000 رمز

للسيناريوهات التي تم تقييمها.

عندما زادت Anthropic ميزانية Mythos 5 إلى:

900,000 رمز

لم ترتفع نتائجه سوى بحوالي:

3 نقاط مئوية

وهذا يشير إلى أن جزءًا على الأقل من تفوق Model 2 لا يمكن تفسيره بمجرد منح Mythos 5 المزيد من الرموز.

لا تزال Anthropic ترى أن تحسين السقالات وأطر التقييم يمكن أن يحسّن النتائج، لذا فإن هذا المعيار لا يقيس أوزان النموذج بحد ذاتها بشكل خالص.

هندسة الوكلاء مهمة.

Model 2 يُستخدم على نطاق واسع داخليًا في Anthropic

لم يتم إصدار Model 2 بعد، لكنه ليس مجرد نقطة فحص مخبرية غير مستخدمة.

صرّحت Anthropic أن Model 2 و Claude Mythos 5 هما من بين أقوى النماذج الداخلية وأكثرها استخدامًا.

يتم استخدامهما بشكل مكثف في:

  • البرمجة.
  • توليد البيانات.
  • سير عمل الوكلاء الآخرين.
  • البحث.
  • الهندسة.

كما ذكرت Anthropic أن كلا النموذجين يُستخدمان عبر نشر وكلاء مستمرين، وليس فقط في جلسات الدردشة التفاعلية.

هذه النقطة مهمة لأن جزءًا من تقرير المخاطر يركز على كيفية قيام أنظمة الذكاء الاصطناعي بأتمتة أجزاء متزايدة من أعمال البحث والتطوير الخاصة بشركة Anthropic نفسها.

ذكر التقرير أن Claude يكتب الآن الغالبية العظمى من التعليمات البرمجية المدمجة في مستودع الإنتاج الخاص بـ Anthropic.

ومع ذلك، لم تستنتج Anthropic أن نماذجها قادرة حاليًا على استبدال باحثيها بالكامل.

ترى الشركة أن الذكاء الاصطناعي يسرّع العمل الداخلي بشكل جوهري، لكن تقييماتها لشهر أغسطس لا تزال أقل من عتبة التسارع الكبير للبحث والتطوير بقيادة الذكاء الاصطناعي المنصوص عليها في سياسة التوسع المسؤول.

Model 2 لم يكمل بعد مجموعة التقييمات الكاملة قبل النشر لدى Anthropic

يتضمن التقرير أيضًا تحذيرًا مهمًا آخر.

لقد اجتاز Model 2 عملية مراجعة النشر الداخلية لدى Anthropic، لكنه لم يخضع بعد لمجموعة التقييمات الكاملة التي تشغّلها الشركة عادةً قبل النشر الخارجي.

لذلك، تقول Anthropic إن درجة ثقتها في فهمها لـ Model 2 أقل قليلاً من ثقتها في النماذج المُصدرة التي خضعت لتقييم شامل.

هذا مهم عند تفسير مقارنات المعايير.

يمكن لنتيجة CoBench واحدة أن تشير إلى أن Model 2 يُظهر أداءً قويًا في مهام البحث والتطوير الداخلية.

لكنها لا ترسم صورة أداء كاملة تغطي:

  • الاستدلال العام.
  • البرمجة.
  • الأمن السيبراني.
  • البيولوجيا.
  • السلامة.
  • المواءمة.
  • الاستقلالية طويلة الأمد.
  • الاستخدام الاستهلاكي.
  • البيئات المؤسسية.

العبء العملي.

استنتاج Anthropic الحالي متعمّد أن يكون واسعًا: يبدو أن Model 2 أفضل قليلاً من Mythos 5 بشكل عام.

لا توجد خطط حاليًا لدى Anthropic لإصدار Model 2 علنًا

في مقال AIBase القصير، من السهل التغاضي عن أهم تفاصيل عملية.

أوضحت Anthropic بوضوح:

ليست لدينا حاليًا أي خطط
لإصدار هذا النموذج علنًا.

لذلك، لا ينبغي اعتبار Model 2 منتج Claude قادمًا مع تاريخ إصدار ضمني.

لا توجد حاليًا مواصفات رسمية لـ:

  • تاريخ الإصدار.
  • اسم النموذج العام.
  • معرّف نموذج Claude API.
  • التسعير.
  • مواصفات نافذة السياق.
  • خطط التوفر الاستهلاكي.
  • خطط النشر المؤسسي.

أي ادعاء بأن Model 2 سيصبح "Claude Mythos 6" أو "Claude Opus 6" أو أي منتج مُسمّى آخر هو مجرد تكهنات.

كشفت Anthropic عن هذا النموذج لأن نماذجها الداخلية مرتبطة بتقييم المخاطر لدى الشركة.

هذا يختلف عن إصدار منتج.

Claude Mythos 5 ليس في الواقع نموذجًا عامًا متاحًا على نطاق واسع

العنوان الأصلي لـ AIBase ذكر أن Claude Mythos 5 هو أقوى نموذج متاح علنًا من Anthropic.

هذه النقطة تحتاج إلى تصحيح بسيط.

Claude Mythos 5 غير متاح على نطاق واسع.

توفّره Anthropic حاليًا فقط لمجموعة محدودة من العملاء المعتمدين عبر Project Glasswing وبرامج الوصول الموثوق ذات الصلة.

الإصدار المتاح على نطاق واسع هو Claude Fable 5.

تقول Anthropic إن Fable 5 و Mythos 5 يستخدمان نفس النموذج الأساسي.

الفرق هو أن Fable 5 يتضمن إجراءات حماية أمان أقوى في المجالات الحساسة مثل الأمن السيبراني والبيولوجيا، بينما يُقدَّم Mythos 5 للمستخدمين الذين خضعوا للتدقيق والذين يحتاجون إلى قيود أقل في العمل المصرح به.

العلاقة الحالية بين المنتجين هي:

Claude Mythos 5
= وصول موثوق مقيد

Claude Fable 5
= نفس النموذج الأساسي
  + حماية أمان أقوى
  + توفر واسع النطاق

لذلك، بالنسبة للقارئ العادي، الأكثر دقة هو القول: Mythos 5 هو أقوى نموذج ذو وصول مقيد لدى Anthropic، بينما Fable 5 هو أقوى نموذج تم إصداره على نطاق واسع.

Model 1 حقيقي، لكن قصة "Model 1 ← Model 2" كمنتجات هي مجرد تكهنات

يذكر التقرير أيضًا Model 1.

هذا كافٍ بطبيعة الحال لإثارة التكهنات:

Model 1
← Model 2
← إصدارات Claude المستقبلية؟

لكن Anthropic لم تصدر مثل هذا الإعلان.

في الواقع، وصفها لـ Model 1 كان متحفظًا إلى حد ما.

قالت الشركة إن Model 1 يعادل من حيث القدرات تقريبًا:

  • Claude Mythos Preview.
  • Claude Mythos 5.

حصل على نشر داخلي محدود نسبيًا.

قالت Anthropic إن الغالبية العظمى من المستخدمين الداخليين فضّلوا Mythos 5، وكان استخدام Model 1 منخفضًا وفي انخفاض مستمر بحلول تاريخ تغطية التقرير في 15 يوليو.

كما ذكرت الشركة:

تتوقع ألا يتم نشر Model 1
خارجيًا في المستقبل
أو استخدامه داخليًا على نطاق واسع

لذلك، يبدو Model 1 أقرب إلى فرع تطوير داخلي أو نقطة فحص وليس جيلًا سابقًا محدد المعالم بانتظار إصدار عام.

Model 2 يختلف عن Model 1 في جانب مهم

أسلوب Anthropic مع Model 2 أكثر حذرًا بشكل ملحوظ.

تمت مناقشة Model 1 بإيجاز فقط، ثم تم استبعاده إلى حد كبير من تحليل المخاطر لأن Anthropic

اعتبرت Mythos 5 حدًا أعلى معقولًا لمخاطرها.

في المقابل، تم استخدام Model 2 في معظم التقرير لأنه:

  • أقوى بشكل عام.
  • أكثر استخدامًا داخليًا.
  • مرتبط بتحليل مخاطر الطليعة لدى Anthropic.

يقول التقرير إن الاستخدام الداخلي لـ Model 2 مشابه لـ Mythos 5.

هذا لا يثبت إصدارًا عامًا وشيكًا.

لكنه يشير إلى أن Model 2 يتمتع بمكانة تشغيلية مهمة داخل Anthropic.

تقرير المخاطر هو السبب وراء معرفة الجمهور بالنموذج

لم يظهر Model 2 من خلال مشاركة مدونة إصدار تقليدية.

لقد ظهر لأن سياسة التوسع المسؤول لدى Anthropic تتطلب من الشركة إجراء تحليل مخاطر للأنظمة التي يتم تطويرها ونشرها داخليًا فعليًا.

يغطي تقرير المخاطر لشهر أغسطس 2026 أنشطة Anthropic حتى 15 يوليو 2026.

تدرج Anthropic النماذج الداخلية عندما تكون ذات صلة بمسائل مثل:

  • سوء المواءمة في البيئات عالية المخاطر.
  • أتمتة البحث والتطوير بالذكاء الاصطناعي.
  • المخاطر البيولوجية والكيميائية.
  • أمان النماذج.
  • المراقبة الداخلية.

لهذا السبب يذكر التقرير Model 2

معلومات أكثر مما سيحصل عليه نموذج عادي غير مُصدر في العادة.

هذا الكشف هو في المقام الأول نتاج حوكمة السلامة، وثانيًا تسريب منتج.

ماذا يخبرنا التقرير وماذا لا يخبرنا

الادعاء الحالة
لدى أنثروبيك نموذج داخلي يُسمى النموذج 2 مؤكد
النموذج 2 لم يُصدر بعد مؤكد
النموذج 2 أقوى قليلًا من Mythos 5 بشكل عام أكدته أنثروبيك
النموذج 2 أفضل من Mythos 5 في كل مجال لا
النموذج 2 سجّل 62.8% في مقارنة CoBench الموضحة في التقرير مؤكد في بيانات التقرير
Mythos 5 سجّل 50.3% في المقارنة نفسها مؤكد في بيانات التقرير
تقدّر أنثروبيك أن معدل استبدال الموظفين التقنيين الكامل على CoBench يبلغ حوالي 85% مؤكد
النموذج 2 يُستخدم على نطاق واسع داخليًا مؤكد
النموذج 2 أكمل مجموعة التقييم الخارجي الرسمية الكاملة لا
تخطط أنثروبيك حاليًا لإطلاق النموذج 2 علنًا لا
للنموذج 2 اسم منتج رسمي ضمن Claude لا
النموذج 1 هو نموذج داخلي حقيقي مؤكد
النموذج 1确定为السلف المباشر للنموذج 2 غير محدد بعد
من المتوقع إطلاق النموذج 1 علنًا لا
Claude Mythos 5 متاح للاستخدام للجميع لا
Claude Fable 5 هو الإصدار الواسع الانتشار المقابل لـ Mythos 5 مؤكد

الأسئلة الشائعة

ما هو نموذج أنثروبيك 2؟

النموذج 2 هو نموذج حدودي داخلي غير مُصدر تم الكشف عنه في تقرير المخاطر الصادر عن أنثروبيك في أغسطس 2026. صرّحت أنثروبيك بأنه أقوى قليلًا من Claude Mythos 5 بشكل عام، وأنه يُستخدم على نطاق واسع داخل الشركة في البرمجة وتوليد البيانات والبحث والهندسة وأعمال الوكلاء الأخرى.

هل النموذج 2 أفضل من Claude Mythos 5؟

بشكل عام، تقول أنثروبيك نعم — لكن بفارق طفيف فقط. كما ذكرت الشركة أن النموذج 2 أقوى في بعض المجالات وأضعف في مجالات أخرى، لذلك لا ينبغي وصفه بأنه متفوق على جميع المستويات.

ما هي نتيجة النموذج 2 في CoBench؟

المقارنة الموضحة في التقرير تُظهر أن النموذج 2 سجّل 62.8%، متقدمًا على Mythos Preview بنسبة 54.8% وMythos 5 بنسبة 50.3%. وتقدّر أنثروبيك أن النموذج القادر تمامًا

على استبدال الموظفين التقنيين يجب أن يصل إلى ما لا يقل عن حوالي 85% في التقييمات الحالية.

ما الذي يقيّمه CoBench؟

CoBench هو تقييم داخلي صممته أنثروبيك استنادًا إلى مشكلات البحث والهندسة التاريخية التي حلّها موظفوها التقنيون سابقًا. يتلقى النموذج لقطات تاريخية تشمل الأكواد والسجلات والرسائل الداخلية والمستندات، ويجب عليه تشخيص المشكلة التقنية الأساسية.

هل ستصدر أنثروبيك النموذج 2؟

صرّحت أنثروبيك بأنه لا توجد حاليًا خطط لإصدار النموذج 2 علنًا. ولم تكشف الشركة عن اسم منتج أو تاريخ إصدار أو معرّف API أو تسعير أو خطط وصول عام.

هل النموذج 2 هو نموذج Claude Mythos التالي؟

لم تذكر أنثروبيك ذلك. النموذج 2 هو معرّف داخلي مستخدم في تقرير المخاطر، ومطابقته باسم منتج Claude مستقبلي هي مجرد تخمين.

ما هو نموذج أنثروبيك 1؟

النموذج 1 هو نموذج داخلي آخر تم الكشف عنه في التقرير نفسه. ذكرت أنثروبيك أنه مشابه تقريبًا لـ Mythos Preview وMythos 5، وأن معدل استخدامه الداخلي منخفض نسبيًا وفي اتجاه تنازلي، ومن غير المتوقع نشره خارجيًا.

هل تم إصدار Claude Mythos 5 علنًا؟

ليس متاحًا بشكل عام. يتوفر Mythos 5 عبر برامج وصول موثوق مقيدة مثل Project Glasswing، بينما يستخدم Claude Fable 5 نفس النموذج الأساسي لكن مع إجراءات حماية أقوى وهو متاح على نطاق واسع.

الأدوات ذات الصلة

  • Claude: مساعد الذكاء الاصطناعي العام من أنثروبيك للمستهلكين والمحترفين.
  • Claude API: منصة المطورين من أنثروبيك لنماذج Claude المتاحة عمومًا.
  • Anthropic Console: مساحة العمل الرسمية لاختبار نماذج Claude API وإدارة وصول المطورين.
  • Project Glasswing: برنامج الوصول الموثوق من أنثروبيك لقدرات الأمن السيبراني المتقدمة على مستوى Mythos.
  • Anthropic Transparency Hub: المورد المركزي لتقييمات سلامة النماذج وبطاقات الأنظمة ومعلومات المخاطر.

الروابط ذات الصلة

الملخص

كشف تقرير مخاطر أنثروبيك لأغسطس 2026 عن نموذج داخلي يُسمى النموذج 2، والذي يُستخدم

حاليًا بشكل مكثف في البحث والهندسة والبرمجة وتوليد البيانات وسير عمل الوكلاء المستمرة.

النموذج أقوى من Claude Mythos 5 في تقييم CoBench الداخلي من أنثروبيك، حيث سجّل 62.8% مقابل 50.3%. كما ذكرت أنثروبيك أن النموذج 2 يبدو أقوى قليلًا بشكل عام، على الرغم من أنه أضعف من Mythos 5 في بعض المجالات، وأن حجم التحسن أقل بكثير من القفزات القدراتية الكبرى السابقة.

أشار التقرير أيضًا إلى النموذج 1، لكن الأدلة غير كافية لاعتبار النموذج 1 والنموذج 2 سلسلة منتجات عامة مؤكدة. الاستخدام الداخلي للنموذج 1 في تراجع، بينما صرّحت أنثروبيك صراحةً أنه لا توجد خطط حاليًا لإصدار النموذج 2 علنًا.

الاستنتاج الأوضح هو أن المستوى الحدودي الداخلي لأنثروبيك تجاوز Mythos 5 قليلًا — لكن النموذج 2 هو نظام بحث داخلي، وليس منتج Claude التالي المُصدر.