GPT-5.6 Sol يتفوق قليلاً على Claude Mythos 5 في اختبارات الأمن السيبراني، والنماذج مفتوحة المصدر تقلل الفجوة
أظهر تقييمان للأمن السيبراني نشرهما معهد السلامة الذكاء الاصطناعي البريطاني (AISI) أن GPT-5.6 Sol يتفوق قليلاً على Claude Mythos 5. هذه النتيجة جديرة بالملاحظة ولكن يجب تفسيرها بحذر. لم ينشر AISI تصنيفاً شاملاً لقدرات الأمن السيبراني الهجومية والدفاعية، بل اختبر النماذج في مجموعة محددة من المهام التقنية الضيقة وسيناريوهات محاكاة للهجمات طويلة المدى على شبكات الشركات. في هذه الإعدادات، حقق GPT-5.6 Sol أعلى متوسط درجات، بينما Mythos

GPT-5.6 Sol يتفوق قليلاً على Claude Mythos 5 في اختبارات الأمن السيبراني، والنماذج مفتوحة المصدر تقلل الفجوة
مقدمة
في تقييمين للأمن السيبراني أصدرهما المعهد البريطاني لسلامة الذكاء الاصطناعي (AISI)، احتلت GPT-5.6 Sol مرتبة أعلى بقليل من Claude Mythos 5. هذه النتيجة جديرة بالاهتمام، ولكن يجب تفسيرها بحذر.
لم يصدر AISI ترتيبًا عامًا يغطي جميع قدرات الأمن السيبراني الهجومية والدفاعية. بل اختبر أداء النماذج في عدة مهام تقنية محددة، بالإضافة إلى هجوم شبكي طويل الأمد على شركة محاكاة. في هذه الإعدادات، سجلت GPT-5.6 Sol أعلى متوسط أداء، بينما كانت Mythos 5 قريبة جدًا منها.
الأهم من ذلك هو النتيجة المتعلقة بالنماذج مفتوحة الوزن. وجد AISI أن أداء GLM-5.2 و DeepSeek V4-Pro أصبح الآن معادلاً للنماذج المغلقة الرائدة التي صدرت قبل أربعة إلى سبعة أشهر فقط. في اختبارات AISI الداخلية لعام 2025، كانت الفجوة الزمنية ستة إلى عشرة أشهر.
هذا التقليص في الفجوة الزمنية مهم، لأن النماذج مفتوحة الوزن يمكن تنزيلها وتعديلها ونشرها محليًا وتشغيلها دون مراقبة من المُزوّد. هذه المرونة التي تدعم البحث، وتحافظ على الخصوصية، وتُخفّض التكاليف قد تجعل أيضًا التحكم في القدرات السيبرانية المتقدمة أكثر صعوبة بعد إصدارها.
ما الذي قيّمه AISI؟
استخدم AISI نظامين تقييميين متكاملين.
المهام الشبكية الضيقة
قام نظام التقييم الأول بقياس مهارات أمن سيبراني محددة من خلال 70 مهمة تم اختيارها من مجموعة أكبر تضم 96 مهمة.
تغطي هذه المهام أربعة مجالات رئيسية:
- البحث في الثغرات واستغلالها
- الهندسة العكسية
- الاستغلال الشبكي
- التشفير
وهي مقسمة إلى أربعة مستويات صعوبة بناءً على الخبرة البشرية التقديرية المطلوبة:
| مستوى الصعوبة | الخبرة البشرية التقريبية | عدد المهام |
|---|---|---|
| غير خبير تقني | لديه خلفية تقنية لكن خبرة محدودة في الأمن السيبراني | 18 |
| متدرّب | حوالي 1-3 سنوات | 25 |
| ممارس | حوالي 3-10 سنوات | 19 |
| خبير | أكثر من 10 سنوات | 8 |
حصل كل نموذج على خمس محاولات لكل مهمة، مع حد أقصى قدره 2.5 مليون رمز (token) لكل محاولة. ثم قام AISI بحساب متوسط معدل النجاح.
ميدان الشبكة الإلكتروني
النظام الثاني يقيس ما إذا كان النموذج قادرًا على الحفاظ على هجوم متعدد الخطوات بشكل مستقل ضمن شبكة محاكاة.
السيناريو الرئيسي الذي تمت مناقشته في التقرير يُسمى الناجي الأخير. ويشمل:
- 32 خطوة هجومية متتالية
- أربع شبكات فرعية
- حوالي 20 مضيفًا
- عدة معالم مسماة
- يُقدر الخبراء البشريون أنه يتطلب 20 ساعة من العمل
يمثل مسار كل نموذج رئيسي متوسط عشر عمليات تشغيل، مع حد أقصى قدره 100 مليون رمز لكل عملية تشغيل.
لم تكرر هذه البيئات جميع صعوبات مهاجمة مؤسسة حقيقية محصنة جيدًا. يشير AISI إلى أن هذه الميادين لا تتضمن حاليًا مدافعين بشريين نشطين، أو أدوات دفاعية، ولا تعاقب على إطلاق الإنذارات.
ماذا تخبرنا نتائج GPT-5.6 Sol و Mythos 5 فعليًا؟
في مجموعة المهام الضيقة، سجلت GPT-5.6 Sol أعلى متوسط نجاح في الرسم البياني الذي نشره AISI. Claude Mythos 5 جاءت بعدها مباشرة، مع تداخل في نطاقات عدم اليقين.
![صورة للرسم البياني الذي نشره AISI، يقارن أداء النماذج الحديثة مفتوحة الوزن مع النماذج المغلقة الرائدة التي صدرت قبل 4-5 أشهر في المهام الشبكية الضيقة. المحور الأفقي هو الوقت، والمحور الرأسي هو متوسط معدل النجاح. تم تمييز نماذج متعددة بألوان مختلفة، مثل GPT-5.6-Sol و GPT-5 و Claude Mythos 5. متوسط نجاح GPT-5.6-Sol في فبراير 2026 يقترب من 90%، بينما متوسط نجاح Claude Mythos 5 في أكتوبر 2025 يبلغ حوالي 60%. يرتبط هذا الرسم البياني ارتباطًا وثيقًا بالسياق، ويوضح بشكل مباشر الفروق في الأداء بين النماذج في المهام الشبكية الضيقة.] (https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b174900b-fa86-4c9b-b17d-2d107f7a95ab-883f0b2f-3c48-40bc-833e-b7af5faa130c.png)
يظهر الرسم البياني أن متوسط نجاح GPT-5.6 Sol يزيد قليلاً عن 90%، بينما يبلغ متوسط نجاح Mythos 5 حوالي 90%. نظرًا لتداخل أشرطة عدم اليقين، ينبغي وصف هذه النتيجة بأنها تقدم طفيف في هذا التقييم المحدد - ولا تثبت أن Sol أفضل بشكل مطلق في جميع سيناريوهات الأمن السيبراني.
المهام طويلة المدى أظهرت وضعًا مشابهًا.

يمكن استخلاص الاستنتاجات التالية:
- GPT-5.6 Sol كان أداؤها متوسطًا هو الأفضل في مهمة المجال المحددة هذه.
- أداء Mythos 5 كان قريبًا، وأكملت جميع الخطوات الـ 32 في أفضل محاولاتها.
- قد يعكس الفرق قدرات النموذج، أو موثوقية الوكيل، أو استخدام الأدوات، أو التخطيط طويل المدى، أو مزيجًا من هذه العوامل.
- قوة الأدلة من مجال أمن سيبراني واحد أضعف من بيانات عدد كبير ومتنوع من المهام.
- لا تثبت هذه النتائج تصنيفًا عامًا للتفوق في الأمن الهجومي.
يركز تقرير AISI بشكل أساسي على فجوة القدرات بين النماذج مفتوحة المصدر ومغلقة المصدر، وليس على تحديد الفائز العام بين Sol و Mythos.
النماذج مفتوحة المصدر الآن تتخلف بـ 4 إلى 7 أشهر فقط
اختار AISI نماذج GLM-5.2 و DeepSeek V4-Pro لأنها كانت المرشحة الرائدة مفتوحة المصدر وقت إجراء الاختبارات.
المقارنة الأساسية في التقرير تعتمد على النماذج المتقاربة في الأداء والفارق الزمني بين تواريخ إصدارها.
| النموذج مفتوح المصدر | مهمة التقييم | النموذج المغلق القابل للمقارنة | فجوة تاريخ الإصدار التقديرية |
|---|---|---|---|
| GLM-5.2 | المهام الشبكية الضيقة | Claude Opus 4.6 و GPT-5.3-Codex | حوالي 4 أشهر |
| GLM-5.2 | مجال الأمن السيبراني "الناجي الأخير" | Claude Opus 4.5 | أقل من 7 أشهر |
| DeepSeek V4-Pro | المهام الشبكية الضيقة | Claude Opus 4.5 | حوالي 5 أشهر |
| DeepSeek V4-Pro | مهام مجال الأمن السيبراني | أقل من Sonnet 4.5 في مجال معين | لا يُعتبر مطابقًا مباشرًا للنماذج الرائدة |
أداء GLM-5.2 كان معادلاً لـ Opus 4.6 في جميع مستويات الصعوبة الأربعة للمهام الضيقة. في مهمة مجال "الناجي الأخير"، وصلت إلى نفس متوسط عدد الخطوات النهائية مثل Opus 4.5.
DeepSeek V4-Pro قارعت Opus 4.5 في المهام الضيقة، لكن أداءها كان أضعف في المهام طويلة المدى.
أظهرت اختبارات AISI الداخلية لعام 2025 أن النماذج الرائدة مفتوحة المصدر تتخلف عن النماذج المغلقة الرائدة بفارق ستة إلى عشرة أشهر. بينما يشير التقدير الجديد الذي يتراوح بين أربعة وسبعة أشهر إلى أن نافذة الاستعداد للمدافعين قد تكون في تقلص.
لماذا هذه الفجوة ليست توقعًا ثابتًا؟
الرقم الذي يتراوح بين أربعة وسبعة أشهر يصف فقط النماذج والمهام التقييمية التي اختبرها AISI. إنه ليس توقعًا بأن كل نموذج مفتوح المصدر في المستقبل سيحافظ على درجة التخلف الثابتة هذه.
عوامل متعددة قد تحرك الفجوة في أي اتجاه:
قد يحقق مطورو النماذج المغلقة قفزة مفاجئة في القدرات.
قد تستنسخ النماذج مفتوحة المصدر التحسينات الحديثة للنماذج الرائدة.
قد تطلق أطر العمل الوكيلة الأفضل أداءً أكبر من النماذج الحالية.
قد يؤدي الضبط الدقيق والاستدلال المحدد للنموذج إلى تغيير القدرات المُقاسة.
قد تكشف المعايير الجديدة نقاط ضعف لم تكتشفها الاختبارات الحالية.
قد تحد تكاليف النشر والأجهزة المتاحة من خطر سوء الاستخدام الفعلي.
قد تغير التدابير الأمنية وضوابط الوصول القدرات المتاحة للنماذج المستضافة.
ويشير AISI أيضًا إلى أن إعداداته ربما قللت قليلاً من تقدير أقصى قدرات النماذج مفتوحة الوزن، لأنهم لم يقوموا باستخراج أو تحسين متعمقين خاصين بكل نموذج.
هذا التقرير مقصور على مجال الأمن السيبراني فقط، ولا ينبغي استنتاج فجوات مماثلة في مجالات العلوم أو البرمجة أو الاستدلال العام أو غيرها.
النماذج مفتوحة المصدر بتكلفة أقل بكثير عند مستوى قدرات مماثل
الفجوة في القدرات صغيرة، لكن الفجوة في السعر كبيرة.
قارن AISI أسعار الرموز (tokens) المعلنة من الطرف الأول للنماذج المتقاربة في الأداء.
التشغيل
1 مليار رمز (توكن) تكلفة ميدان التدريب السيبراني
| النموذج | التكلفة التقريبية |
|---|---|
| Claude Opus 4.5 | 85 دولارًا |
| Claude Opus 4.6 | 85 دولارًا |
| GLM-5.2 | 46 دولارًا |
| DeepSeek V4-Pro | 1.19 دولار |
تكلفة حل مهمة فردية محددة بموثوقية 100%
| عنصر المقارنة | تكلفة النموذج المغلق المصدر | تكلفة نموذج الأوزان المفتوحة المصدر |
|---|---|---|
| Opus 4.6 مقابل GLM-5.2 | 15.17 دولارًا | 6.12 دولارًا |
| Opus 4.5 مقابل DeepSeek V4-Pro | 12.50 دولارًا | 0.28 دولارًا |
في هذه الأمثلة، السعر المُعلن لنموذج DeepSeek V4-Pro أقل بمرتبة إلى مرتبتين من النماذج المغلقة المصدر المماثلة.
تعاني هذه المقارنة من قيود. لم يقم معهد أمان الذكاء الاصطناعي (AISI) بتشغيل نماذج الأوزان المفتوحة المصدر التي تم اختبارها عبر موفرها الأصلي، لذا قد تختلف تكاليف البنية التحتية الفعلية. كما يضيف الاستضافة الذاتية تكاليف مثل الأجهزة والهندسة والكهرباء والشبكات والصيانة، والتي لا تنعكس في أسعار واجهات برمجة التطبيقات.
ومع ذلك، فإن انخفاض تكاليف الاستدلال يجعل التجارب المتكررة والضبط الدقيق والنشر الخاص أكثر جدوى.
لماذا غيّرت الأوزان مفتوحة المصدر قضايا الأمان
تتمتع نماذج الأوزان مفتوحة المصدر بمزايا عملية:
- النشر الخاص
- عدم الحاجة لإعادة البيانات إلى الموفر الأصلي
- التخصيص لمهام محددة
- عدم التأثر بإيقاف الخدمة من قبل الموفر
- قابلية تكرار البحث
- فحص وتعديل أوزان النموذج
- التعاون عبر المؤسسات
نفس هذه الخصائص تحد من الإجراءات الأمنية التي يمكن اتخاذها بعد النشر.
يمكن لمقدمي النماذج المغلقة المصدر:
- مراقبة أنماط الاستخدام غير الطبيعية
- تطبيق المُصنّفات
- تعليق الحسابات
- تقييد معدل الوصول
- تحديث الإجراءات الأمنية
- تقييد أدوات معينة
- سحب النماذج أو استبدالها
بمجرد أن تصبح أوزان النموذج عامة، يمكن إعادة توزيع النسخ وتشغيلها بشكل خاص. قد يتم تعديل سلوكيات الرفض، وقد تتم إزالة مراقبة النشر، ولا يمكن للمطور الأصلي استرداد كل نسخة بشكل موثوق.
وجد معهد أمان الذكاء الاصطناعي أن الإجراءات الأمنية لم تعيق بشكل جوهري معظم اختباراته على النموذجين مفتوحي المصدر. يرفض DeepSeek V4-Pro أحيانًا مهام الهندسة العكسية، لكن إعادة المحاولة القليلة غالبًا ما تتجاوز هذه الرفض.
هذا لا يعني أن جميع نماذج الأوزان مفتوحة المصدر ستُستخدم بشكل ضار، بل يعني أنه عندما يصل النموذج إلى مستويات قدرات مرتبطة بالمخاطر، يصبح قرار النشر صعب التراجع.
النماذج المغلقة المصدر تحتاج أيضًا لإجراءات أمان أقوى
الوصول المغلق ليس ضمانًا للأمان.
أصدرت شركة Anthropic نموذج Claude Fable 5 ونموذج Claude Mythos 5 في 9 يونيو 2026. يستخدم Fable 5 مُصنّفات أقوى للوصول العادي، بينما يعرض Mythos 5 قدرات الأمن السيبراني الأساسية للنموذج لمجموعة محدودة من المدافعين الموثوقين.
في 12 يونيو، طلبت ضوابط التصدير الأمريكية من Anthropic تعليق الوصول. ذكرت Anthropic أن التوجيه جاء بعد أن قدم باحثون من أمازون تقريرًا يصف طريقة لتجاوز إجراءات الحماية في Fable 5 في سيناريوهات أمن سيبراني محدودة.
قامت Anthropic بعد ذلك بتدريب مُصنّف محدث، ووضعت بالتعاون مع شركاء حكوميين وصناعيين إطارًا لتقييم خطورة الاختراق، وأعادت نشر Fable 5 عالميًا في 1 يوليو بعد رفع القيود.
كشف هذا الحدث عن عدة نقاط:
- يمكن أن تنتج المُصنّفات نتائج سلبية كاذبة وإيجابية كاذبة.
- تتفاوت خطورة وسائل الاختراق بشكل كبير.
- لا تكشف وسائل التجاوز بالضرورة أخطر قدرات النموذج.
- يمكن للموفر المغلق تحديث الإجراءات الأمنية وتعليق الوصول.
- قد تعيق هذه التدخلات أيضًا الأعمال الأمنية المشروعة.
- لا تزال الصناعة والحكومة تفتقران إلى معيار موحد للحكم على الاختراقات السيبرانية.
يوفر النشر المغلق المزيد من خيارات التدخل، لكن هذه الخيارات لا تزال تتطلب مراقبة واختبارًا وسياسات وضوابط تقنية فعالة.
نافذة الاستعداد الدفاعي تتقلص
يصف معهد أمان الذكاء الاصطناعي الفجوة بين النماذج المفتوحة والمغلقة بأنها وقت الاستعداد.
إذا تم التحكم بأقوى الأنظمة لعدة أشهر قبل إصدار أوزان مفتوحة مكافئة، يمكن للمدافعين استغلال هذا الوقت من أجل:
- اكتشاف الثغرات وإصلاحها
- تحسين قوائم الأصول
- إزالة البرامج غير المدعومة
- تعزيز ضوابط الهوية
- نشر المصادقة المقاومة للتصيد
- تحسين تجزئة الشبكة
- توسيع التسجيل والكشف
- اختبار خطط الاستجابة للحوادث
- تطبيق مراجعة الكود بمساعدة الذكاء الاصطناعي وتحليل التهديدات
الانخفاض من ستة إلى عشرة أشهر إلى أربعة إلى سبعة أشهر يعني أن المؤسسات قد يكون لديها وقت أقل لإنجاز هذه المهام قبل أن تصبح القدرات المماثلة أرخص وأكثر انتشارًا.
يحذر المركز الوطني للأمن السيبراني البريطاني من أن الذكاء الاصطناعي سيعظم الفجوة بين الممارسات الأمنية القوية والضعيفة. تؤكد إرشاداته على أن أدوات الذكاء الاصطناعي لا يمكنها تعويض الأساسيات الضعيفة.
المؤسسات التي تعاني من سوء إدارة التصحيح، والأصول المكشوفة، وإعادة استخدام بيانات الاعتماد، والنسخ الاحتياطية غير المكتملة، والمراقبة المحدودة، ستظل عرضة للخطر بغض النظر عن نموذج الذكاء الاصطناعي الذي يستخدمه المهاجم.
الذكاء الاصطناعي يسرع أيضًا الأعمال الدفاعية
نفس القدرات المستخدمة في التقييمات الهجومية يمكن أن تساعد المدافعين في مراجعة الكود، وتوليد الاختبارات، والتحقيق في الأعطال، وتوسيع أبحاث الثغرات.
مثال حديث من مطور شبكات الألعاب Glenn Fiedler، الذي استخدم Claude Code مع Claude Fable 5 لمراجعة أربع مكتبات مفتوحة المصدر معروفة:
netcodereliableserializeyojimbo
أضافت المراجعة أهداف libFuzzer، وتكاملًا مستمرًا قائمًا على أدوات التعقيم، واختبارات إجهاد بملايين التكرارات، واختبارات تنسيق الخط الذهبي، ومراجعة سطرًا بسطر.
يُظهر سجل الثغرات العام 43 إصلاحًا:
| المكتبة | إجمالي الإصلاحات | الإصلاحات التي يمكن الوصول إليها عبر الشبكة |
|---|---|---|
| netcode | 7 | 2 |
| reliable | 7 | 6 |
| serialize | 11 | 7 |
| yojimbo | 18 | 12 |
| المجموع | 43 | 27 |
كانت المشكلة الأكثر خطورة هي ثغرة تجاوز سعة المخزن المؤقت في الكومة في yojimbo والتي يمكن تشغيلها عن بُعد منذ عام 2019. يمكن نسخ أجزاء الكتلة المعدة بعناية إلى المخزن المؤقت لإعادة التجميع قبل التحقق من الحجم.
كل مشكلة مدرجة مصحوبة بروابط للإصلاح والإصدار، وكل إصلاح يتضمن اختبارات تراجع. ذكر المطور أنه أنفق أكثر من 2500 دولار على Claude Code خلال عملية الإصلاح التي استمرت أسبوعين.
يُنصح مستخدمو المكتبات المتأثرة بالترقية إلى أحدث إصدار محدد في سجل الثغرات العام.
لا تثبت هذه الحالة أن وكلاء الذكاء الاصطناعي يمكنهم تأمين أي برنامج بشكل مستقل. إنها تشير إلى أن الصيانة ذوي المعرفة يمكنهم استخدام الذكاء الاصطناعي لتوسيع نطاق اختبارات التشويش، وتغطية أدوات التعقيم، والمراجعة، وتوليد الاختبارات لقواعد الكود الحالية.
عدم تناسق تسريع الهجوم والدفاع
يمكن للذكاء الاصطناعي مساعدة كلا الجانبين، لكن أنماط النشر مختلفة.
يحتاج المهاجم فقط إلى ثغرة واحدة قابلة للاستغلال، وهدف واحد يمكن الوصول إليه، ومسار واحد ناجح. يمكن نسخ نماذج الأوزان مفتوحة المصدر وإعادة استخدامها مرارًا وتكرارًا بعد النشر.
يجب على المدافع حماية أنظمة متعددة، والحفاظ على قوائم الأصول، وترتيب أولويات التصحيحات، واختبار التغييرات، وإدارة فترات التوقف، والتنسيق عبر الفرق. يجب تنفيذ التحسينات الدفاعية مؤسسة تلو الأخرى.
يخلق هذا عدم تناسق:
- يمكن أن تنتشر القدرات الهجومية بسرعة.
- يجب تنفيذ القدرات الدفاعية محليًا.
- يمكن نشر النموذج مرة واحدة.
- يجب نشر التحديثات الأمنية عدة مرات.
- يمكن للمهاجم اختيار أضعف هدف.
- يجب على المدافع تغطية جميع المسارات الحيوية.
الرد المناسب ليس تجنب استخدام الذكاء الاصطناعي الدفاعي، بل دمجه مع الممارسات الهندسية القوية والخبرة البشرية والضوابط الأمنية المثبتة.
كيف يجب أن تتصرف المؤسسات
تدعم نتائج معهد أمان الذكاء الاصطناعي والمركز الوطني للأمن السيبراني مجموعة من الإجراءات العملية.
1. تعزيز الأساسيات أولاً
إعطاء الأولوية لـ:
- قوائم الأصول
- البرامج المدعومة
- التصحيح السريع
- المصادقة متعددة العوامل
- الوصول بأقل صلاحية
- تجزئة الشبكة
- النسخ الاحتياطية المختبرة
- التسجيل المركزي
- تدريبات الاستجابة للحوادث
عند وجود هذه الأساسيات، يكون الدعم المعزز بالذكاء الاصطناعي أكثر فعالية.
2. توسيع نطاق اختبار الأمان المستمر
بالنسبة للمشاريع البرمجية، قم بتقديم:
- اختبار التشويش (Fuzzing)
- AddressSanitizer
- UndefinedBehaviorSanitizer
- MemorySanitizer حيثما أمكن
- التحليل الثابت
- فحص التبعيات
- اختبارات التراجع لكل خطأ مؤكد
- مراجعة أمنية لمسارات الإدخال غير الموثوقة
كان تدقيق مكتبات Game Networking مفيدًا لأنه جمع بين مراجعة الذكاء الاصطناعي والأدلة الميكانيكية، بدلاً من الثقة في التفسيرات المولدة.
3. اعتبار اكتشافات الذكاء الاصطناعي أدلة، وليس براهين
قد تكون تقارير الثغرات المولدة بواسطة الذكاء الاصطناعي صحيحة أو غير كاملة أو مضللة.
يتطلب:
1.
إعادة الإنتاج
2. تحليل السبب الجذري
3. المراجعة اليدوية
4. الإصلاح الأدنى
5. اختبار الانحدار
6. توثيق الإصدار
7. التنسيق للإفصاح حسب الاقتضاء
4. تقييد صلاحيات الوكيل
لا ينبغي أن يحصل وكيل البرمجة الدفاعية على صلاحيات غير مقيدة بشكل افتراضي.
القيود:
- بيانات الإنتاج
- الوصول إلى الشبكة
- أوامر shell المدمرة
- نطاق الكتابة في المستودع
- الوصول إلى المفاتيح
- صلاحيات النشر
- الاتصالات الخارجية
استخدم بيئات معزولة، و
ضع الإجراءات الهامة بعد موافقة بشرية.
5. قياس التكلفة والفعالية
تتبع المؤشرات التالية:
- الثغرات المؤكدة
- النتائج الإيجابية الخاطئة
- الوقت اللازم لإعادة الإنتاج
- الوقت اللازم للإصلاح
- تغطية الاختبارات الجديدة
- تكاليف الرموز والبنية التحتية
- وقت المراجعة اليدوية
- حالات التراجع الأمني بعد النشر
إذا كان النموذج ينتج نتائج غير موثوقة أو يتطلب مراجعة مكثفة، فإن أرخص نموذج قد لا يكون الأكثر فعالية من حيث التكلفة.
كيفية تفسير اختبارات الأمن السيبراني للذكاء الاصطناعي
اختبارات الأمن السيبراني مفيدة، ولكن يجب فهم نطاق تطبيقها.
الدرجة العالية لا تعني الاختراق في العالم الحقيقي
ساحات المحاكاة تبسط البيئة. الشبكات الحقيقية قد تحتوي على مدافعين نشطين، وحماية نقاط النهاية، وآليات تنبيه، وتحديد معدل، وأنظمة خداع، ومعلومات غير كاملة.
قدرات النموذج وقدرات الوكيل متداخلة
نتائج المهام طويلة المدى لا تعتمد فقط على معرفة النموذج. تصميم الأداة، والذاكرة، وإدارة السياق، واستراتيجيات إعادة المحاولة، وهيكل التوجيه، وموثوقية التنفيذ كلها تؤثر على الأداء.
النتائج المتوسطة والنتائج المثلى تجيب على أسئلة مختلفة
النتائج المثلى تظهر ما يمكن للنظام فعله أحيانًا. النتائج المتوسطة تظهر مدى موثوقية تقدم النظام عبر عمليات متعددة.
بالنسبة للمخاطر التشغيلية، كلاهما مهم.
المقارنات المبنية على تاريخ الإصدار تقريبية فقط
النماذج ذات الأداء المشابه للنماذج القديمة ليست مطابقة لها تمامًا. قد يكون لهذه الأنظمة نقاط قوة ونقاط ضعف وضمانات وتكاليف وقيود نشر مختلفة.
قدرات الأمن السيبراني ذات استخدام مزدوج
نفس المهارات يمكن استخدامها في اختبار الاختراق، ومراجعة الأمان للكود، والاستجابة للحوادث، واكتشاف الثغرات، أو الاختراق الخبيث.
يجب أن تغذي نتائج التقييم إدارة المخاطر والاستثمار في الوصول الأمني الدفاعي.
أسئلة شائعة
هل GPT-5.6 Sol أفضل من Claude Mythos 5 في اختبارات AISI؟
GPT-5.6 Sol حقق نتائج متوسطة أعلى قليلاً في مهام الأمن السيبراني الضيقة لـ AISI وساحات المدى الطويل المذكورة. نتائج Mythos 5 كانت قريبة، وتتداخل نطاقات عدم اليقين لكلا النموذجين في مجموعة المهام الضيقة، وكلاهما أكمل جميع خطوات ساحة المدى الطويل البالغ عددها 32 في أفضل المحاولات.
هل يعني هذا أن GPT-5.6 Sol هو أفضل نموذج للأمن السيبراني؟
ليس بالضرورة. AISI تختبر مجموعات مهام وبيئات محاكاة محددة، وليس جميع سيناريوهات الدفاع أو الهجوم الحقيقية. النتائج تدعم المقارنات المعيارية الضيقة، وليس التصنيفات العامة.
كم الفجوة بين نماذج الوزن المفتوح والنماذج المغلقة الرائدة؟
تقدر AISI أن نماذج الوزن المفتوح الرائدة التي اختبرتها تتأخر بمقدار أربعة إلى سبعة أشهر. يستند هذا الرقم إلى مقارنة الأداء المقاس مع تواريخ إصدار النماذج المغلقة المماثلة.
أي نموذج وزن مفتوح كان الأفضل؟
في وقت إصدار التقرير، كان GLM-5.2 أقوى نموذج وزن مفتوح في اختبارات AISI. كان متساويًا مع Opus 4.6 في المهام الضيقة، وسجل متوسط درجة مماثل لـ Opus 4.5 في ساحات الأمن السيبراني المذكورة.
لماذا تشكل نماذج الوزن المفتوح مخاوف متعلقة بالأمن السيبراني؟
يمكن تنزيل أوزانها وتعديلها ونشرها بشكل خاص وإعادة توزيعها. هذا يوفر فوائد بحثية وخصوصية، ولكنه يحد من قدرة المطور الأصلي على مراقبة سوء الاستخدام، وتحديث إجراءات أمان النشر، وإيقاف المستخدمين، أو سحب جميع النسخ.
هل النماذج مفتوحة الوزن أرخص في اختبارات AISI؟
نعم. وفقًا للتسعير الرسمي المعلن، فإن GLM-5.2 وخاصة DeepSeek V4-Pro أرخص بكثير من النماذج المغلقة المماثلة. قد تختلف تكاليف الاستضافة الذاتية الفعلية والنشر من طرف ثالث.
هل يمكن لنماذج الذكاء الاصطناعي مساعدة المدافعين والمهاجمين في نفس الوقت؟
نعم. يمكن للذكاء الاصطناعي المساعدة في مراجعة الكود، وتوليد اختبارات الصندوق الأسود، وتحليل الثغرات، والتحقيق في السجلات، والإصلاح. بعد العمل الأمني بمساعدة Claude Code، سجل تدقيق Mas Bandwidth 43 إصلاحًا في أربعة مكتبات شبكات.
ما الذي يجب على المؤسسات إعطاؤه الأولوية؟
تعزيز الضوابط الأمنية الأساسية قبل الاعتماد على أدوات الذكاء الاصطناعي. رؤية الأصول، وإدارة التصحيحات، وحماية الهوية، والنسخ الاحتياطي، وتقسيم الشبكة، والمراقبة، والاستجابة للحوادث المختبرة لا تزال أساسية.
أدوات ذات صلة
- AISI Inspect Cyber: إطار لتقييم مهام الأمن السيبراني للوكيل.
- Inspect AI: إطار عمل مفتوح المصدر من AISI لتقييم نماذج اللغة الكبيرة.
- GLM-5.2: مستودع الوزن المفتوح الرسمي من Z.ai.
- DeepSeek API: الوثائق الرسمية ومعلومات الوصول الحالية لنماذج DeepSeek.
- Claude Code: بيئة البرمجة الوكيلة من Anthropic، مستخدمة لأعمال المستودع والاختبار والمراجعة الأمنية.
- NCSC Cyber Essentials: معيار أساسي مدعوم من المملكة المتحدة لحماية المؤسسات من التهديدات السيبرانية الشائعة.
روابط ذات صلة
- تقرير فجوة القدرات السيبرانية لنماذج الوزن المفتوح من AISI: التحليل الرسمي لشهر يوليو 2026 والمنهجية والرسوم البيانية ومقارنات التكلفة والقيود والاستنتاجات.
- مقدمة لـ Inspect Cyber: شرح AISI لإطارها المفتوح لتقييم الأمن السيبراني للوكيل.
- تقرير اتجاهات الذكاء الاصطناعي الحدودي من AISI: أدلة أوسع حول تقدم قدرات النماذج الحدودية بما في ذلك الأمن السيبراني.
- إرشادات مخاطر الذكاء الاصطناعي الحدودي من NCSC: إرشادات حول خط الأساس الأمني والنشر الحذر للدفاعات المعززة بالذكاء الاصطناعي.
- تقرير إعادة نشر Fable 5 من Anthropic: شرح Anthropic لإيقاف وتحديث المصنف واستعادة الوصول في يونيو 2026.
- سجل ثغرات أمان Mas Bandwidth: قائمة قابلة للتحقق تحتوي على 43 إصلاحًا مع معلومات الالتزام ومستوى الخطورة والوصول الشبكي والإصدار.
- إشعار ترقية Mas Bandwidth: إشعار من المشرف يدعو المستخدمين إلى ترقية المكتبات الشبكية المتأثرة.
خلاصة
تظهر أحدث نتائج AISI أن GPT-5.6 Sol يتقدم قليلاً على Claude Mythos 5 في متوسط الدرجات في تقييميّ الأمن السيبراني المحددين. هذه المقدمة صغيرة ولا ينبغي اعتبارها دليلاً على التفوق العام.
الاستنتاج الرئيسي للتقرير هو أوسع: GLM-5.2 و DeepSeek V4-Pro يتأخران حاليًا عن النماذج المغلقة الحدودية المماثلة بمدة تقلصت إلى 4-7 أشهر، بينما كانت هذه الفجوة من 6-10 أشهر في اختبارات AISI الداخلية لعام 2025.
كما أن سعره أقل بكثير من سعر المنافسين.
هذا الفاصل الزمني القصير يعني أن نافذة الوقت المتاحة للمدافعين للاستجابة قد تضيق أكثر، قبل أن تصبح القدرات المتقدمة أسهل في التحميل والتعديل والتشغيل محليًا. وفي الوقت نفسه، فإن أداء Claude Code في اكتشاف 43 ثغرة في أربع مكتبات شبكية يُظهر أن النماذج القوية يمكنها أيضًا تسريع العمل الدفاعي.
الحل العملي لا يعتمد فقط على حماية النماذج أو أدوات الأمان الخاصة بالذكاء الاصطناعي، بل يتمثل في تعزيز القاعدة الأمنية الأساسية، واستخدام الذكاء الاصطناعي ضمن عمليات دفاعية مُحكمة تعتمد على الاختبارات والمراجعة البشرية.