حلقة التحدي في Claude Opus 5: كيف يعمل التكرار متعدد الوكلاء على صناعة ألعاب متصفح قابلة للعب
نمط جديد من توجيهات Claude Opus 5 ينتشر بسرعة في مجتمع برمجة الذكاء الاصطناعي، حيث يستخدمه المطورون لصنع نماذج أولية مذهلة من ألعاب المتصفح من أوصاف قصيرة.

حلقة التحدي لـ Claude Opus 5: كيف ينتج التكرار متعدد الوكلاء ألعاب متصفح قابلة للعب
مقدمة
نمط مطالبة جديد لـ Claude Opus 5 انتشر بسرعة في مجتمع برمجة الذكاء الاصطناعي، حيث استخدمه المطورون لإنشاء نماذج أولية مذهلة لألعاب المتصفح من تعليمات أولية قصيرة.
يُعرف هذا الأسلوب الآن باسم "حلقة التحدي" (Gauntlet Loop).
الفكرة الأساسية بسيطة: لا تدع نفس الوكيل يبني مرة واحدة، ويقيّم عمله بنفسه، ثم يتوقف عند ذلك. أعطِ الوكيل الرئيسي هدفًا عالي المستوى، ودعه يقسّم المشروع إلى أجزاء أصغر، ويعيّن بناة متخصصين، ويستخدم وكلاء تقييم مستقلين لمقارنة المخرجات الفعلية بمعايير جودة محددة.
إذا فشل الناتج النهائي في اجتياز المقارنة، فارجع وأعد التكرار مرة أخرى.
روّج مات شومر لهذا الأسلوب بعد أن أنشأ لعبة تصويب من منظور الشخص الأول في المتصفح مستوحاة من ألعاب Call of Duty الحديثة باستخدام Claude Code وOpus 5. ثم نشر المطالبة والكود المصدري وشرحًا لسير العمل.

مطور آخر، أنشو تشيمالا، اعتمد سير عمل مشابهًا لبناء "الصمت الطويل" (The Long Silence)، وهي لعبة استكشاف فضائي إجرائية تعمل في المتصفح.
يجب وصف هذه المشاريع بدقة. فهي لا تشير إلى أن مطالبة واحدة يمكنها أن تنتج فورًا لعبة AAA بجودة تجارية. إنها تشير إلى أن وكيل برمجة قوي، عندما يُمنح الأدوات والوكلاء الفرعيين والتنفيذ طويل الأمد وعتبات الجودة القابلة للقياس والتحقق المتكرر، يمكنه دفع النموذج الأولي إلى أبعد بكثير مما يمكن أن تحققه المطالبة التقليدية لمرة واحدة.
نمط المطالبة خلف العرض الفيروسي
حددت مهمة شومر الأولية هدفًا متطرفًا بشكل متعمد: بناء لعبة تصويب من منظور الشخص الأول بطموح بصري يوازي ألعاب AAA الحديثة.
الجزء الأساسي لا يكمن في نوع اللعبة، بل في بنية التقييم.

وجّه سير العمل الوكيل إلى:
- تقسيم الهدف العام إلى أجزاء أصغر.
- تفويض هذه الأجزاء إلى وكلاء فرعيين متخصصين.
- استخدام وكلاء تقييم مستقلين لفحص النتائج.
- مقارنة المخرجات الناتجة بمراجع حقيقية.
- رفض العمل الذي لا يفي بالمعايير.
- مواصلة التكرار، بدلاً من التوقف بعد عدد ثابت من الجولات.
بعد ذلك، قام شومر بإضفاء الطابع الرسمي على هذا الأسلوب تحت اسم "حلقة التحدي" (Gauntlet Loop).
النسخة المبسطة موضحة أدناه:
الهدف
↓
الوكيل الرئيسي
↓
تقسيم المهام
↓
وكلاء البناء
↓
المخرجات الفعلية
↓
التقييم المستقل
↓
المقارنة بالمرجع
↓
نجح؟ ── نعم → الدمج
│
لا
↓
شرح أكبر فجوة
↓
تحسين البناء
↓
تكرار
عتبات الجودة المحددة ضرورية
"اجعلها أفضل" ملاحظة ضعيفة، لأن النموذج يجب أن يحدد بنفسه ما يعنيه "أفضل".
أما "حلقة التحدي" فتمنح المُقيّم مرجعًا خارجيًا.
بالنسبة للألعاب، يمكن أن تكون لقطات شاشة من أعمال تجارية ناضجة.
بالنسبة للمواقع الإلكترونية، يمكن أن تكون عدة مواقع رائدة في الفئة نفسها.
بالنسبة لهندسة النظم الخلفية، قد تشمل:
- مجموعة اختبارات
- هدف زمن استجابة
- تنفيذ مرجعي
- مراجعة أمنية
- عتبة موثوقية
الهدف ليس بالضرورة قابلاً للتحقيق بالكامل. وظيفته منع الوكيل من إعلان النجاح مبكرًا.
لا تجعل البنّاء هو الحكم الوحيد أبدًا
القاعدة الأساسية الثانية هي الاستقلالية.
البنّاء يعرف أسباب كل اختيار قام به، ويسهل عليه الدفاع عن نتائجه. أما المُقيّم الجديد تمامًا فيستلم المخرجات الفعلية دون معرفة سياق التنفيذ.
بالنسبة للأعمال البصرية، يمكن للمُقيّم فحص البكسلات المقدّمة.
بالنسبة للبرمجيات، يمكن للمُقيّم فحص الاختبارات والسلوك أثناء التشغيل.
بالنسبة لأعمال الأداء، يمكن للمُقيّم فحص القياسات الفعلية.
المبدأ الأوسع هو: التوليد والتقييم يجب أن يكونا أمرين منفصلين.
Claude of Duty: المشروع الذي أشعل هذا الأسلوب
تم إصدار العرض التجريبي الأول لشومر علنًا تحت اسم Claude of Duty.
يصف مستودع GitHub الخاص به لعبة تصويب من منظور الشخص الأول مبنية على Three.js وWebGL2، وتحتوي على حوالي 55,000 سطر من التعليمات البرمجية موزعة على 11 نظامًا فرعيًا.
يذكر المستودع أن اللعبة لا تستخدم أي موارد فنية خارجية. فالخامات والشبكات والرسوم المتحركة والأصوات كلها مولّدة برمجيًا.
تشمل أنظمتها:
- العرض
- المواد
- الغلاف الجوي والسماء
- هندسة العالم
- الفيزياء
- حركة اللاعب
- الأسلحة
- المؤثرات
- ذكاء العدو الاصطناعي
- واجهة المستخدم
- الصوت الإجرائي
القول بأن المشروع "أُنجز دفعة واحدة" لا يعني أن كل المحتوى ظهر في رد واحد. وفقًا لشومر، أطلقت مطالبة عالية المستوى جلسة Claude Code طويلة الأمد، ثم اشتقت تلك الجلسة وكلاء فرعيين، وكتبت ملفات، وشغّلت أدوات، وقدّمت اللعبة، وفحصت المخرجات، وعدّلت باستمرار.
أدوات التحقق هي جزء من النتائج نفسها
يتضمن المستودع الأدوات التالية:
- لقطات شاشة قابلة لإعادة الإنتاج
- مجموعات صور للمراجعة
- مقارنة صور بكسل ببكسل
- تحليل زمن الإطار
- تجربة لعب مكتوبة
كما أن ملف README أكثر حذرًا من بعض المنشورات الفيروسية: فهو يوضح صراحةً أن المشروع النهائي لا يطابق مستوى ألعاب Call of Duty الحديثة.
هذا ما يجعل التجربة أكثر قيمة. النتيجة الحقيقية ليست "لقد استبدل الذكاء الاصطناعي استوديوهات AAA"، بل: مرجع عالٍ مضبوط عن قصد يمكن الوكيل من مواصلة العمل لفترة طويلة بعد أن تتوقف المطالبة العادية عند نقطة معينة.
لعبة فضاء في 24 ساعة: The Long Silence
بعد ذلك، طبق أنشو تشيمالا سير عمل مشابهًا على The Long Silence، وهي لعبة استكشاف فضائي إجرائية في المتصفح بُنيت باستخدام Claude Opus 5.

com/cms-assets/image/2026/07/4c0cc196-a519-4a65-9455-9973c77719a4-8c0d5688-9322-4030-96b7-7f67d4d1707a.png)
يذكر المستودع العام أن اللعبة تستخدم WebGL2 وأسلوب Three.js في العرض داخل المتصفح وGLSL مخصصًا.
كما تعتمد على توليد محتوى إجرائي قائم على البذور، بدلاً من تنزيل مكتبات أصول فنية تقليدية.
تصف المقالة المصدر عملية تطوير استغرقت حوالي 24 ساعة، وتنقسم أساسًا إلى ثلاث مراحل.
الخطوة الأولى: تسليم الهدف إلى Opus 5 وتركه يختار البنية المعمارية
كان الطلب الأول هو إنشاء لعبة استكشاف فضائي باستخدام Three.js.
كانت المتطلبات عالية المستوى بشكل متعمد:
- تمكين اللاعب من الحركة.
- تمكين اللاعب من قيادة سفينة فضائية.
- تجنب النمط البصري البلاستيكي المفرط.
- العمل بثبات في المتصفح.
- السعي لتحقيق أداء سلس حيثما كان ذلك ممكنًا.
تُرك معظم بناء العالم والبنية التقنية لتقدير الوكيل.
وهذا يتبع المبدأ الأساسي لهذه المنهجية:
حدد الوجهة، وليس الطريق.
تذكر المقالة المصدر أيضًا أن Claude Code ارتبط بأدوات متعلقة بـ Blender خلال العملية. يحتوي المستودع العام على دليل مهارات Claude خاص بالنمذجة السطحية الصلبة في Blender، مما يؤكد أن تعليمات Blender القابلة لإعادة الاستخدام أصبحت جزءًا من المشروع.

الخطوة الثانية: تشغيل حلقة تحسين بصري طويلة الأمد
بعد اكتمال أول نسخة قابلة للعب، دخل المشروع مرحلة صقل بصري طويلة.
تولى عدة وكلاء فرعيين معالجة مناطق مختلفة، بينما قارن وكيل مُراجع لقطات الشاشة بصور مرجعية لألعاب فضائية مصقولة.
لم يكن التركيز على مجرد إخبار Opus 5 بـ"اجعل اللعبة أجمل". كان على وكيل المراجعة تحديد الفجوات المرئية وإعادة المناطق الضعيفة للتكرار مرة أخرى.
تذكر المقالة المصدر أن أعمالًا مثل ستارفيلد (Starfield) استُخدمت كمعيار جودة.
كما أن الحلقة الطويلة تحتاج إلى شروط إيقاف. نقاط التوقف المفيدة تشمل:
- تحقيق هدف قابل للقياس.
- عجز وكيل المراجعة عن اكتشاف فجوات كبيرة إضافية.
- صغر حجم التحسن بحيث لا يبرر تكلفة الحوسبة.
- استنفاد الوقت أو الميزانية المخصصة.
- اعتبار المسؤول البشري النتيجة كافية.
الحلقة هي آلية ضغط، وليست ضمانًا بأن المخرجات ستصبح "مثالية" في النهاية.
الخطوة الثالثة: إعادة ترتيب الأولويات يدويًا والتنظيف واستخراج المهارات
لم تكن العملية بدون تدخل بشري تمامًا.
وفقًا للمقالة المصدر، تفقد Chimala التقدم عن بُعد، وتدخلت عندما استثمر الوكيل جهدًا مفرطًا في منطقة معينة.
بعد انتهاء التشغيل الطويل، استُخدمت جلسات Claude إضافية من أجل:
- إصلاح مشكلات العرض
- تنظيف الكود
- التحضير لنشر المشروع
بعد ذلك، طُلب من النموذج تلخيص الخبرات القابلة لإعادة الاستخدام في مهارة.
يحتوي المستودع العام على:
.claude/skills/blender-hardsurface
هذا نمط مفيد لعمليات الوكيل طويلة الأمد. فالمشروع لا ينتج القطع فقط، بل يرسّخ أيضًا معرفة تشغيلية قابلة لإعادة الاستخدام: أي الأدوات تعمل، وأي الاختبارات مهمة، وما الذي فشل، وكيف يجب هيكلة المهام المستقبلية.
The Long Silence بنت أدوات التحقق الخاصة بها
من أبرز الأجزاء في المستودع العام
مجموعة أدوات التحقق.
يوثق README الأوامر التالية:
node tools/play.mjs
node tools/survey.mjs
node tools/probe.mjs "<js>" --shot out.png
node tools/sheet.mjs a.png b.png --out s.png
node tools/levels.mjs shots/*.png
node tools/judgeset.mjs
الاستخدامات الموثقة لهذه الأوامر تشمل:
play.mjs: 17 اختبار تفاعل يغطي الطيران والمسح والطي والقفزsurvey.mjs: لقطات شاشة للمشاهد الرئيسية وتقرير الأداءprobe.mjs: تنفيذ تعبير واحد في المتصفح مع لقطة شاشة واحدةsheet.mjs: ورقة اتصال مصغرة للمقارنة البصريةlevels.mjs: إحصائيات درجة اللون والتعرض الضوئيjudgeset.mjs: إعادة بناء مجموعة المراجعة البصرية

النقطة الأساسية هي أن الذكاء الاصطناعي لم ينشئ اللعبة نفسها فحسب، بل أنشأ أيضًا الآليات المستخدمة للحكم عليها.
هذا أحد الأسباب التي تجعل الوكيل طويل التشغيل قادرًا على التحسن بشكل أكثر موثوقية من سير عمل "الإنشاء ثم التوقف" البسيطة.
يعرض المستودع مقايضات هندسية حقيقية
يوثق README عدة قرارات رسومية عملية:
- نظام أصل عائم للتعامل مع المسافات المكانية الكبيرة جدًا.
- خبز الكواكب في خرائط مكعبة لتجنب التقييم الإجرائي المكلف كل إطار.
- حسابات تشتت للغلاف الجوي.
- المعالجة اللاحقة تشمل توهجًا، وتعيين درجات لونية، وتأثيرات عدسة، وحبيبات، وتنعيم الحواف.
- تحجيم عرض ديناميكي لحماية معدل الإطارات.
يوضح المستودع أيضًا أن التحقق من المتصفح تم تشغيله على مثيلات Chromium حقيقية مع تفعيل التسريع الرسومي (GPU).
هذه التفاصيل مهمة لأنها تُظهر أداء النموذج عند التعامل مع قيود هندسية مألوفة: الأداء، والدقة، والقابلية للتكرار، وسلوك المتصفح، والجودة البصرية.
النتيجة قابلة للعب ولكنها لا تزال نموذجًا أوليًا
لعبة "الصمت الطويل" (The Long Silence) متاحة للعب علنًا في المتصفح.
يوفر مستودعها أوامر تطوير قياسية:
npm install
npm run dev
npm run build
تتضمن اللعبة طيرانًا فضائيًا، ومسحًا، وبيئات إجرائية، وتنقلًا، وأهداف استكشاف، وأنظمة واجهات متعددة.
هذا يجعلها أكثر من مجرد نموذج ثابت.
لكنها ما زالت لا تعادل لعبة AAA تجارية طورها استوديو كبير على مدى سنوات.
الإنتاج على مستوى AAA يتطلب عادةً فرقًا كبيرة مسؤولة عن:
- الفن
- تصميم المستويات
- الرسوم المتحركة
- الصوت
- السرد
- اللعب الجماعي
- ضمان الجودة
- دعم إمكانية الوصول
- الشهادات
- تحسين الأداء
- التشغيل والصيانة
الاستنتاج الأكثر منطقية هو: يمكن لمطور واحد اليوم تنسيق وكلاء ترميز متقدمين لصنع نماذج أولية قابلة للعب طموحة بصريًا وغير تافهة تقنيًا، بسرعة لم تكن ممكنة عمليًا في السابق.
بدأ المطورون في المجتمع بإعادة استخدام هذا النمط
بعد أن نشر Shumer التعليمات والكود، انتشر سير العمل هذا بسرعة.
سباق السيارات الكارتية
اعتمد Ryan Campbell نمطًا مشابهًا
حيث طوّر مشروع سباق سيارات كارتية في المتصفح بشكل متكرر، مع التحسين المستمر للعرض والتحكم وسلوك الكاميرا وأداء الأجهزة المحمولة.
دليل Gauntlet Loop الذي نشره Shumer عرض لاحقًا تجربة سباق قابلة للعب في المتصفح تم إنتاجها بهذه الطريقة.
Claudepunk 2077
شارك المصمم Yogi Suria مشروع Three.js بأسلوب السايبربانك، مستلهمًا من نفس نمط التعليمات.

يوضح هذا المثال أن الطريقة لا تقتصر على نوع واحد من الألعاب. يمكن تغيير الأهداف المرجعية والاتجاه الفني وسلسلة الأدوات، بينما يبقى هيكل "ابنِ-انتقد-كرر" ثابتًا.
نفس النمط يمكن استخدامه مع وكلاء برمجة آخرين
أظهر مصدر الأخبار أيضًا مطورًا جرب تعليمات مشابهة عبر Codex باستخدام GPT-5.6 Sol.
أفاد هذا المطور أن وقت البناء استغرق حوالي ساعتين، ووصف النتيجة بأنها جيدة ولكنها ليست بنفس دقة عرض Shumer.

يشير هذا إلى أن Gauntlet Loop ليس حصريًا لـ Claude في الأساس.
يعتمد هذا النمط على بيئة وكيل تمتلك القدرات التالية:
- الوصول إلى الملفات
- تشغيل الكود
- عرض المخرجات
- فحص لقطات الشاشة
- استخدام الأدوات
- الاستمرار في جولات متعددة
- تفويض المهام
- إجراء التعديلات بناءً على الملاحظات
قد تختلف أداء النماذج المختلفة في الحلقة، لكن البنية قابلة للنقل.
لماذا يغير وكيل الناقد النتائج؟
عادةً ما يكون سير العمل التقليدي للجيل كما يلي:
المستخدم ← النموذج ← المخرجات ← المستخدم
يضيف Gauntlet Loop طبقة تقييم:
المستخدم
↓
الوكيل الرئيسي
↓
الباني
↓
الناتج
↓
ناقد مستقل
↓
قياس الفجوة
↓
مراجعة الباني
↓
ناتج جديد
يخلق هذا المزيد من الفرص لاكتشاف المخرجات منخفضة الجودة قبل التسليم.
يجب على الناقد اختبار الواقع
قول الوكيل "الصفحة يجب أن تكون متجاوبة الآن" ليس بنفس قوة فتح الصفحة بعرض الجوال والتحقق فعليًا.
"اللعبة يجب أن تكون أسرع" ليس بنفس قوة قياس زمن الإطار.
"العرض يبدو أفضل" ليس بنفس قوة مقارنة لقطات الشاشة.
أفضل إشارات التغذية الراجعة هي تلك المتجذرة في الناتج الفعلي.
السياق الجديد يقلل من التبرير الذاتي
يتذكر الباني كل حل وسط قام به.
قد يؤدي هذا إلى انحياز في المراجعة.
يمكن للناقد المستقل طرح سؤال أبسط: هل النتيجة بلغت المستوى المطلوب فعلاً؟
يعكس هذا سير العمل البشري. يستخدم المطورون الاختبارات ومراجعات الكود. ويستخدم المصممون المراجعات البصرية واختبارات المستخدم. ويستخدم الكتاب التحرير.
يمكن للوكلاء الذكيين تكرار هذا الفصل بمعدل أعلى.
لماذا يُعد Opus 5 مناسبًا لسير العمل هذا؟
أصدرت Anthropic نموذج Claude Opus 5 في 24 يوليو 2026.
مواد الإصدار الرسمي
تؤكد على أداء أقوى في البرمجة والعمل متعدد الخطوات الطويل والتحقق والتحسين المتكرر.
أشارت Anthropic على وجه التحديد إلى أن Opus 5 أفضل في:
- فحص عمله الخاص
- التكرار المستمر حتى نجاح المهمة
- إيجاد السبب الجذري
- بناء أطر الاختبار عند الحاجة
- الحفاظ على التقدم في المهام الطويلة
- فحص المخرجات البصرية قبل إعادة العمل
تتوافق هذه السلوكيات بشكل كبير مع Gauntlet Loop.
لا تمنح هذه التعليمات النموذج قدرات جديدة. إنها تنشئ بنية تدفع النموذج مرارًا وتكرارًا لاستخدام قدراته الموجودة.
كما ذكرت Anthropic أن Opus 5 أكثر كفاءة من Opus 4.8 بنفس السعر الأساسي: 5 دولارات لكل مليون رمز إدخال و25 دولارًا لكل مليون رمز إخراج.
لا يزال Opus 5 بحاجة إلى إشراف
قد يواجه الوكلاء طويلو التشغيل المشكلات التالية:
- انحراف السياق
- اختلال الأولويات
- إهدار الموارد الحاسوبية
- ضعف القرارات المحلية
- تعارضات التكامل
- أعطال الأدوات
- تناقضات بصرية
لذلك، تظل نقاط الفحص البشرية مفيدة.
أقوى سير عمل ليس "عدم النظر إلى الوكيل إطلاقًا"، بل "جعل الوكيل يعمل لفترة أطول بين تدخلين بشريين عاليي القيمة".
قالب Gauntlet Loop العملي
يمكن تعميم هذه الطريقة على مجالات تتجاوز الألعاب.
الخطوة الأولى: تحديد الهدف
صف النتيجة المرجوة، بدلاً من تحديد كل تفاصيل التنفيذ.
ابنِ لعبة استكشاف فضائية مصقولة في المتصفح، مع تحكم سلس،
وأجواء بصرية قوية، وأداء مستقر.
الخطوة الثانية: تحديد معايير جودة حقيقية
استخدم محتوى يمكن للمُراجع فحصه.
للأعمال البصرية:
قارن الإضاءة والعمق والتكوين ودقة الواجهة بمجموعة مختارة من لقطات ألعاب تجارية عالية الجودة.
للبرمجيات، استخدم الاختبارات أو المعايير المرجعية أو التطبيقات المرجعية.
الخطوة الثالثة: دع الوكيل الرئيسي يقسم العمل
يمكن للوكيل تقسيم المكونات، مثل:
- الحركة
- الإضاءة
- البيئة
- الواجهة
- الصوت
- التأثيرات
- الأداء
الخطوة الرابعة: الفصل بين أدوار الباني والمُراجع
للمكونات المهمة، استخدم:
- بانيًا واحدًا
- مراجعًا بسياق جديد تمامًا
الخطوة الخامسة: إرجاع أكبر فجوة مؤثرة
يجب أن يشير المراجع إلى أكبر فرق قابل للتنفيذ، بدلاً من إدراج قائمة طويلة من الشكاوى الغامضة.
الخطوة السادسة: التكرار
استمر في التحسين حتى تصل إلى نقطة توقف من حيث الجودة أو الميزانية أو الوقت.
الخطوة السابعة: تنفيذ فحص التكامل
قد تنتج الوكلاء المتوازيون عملًا جيدًا محليًا لكنه غير متسق عالميًا.
يمكن لوكيل التكامل النهائي فحص:
- الواجهات المشتركة
- الاتساق البصري
- التسمية
- المنطق المكرر
- الأداء
- التعارضات عبر الأنظمة
الخطوة الثامنة: حفظ المعرفة القابلة لإعادة الاستخدام
خزّن الأجزاء المفيدة من العملية كـ:
- مهارات
- نصوص اختبار
- معايير مرجعية
- قوالب تعليمات
- أدوات مراجعة
يجب أن تبدأ التشغيلات اللاحقة من الدروس المستفادة سابقًا.
متى يكون هذا النمط الأفضل؟
يكون Gauntlet Loop أكثر فعالية عندما يمكن قياس الجودة بشكل متكرر.
تشمل الحالات المناسبة:
- تطوير الواجهات الأمامية
- الألعاب
- البرمجة المدفوعة بالاختبارات
- إعادة الهيكلة
- تحسين الأداء
- التقارير البحثية
- صفحات التسويق
- العروض التقديمية
- التصميم البصري
لكن النمط يكون أضعف عندما يفتقر المراجع إلى إشارات موثوقة.
مراجع بلا لقطات شاشة أو اختبارات،
أو معايير مرجعية أو مواد مرجعية أو ملاحظات مستخدمين حقيقية، قد ينتج مجرد "رأي" إضافي من النموذج.
التكلفة والتحكم لا يزالان مهمين
يمكن أن تستهلك سير العمل متعددة الوكلاء طويلة التشغيل موارد حسابية كبيرة.
قد تتطلب كل جولة مراجعة ما يلي:
- استدعاءات نماذج جديدة
- عرض المتصفح
- تحليل الصور
- تنفيذ الأدوات
- توليد الأكواد
- الاختبار
تشمل الوسائل العملية لضبط الميزانية ما يلي:
- الحد الأقصى لوقت التشغيل
- الحد الأقصى لتكلفة النموذج
- الحد الأقصى لعدد جولات النقد
- الحد الأدنى لعتبة التحسين
- موافقة بشرية بعد المعالم الرئيسية
يمكن للمنتقد الصارم تحسين الجودة، لكنه قد يجعل النظام يستمر في العمل لفترة طويلة حتى عندما لا يكون التحسين المتبقي مجديًا من حيث التكلفة.
الأسئلة الشائعة
ما هي حلقة Gauntlet؟
حلقة Gauntlet هي منهجية ترويج متعدد الوكلاء روّج لها مات شومر. يقوم وكيل رئيسي بتقسيم الهدف إلى مهام أصغر، وينتج وكيل البناء النتائج، بينما يقارن وكيل نقد مستقل المخرجات الفعلية بمرجع محدد، وتُعاد النتائج غير المرضية لإعادة العمل.
هل تم بناء Claude of Duty حقًا باستخدام موجه واحد فقط؟
وفقًا لشومر، بدأ المشروع بموجه عالي المستوى، لكنه لم يُنتج في استجابة نموذج واحدة. عمل Claude Code بعد ذلك لساعات، فاشتق وكلاء فرعيين، وكتب حوالي 55,000 سطر من الأكواد، واستخدم الأدوات، وفحص المخرجات، ونفّذ التكرارات.
هل ابتكر Claude Opus 5 لعبة 3A حقيقية خلال 24 ساعة؟
لا. هذه العروض هي ألعاب متصفح ونماذج أولية مثيرة للإعجاب تقنيًا، لكنها لا تعادل الإنتاجات التجارية الضخمة من فئة 3A. يشير مستودع أكواد Claude of Duty نفسه إلى أن النتيجة النهائية لا يمكن مقارنتها بأعمال Call of Duty الحديثة التي كانت المرجع للجودة.
ما هي The Long Silence؟
The Long Silence هي لعبة استكشاف فضائي توليدية إجرائية قائمة على المتصفح من صنع أنشو تشيمالا. يُظهر مستودعها العام أنها بُنيت باستخدام Claude Opus 5 وتتضمن عرضًا مخصصًا ومحتوى مولّدًا إجرائيًا وأدوات تحقق قائمة على المتصفح.
لماذا استخدام وكيل نقد مستقل؟
من غير المرجح أن يدافع منتقد جديد عن قرارات التنفيذ التي اتخذها البنّاء نفسه. يمكنه فحص المنتج الفعلي ومقارنته بالاختبارات أو لقطات الشاشة أو المعايير أو الأمثلة المرجعية قبل طلب مراجعة أخرى.
هل حلقة Gauntlet مخصصة فقط لـ Claude Opus 5؟
لا. يمكن تطبيق هذه البنية على وكلاء برمجة آخرين يدعمون الأدوات وتحرير الملفات وتنفيذ الأكواد والفحص البصري والعمل المتكرر. يتضمن النص المصدر مثالًا على GPT-5.6 Sol و Codex.
هل أحتاج إلى Claude Code؟
تتطلب سير العمل الكامل بيئة تشغيل وكيل وليس مجرد واجهة محادثة عادية. Claude Code هو أحد الخيارات لأنه يمكنه التعامل مع الملفات وتشغيل الأوامر والاتصال بالأدوات وتنسيق مهام البرمجة طويلة التشغيل.
ما هو أكبر قيد؟
عندما تكون معايير الجودة غامضة أو غير قابلة للقياس، قد تهدر الحلقات طويلة التشغيل الوقت والموارد الحسابية. يجب على المالك البشري تحديد الميزانيات ومراجعة التقدم وإعادة ترتيب الأولويات عند الحاجة وتحديد متى تفقد التكرارات الإضافية قيمتها.
الأدوات ذات الصلة
- Claude Code: بيئة البرمجة الوكيلة من Anthropic، مناسبة لقواعد الأكواد والأدوات ومهام التطوير طويلة الأجل.
- Claude Opus 5: الإعلان الرسمي من Anthropic.
يغطي قدرات Opus 5 في البرمجة والتحقق والتكرار والمهام طويلة الدورة.
- Three.js: مكتبة الرسوميات ثلاثية الأبعاد بلغة JavaScript المستخدمة في مشاريع ألعاب المتصفح التي نوقشت في هذا المقال.
- Blender: مجموعة أدوات إبداعية ثلاثية الأبعاد مفتوحة المصدر يمكن دمجها في سير عمل الوكلاء عبر أدوات خارجية.
- Model Context Protocol: بروتوكول مفتوح لربط تطبيقات الذكاء الاصطناعي بالأدوات ومصادر البيانات الخارجية.
الروابط ذات الصلة
- كيفية تشغيل حلقة Gauntlet: شرح مفصّل من مات شومر لبنية موجهات البنّاء/الناقد.
- Claude of Duty على GitHub: لعبة تصويب من منظور الشخص الأول مفتوحة المصدر بتقنية Three.js أُنتجت عبر سير عمل شومر مع Opus 5.
- الموجه الأصلي لـ Claude of Duty: الموجه العام الذي استُخدم لبدء التجربة.
- The Long Silence على GitHub: لعبة الفضاء المفتوحة المصدر القائمة على المتصفح وأدوات التحقق الخاصة بها.
- العب The Long Silence: النسخة الحية بتقنية WebGL2 من المشروع.
- Anthropic: إطلاق Claude Opus 5: معلومات رسمية حول قدرات Opus 5 وتسعيره وسلوك الوكلاء طويلي التشغيل.
- توثيق MCP من Anthropic: نظرة عامة من Anthropic على دعم Model Context Protocol في منتجات Claude.
ملخص
تجارب ألعاب Opus 5 التي حققت رواجًا يجب فهمها بشكل أفضل كعرض لسير عمل وليس "توليدًا سحريًا لمرة واحدة". تجمع حلقة Gauntlet بين تقسيم المهام وبنّاء خبير وناقد مستقل ومعايير جودة ملموسة وتكرار متواصل.
تُظهر The Long Silence المدى الذي يمكن أن تصل إليه هذه البنية في مشاريع الوكلاء التي تدوم يومًا تقريبًا. لا يضم مستودعها العام اللعبة القابلة للعب فحسب، بل يشمل أيضًا نصوص التحقق وأدوات لقطات الشاشة وتأكيدات التفاعل وتعليمات الوكلاء القابلة لإعادة الاستخدام.
لا تزال هذه المنهجية تعتمد على الحكم البشري والميزانيات الحسابية والمراجع الجيدة وبيئة عمل الوكلاء. وهي لا تعادل جعل النماذج الأولية القائمة على المتصفح تضاهي ألعاب 3A التي تنتجها الاستوديوهات.
التحول الحقيقي يكمن في أن هدفًا عالي المستوى يمكنه الآن إطلاق حلقة "بناء–قياس–نقد–تحسين" طويلة التشغيل، تنجز عملًا أكثر بكثير قبل الحاجة إلى تدخل بشري.