PenguinHarness يبني ويحسّن وكلاء الذكاء الاصطناعي ذاتيًا مقابل 0.2 يوان فقط

LlamaFactory يجعل ضبط النماذج الكبيرة أكثر سهولة لمجموعة أوسع من المطورين. والآن، يطبّق مبتكره تشنغ ياو وي وفريق PrismShadow نفس فلسفة سهولة الاستخدام على...

发布于 2026年8月6日generalGEO 评分: 07 次阅读
PenguinHarness يبني ويحسّن وكلاء الذكاء الاصطناعي ذاتيًا مقابل 0.2 يوان فقط

PenguinHarness يبني ويحسّن وكلاء الذكاء الاصطناعي ذاتيًا مقابل 0.2 يوان فقط

مقدمة

لقد سهّلت LlamaFactory عملية الضبط الدقيق للنماذج واسعة النطاق أمام شريحة أوسع من المطوّرين. واليوم، يطبّق مبتكروها "ياو وي تشنغ" وفريق PrismShadow نفس نهج "سهولة الاستخدام أولاً" على وكلاء الذكاء الاصطناعي.

مشروعهم مفتوح المصدر الجديد كليًا PenguinHarness يهدف إلى أتمتة ثلاث مراحل من دورة حياة الوكيل:

  1. بناء تطبيقات الوكيل
  2. تقييم أدائها
  3. تحسين مطالباتها ومهاراتها وإعداداتها باستمرار

لا يحتاج المستخدم إلى اختيار الأطر يدويًا أو ربط الأدوات أو كتابة المطالبات أو بناء الواجهات واختبار النتائج مرارًا وتكرارًا؛ بل يكتفي بوصف احتياجه، ويترك PenguinHarness لتجميع تطبيق وكيل قابل للتشغيل.

PenguinHarness 平台宣传图

PenguinHarness أداة مفتوحة المصدر لبناء الوكلاء آليًا، مصممة للنشر على أجهزة سطح المكتب والخوادم.

يتميز المشروع بخفة وزنه، ومتوفر برخصة Apache 2.0، ويدعم أنظمة Linux وmacOS وWindows. يمكن تشغيله محليًا أو استخدامه عبر واجهة متصفح على خادم بعيد.

كما يدعم PenguinHarness النماذج عبر الإنترنت والمحلية من خلال الإعدادات المدمجة وواجهة متوافقة مع OpenAI. يسرد المستودع الرسمي حاليًا أحدث النماذج من موفّرين مثل DeepSeek وKimi وGLM وQwen وOpenAI وGoogle وAnthropic.

يصف التقرير الأصلي تطبيق RAG تم إنشاؤه بتكلفة 0.2 يوان فقط من رسوم رموز النموذج. وتعرض الصفحة الرسمية للمشروع نفس المثال بحوالي 0.02 دولار أمريكي (باستخدام DeepSeek V4 Pro).

هذا الرقم هو بيانات توضيحية من المشروع وليس سعرًا ثابتًا مضمونًا. تعتمد التكلفة الفعلية على النموذج المختار والموفّر وتعقيد المطالبات وعدد مرات إعادة المحاولة ونطاق التطبيق وتسعير الرموز.

وكيل يبني وكيلًا آخر

يبدأ PenguinHarness بفكرة بسيطة: يجب أن يكون الوكيل قادرًا على بناء تطبيق وكيل آخر بناءً على احتياجات اللغة الطبيعية.

يتماشى هذا مع النقاشات الأوسع حول "الذكاء الاصطناعي يخدم الذكاء الاصطناعي" والتحسين الذاتي التكراري — حيث تساعد أنظمة الذكاء الاصطناعي في إنشاء أو اختبار أو تحسين أنظمة ذكاء اصطناعي أخرى.

أول حالة استخدام معروضة في المقالة المصدر طلبت من النظام بناء تطبيق RAG يتطلب:

  • استرجاع المعلومات على شكل أجزاء
  • إخراج إجابات واضحة بتدفق
  • تضمين المصادر المُشار إليها
  • توفير واجهة أمامية قابلة للاستخدام
  • العمل كتطبيق متكامل

اختبرت المقارنة PenguinHarness جنبًا إلى جنب مع وكيل برمجي، وطُلب من النظامين إنجاز مهام متشابهة.

وفقًا لعرض المشروع، أكمل PenguinHarness التطبيق بسرعة أكبر وتكلفة رموز أقل. تضمنت نتائجه إجابات سلسة وإخراجًا متدفقًا ومصادر مرتبطة.

أما مخرجات المنافس المعروضة في التقرير فكانت مختلطة اللغات، ولم تظهر نفس سلوك التدفق.

هذه الأمثلة عروض مفيدة، لكنها لا تثبت بشكل قاطع تفوق PenguinHarness على كل وكيل برمجي في جميع السيناريوهات،

المستودع. تعتمد النتائج إلى حد كبير على النموذج وإعدادات الوكيل وتصميم المهمة ومنهجية التقييم.

من الاحتياج إلى تطبيق قابل للتشغيل

يتضمن تطوير الوكلاء التقليدي عادةً عدة مراحل يدوية:

  1. اختيار إطار عمل الوكيل.
  2. اختيار النموذج وتكوينه.
  3. ربط الأدوات والخدمات الخارجية.
  4. كتابة مطالبات النظام.
  5. تعريف الذاكرة ومنطق سير العمل.
  6. بناء حالات التقييم.
  7. اختبار الوكيل وتعديله.
  8. إنشاء الواجهة الأمامية أو واجهة التسليم.
  9. تجهيز التطبيق للنشر.

يحاول PenguinHarness تحويل هذه الخطوات إلى سير عمل واحد مدفوع بالوكيل.

عندما يكون الاحتياج واضحًا، يمكن للنظام توليد:

  • الهيكل الأساسي للتطبيق
  • مطالبات الوكيل
  • تعريفات المهارات والأدوات
  • ملفات الإعدادات
  • الكود المساعد
  • الواجهة الأمامية
  • تعليمات التثبيت
  • تعليمات التشغيل
  • الإصلاحات والتحسينات التكرارية

استخدم المثال الرسمي للمشروع الطلب التالي:

اجمع الوثائق من https://github.com/ericbuess/claude-code-docs، وابنِ تطبيق RAG يجيب بصفته خبيرًا في إعدادات Claude Code مع الاستشهاد بالمصادر.

يشير تقرير المشروع إلى أن تطبيق RAG الناتج استهلك حوالي 0.02 دولار (أي 0.2 يوان) من رموز النموذج عند بنائه باستخدام DeepSeek V4 Pro.

نظام الملفات مصدر للحقيقة

يتعامل PenguinHarness مع الملفات باعتبارها طبقة التعاون الرئيسية بين الإنسان والوكيل.

في هذا التصميم:

  • يتم تمثيل الوكيل بملفات.
  • المطالبات ملفات.
  • المهارات ملفات.
  • تُخزَّن الإعدادات في ملفات.
  • يمكن تتبع المحادثات وسجلات التنفيذ عبر السجلات المخزنة.
  • يمكن إنشاء وكلاء جدد بتجميع أو نسخ بنية الملفات المطلوبة.

هذا الأسلوب يجعل الوكلاء أسهل في الفحص والتعديل.

بدلاً من إخفاء السلوك المهم داخل إطار تطبيق كبير، يجعل PenguinHarness الملفات القابلة للتحرير هي الواجهة الرئيسية. يمكن للبشر قراءة هذه الملفات وتعديلها، بينما يمكن للوكيل تحسينها ضمن عمليات تحسين معتمدة.

تتولى الأداة تجميع تلك الملفات في كائن وكيل قابل للتشغيل.

PenguinMessage يوفر بروتوكولًا موحدًا

في وقت التشغيل، يعمل PenguinMessage كتنسيق رسائل مشترك يربط بين النموذج والبيئة والأدوات والمستخدم.

تشبهه المقالة المصدر بحزمة الشبكة: يمكن للمكونات المختلفة تبادل المعلومات عبر نفس الواجهة خفيفة الوزن دون الحاجة إلى تكاملات فريدة لكل نموذج أو بيئة.

لذا، فإن PenguinHarness هو:

  • إطار عمل لتشغيل الوكلاء
  • وكيل قادر على فهم بنيته الذاتية وتوسيعها

PenguinHarness 项目架构图

يجمع PenguinHarness بين PenguinMessage وPenguin SDK وPenguin Skills في بنية خفيفة الوزن.

المجالات الأساسية الثلاثة المعروضة في البنية المعمارية للمشروع هي:

المكوّن الدور
PenguinMessage بروتوكول رسائل أدنى حد بين المستخدم والنموذج والأدوات والبيئة
Penguin SDK طبقة تطوير لبناء تطبيقات الوكيل
Penguin Skills قدرات قابلة لإعادة الاستخدام لبناء الوكلاء وتقييمهم وتحسينهم

حلقة التطوير الذاتي القابلة للتكرار محليًا

بناء الوكيل الذكي هو مجرد الخطوة الأولى.

الهدف طويل المدى لمشروع PenguinHarness هو تمكين المستخدمين من تشغيل وكلاء يمكن تقييمهم وتحسينهم محليًا، دون الحاجة إلى إعادة بناء النظام بأكمله يدويًا.

يميز المشروع بين مرحلتين:

  • بناء الوكيل الذكي: من الصفر إلى الواحد
  • تحسين الوكيل الذكي: من الواحد إلى المائة

تعديل الوكيل الذكي سهل نسبيًا، لأن المطالبات النصية والكود والمهارات والإعدادات كلها قابلة للتعديل. لكن الحكم على ما إذا كان التعديل يجعل الوكيل أفضل بالفعل هو أمر أصعب بكثير.

نماذج اللغة الكبيرة احتمالية بطبيعتها، وتضيف أنظمة الوكلاء مزيدًا من عدم اليقين من خلال الأدوات والبيئة والذاكرة والقرارات متعددة الخطوات.

لذلك، فإن حلقة التحسين الموثوقة تتطلب نظام قياس موثوقًا.

لماذا يُعد التقييم أمرًا أساسيًا

قد يكون أداء الوكيل الذكي أفضل على مثال واحد، لكنه يصبح أسوأ بشكل عام.

بدون معايير مرجعية منظمة، قد يقوم المُحسِّن بما يلي:

  • الإفراط في التكيف مع عدد قليل من العينات التجريبية
  • حفظ الإجابات
  • استغلال نقاط ضعف المُقيِّم
  • زيادة التكلفة دون تحسين الجودة
  • تحسين مهمة على حساب أخرى
  • الحصول على درجات أعلى عبر أساليب اختراق المكافآت

استغرق فريق PrismShadow أكثر من ستة أشهر لاستكشاف كيفية تقييم الوكلاء ذاتيي التطور.

التحدي الأساسي كان في غياب معايير مرجعية تميز بوضوح بين خبرة التدريب والاختبار المحجوز.

إذا تحسّن الوكيل الذكي على نفس الأسئلة المستخدمة في التقييم، فمن الصعب تحديد ما إذا كان قد تعلّم استراتيجية قابلة لإعادة الاستخدام أم أنه حفظ الإجابات ببساطة.

GDPevo يميّز بين مهام التدريب ومهام الاختبار

أنشأ الفريق GDPevo، وهو معيار مرجعي تطوري أصلي يعتمد على عمليات الأعمال الحقيقية.

تصف المقالة المصدرية تغطيته لمجالات مثل الرعاية الصحية والمالية والأعمال القانونية. يحتوي مستودع الكود الحالي للنسخة V2 على 240 مهمة موزعة على 24 مجموعة مهام، تغطي المجالات التالية:

  • إدارة علاقات العملاء (CRM)
  • تخطيط موارد المؤسسات (ERP)
  • المالية
  • الرعاية الصحية
  • سير العمل القانوني
  • تحليل البيانات
  • العمليات الهندسية

تتضمن كل مجموعة مهام:

  • بيئة أعمال مشتركة
  • خمس مهام تدريبية
  • خمس مهام اختبار محجوزة

يستخدم GDPevo منهجية تُعرف باسم المزج القائم على القواعد. يتم تقسيم عمليات الأعمال إلى قواعد أصغر، موزعة على مهام التدريب، ثم يُعاد تجميعها في مهام الاختبار المحجوزة.

يساعد هذا الهيكل في تحديد ما إذا كان الوكيل الذكي قد تعلّم سير عمل قابلًا لإعادة الاستخدام، بدلاً من مجرد رؤية إجابات الاختبار مسبقًا.

GDPevo 模型评测排行榜

يقيس GDPevo مدى تحسّن الوكلاء الأذكياء على المهام التجارية المحجوزة بعد أشكال مختلفة من التطور.

تقرير ورقة GDPevo

أظهر التطور الذاتي في تجاربهم تحسنًا في الدقة المحجوزة يصل إلى 16.44 نقطة مئوية. كما أشار التقرير إلى أن أفضل وكيل بعد التطور لا يزال بعيدًا عن الحد الأعلى المثالي البالغ 91.6% في ظل المعلومات الكاملة.

هذه الفجوة بالغة الأهمية. يمكن للوكلاء الحاليين التحسن، لكن التطور الذاتي الموثوق لا يزال بعيدًا عن الحل الكامل.

PenguinHarness يحوّل التقييم إلى مهارات

يحوّل PenguinHarness الأفكار الأساسية وراء GDPevo إلى مهارات قابلة لإعادة الاستخدام من أجل:

  • إنشاء الوكلاء الأذكياء
  • تصميم المعايير المرجعية
  • تقييم الوكلاء الأذكياء
  • تحسين الوكلاء الأذكياء

بعد استدعاء المهارات ذات الصلة، يمكن لعدة وكلاء التعاون في عملية التحسين.

تعطي المقالة المصدرية مثالًا على وكيل مصمم لمهام مثل التنبؤ الرياضي، أو توليد استراتيجيات الاستثمار، أو دعم التجارة الإلكترونية.

بدلاً من قيام المستخدم بتعديل المطالبات النصية وسير العمل يدويًا، يمكنه ببساطة ترك PenguinHarness لإنشاء مجموعات التقييم، وتشغيل الاختبارات المتكررة، وتحليل أسباب الخسارة، واقتراح نسخ محسّنة.

يُظهر التقرير التجريبي للمشروع أن النتيجة ارتفعت من 53 إلى 95 نقطة بعد عدة جولات من التكرار، بتكلفة رموز نموذجية تبلغ حوالي 0.5 يوان صيني باستخدام نموذج DeepSeek V4 Flash.

هذه نتائج تجريبية لفريق المشروع، وليست ضمانًا عامًا بالمعايير المرجعية. قد تختلف النتائج الفعلية حسب المهمة ومعايير التقييم والنموذج وحجم العينات وميزانية التحسين.

عملية التحسين المكونة من أربع خطوات

يستخدم سير عمل التطور الذاتي عدة وكلاء بتقسيم أدوار مختلف.

1. تنظيم التقييم

يحدد وكيل التحسين العدد المطلوب من الأسئلة ومرات التكرار، ثم يطلق عدة وكلاء تقييم بالتوازي.

يساعد التقييم المتوازي في تقليل الوقت اللازم لاختبار مهام متعددة أو تكرارات متعددة.

2. التقييم المستقل

يبدأ كل وكيل تقييم نسخة مستقلة من الوكيل المستهدف ويطلب منه حل مهمة واحدة.

يمكن لوكيل التقييم الوصول إلى معايير التصحيح، بينما لا يمكن للوكيل المستهدف الوصول إليها.

يهدف هذا العزل إلى منع الوكيل المستهدف من التحسين المباشر بناءً على تعليمات التقييم المخفية.

3. التحليل والتحسين

يجمع وكيل التحسين النتائج ويفحص مسارات التنفيذ.

يحدد أسباب فقدان الدرجات، ثم يعدّل الأجزاء المصرح بها في الوكيل المستهدف، مثل:

  • المطالبات النصية
  • المهارات
  • الإعدادات
  • ملفات سير العمل

يولّد وكيل التحسين نسخة مرشحة تالية.

4. التحقق والتكرار

تختبر وكلاء التقييم النسخة المرشحة مرة أخرى.

لا يقبل وكيل التحسين النسخة المرشحة إلا إذا حصلت على درجة أعلى بشكل صارم. إذا تساوت الدرجة أو انخفضت، يعود الإطار إلى النسخة السابقة.

PenguinHarness 自进化工作流

ينسّق وكيل التحسين وكلاء التقييم المتوازيين، ولا يقبل سوى الوكيل المرشح الذي حصل على درجة أعلى.

يمكن تلخيص هذه العملية على النحو التالي:

الوكيل المستهدف الإصدار N
      ↓
وكلاء التقييم المتوازيون
      ↓
الدرجات ومعايير التصحيح ومسارات التنفيذ
      ↓
وكيل التحسين
      ↓
تحديث المطالبات النصية أو المهارات أو الإعدادات
      ↓
الوكيل المرشح الإصدار N+1
      ↓
القبول فقط عند درجة أعلى بشكل صارم

هذا التصميم الذي يجمع بين معايير التصحيح المخفية والاختبارات المحجوزة واللقطات والتحسين الصارم للدرجات يهدف إلى جعل التحسين أكثر قابلية للتكرار.

العقد بين إطار الاختبار والوكيل ذاتي التطور

يثير التطور الذاتي سؤالًا أمنيًا واضحًا: ما الذي يُسمح للوكيل بتغييره؟

يحدد PenguinHarness هذه الحدود في ملف محمول يُسمى CONTRACT.md.

ينص هذا العقد على أن القدرات يمكن تحسينها في المناطق المصرح بها، بينما تبقى نواة إطار الاختبار وحدوده الأمنية ثابتة.

PenguinHarness 自进化工作流

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/e5026929-6776-4554-9898-0bb26c98a90b-22347c95-602e-479c-97e6-268a5f43988a.png)

يحدد ملف CONTRACT.md حدود تطور الوكيل والتدقيق والتحكم في الإصدارات وعزل بيانات الاعتماد.

تسلط المقالة المصدر الضوء على أربع قواعد أساسية.

1. لا يمكن للتطور تعديل نواة إطار الاختبار

تقتصر المناطق القابلة للتحرير على مساحة العمل والملفات التوجيهية والمهارات والإعدادات المعتمدة.

لا يجوز للوكيل إعادة كتابة نواة إطار الاختبار أو آلياته الأمنية.

يقلل هذا من المخاطر التي قد يضعفها عملية التحسين، مثل:

  • الموافقة على الأدوات
  • التحكم في الصلاحيات
  • سجلات التدقيق
  • عزل بيانات الاعتماد
  • استعادة الإصدارات
  • الفحوصات الأمنية الأخرى على مستوى النظام

2. كل تحسين يتطلب لقطة

قبل جولة التحسين، يخزن الإطار لقطة من حالة الوكيل.

إذا كان الوكيل المرشح أداءً أسوأ أو تسبب في آثار جانبية غير مرغوب فيها، يمكن للنظام التراجع إلى إصدار سابق.

قد تتراكم الأضرار في الأنظمة ذاتية التحسين التي لا تملك قدرة على التراجع. يجعل التحكم في الإصدارات التحسينات قابلة للعكس.

3. لا يمكن للوكيل المستهدف رؤية معايير التقييم

يتلقى الوكيل المستهدف المهام دون أن يرى معايير التقييم المخفية.

لا يمكن إلا للمقيّم الوصول إلى معايير التقييم.

يهدف هذا إلى تقليل سلوكيات الاختصار وحفظ الإجابات وهجمات المكافآت.

هذا لا يلغي هذه المخاطر تمامًا، لكنه يخلق فصلاً أوضح بين حل المشكلات وتقييم النتائج.

4. كل تحسين يجب أن يكون قابلاً للتدقيق

تُكتب طلبات النماذج واستدعاءات الأدوات واستخدام الرموز والوقت والإخفاقات والموافقات وتغييرات التحسين في ملفات التتبع.

يمكن للمستخدمين فحص ما تغير ولماذا.

تتضمن اتفاقية المشروع الأوسع أيضًا:

  • الموافقة قبل تنفيذ الأدوات
  • سجلات تدقيق لقرارات الموافقة
  • عزل بيانات الاعتماد
  • فصل النموذج عن الوكيل
  • مسارات تنفيذ قابلة للاستعادة
  • تحميل الملفات ذات الصلة عند الطلب
  • قواعد واضحة للتعامل مع الأخطاء

النتيجة النهائية هي إطار يمكن للوكيل أن يتطور فيه، مع بقاء عملية التطور مرئية وقابلة للعكس.

ميزات إضافية مفيدة في PenguinHarness

بالإضافة إلى الإنشاء الآلي للوكلاء وتحسينهم، يتضمن PenguinHarness قدرات متعددة.

مهارات مدمجة لتدريب النماذج

والنشر

يضم المشروع مهارات مدمجة مرتبطة بتطوير تطبيقات الذكاء الاصطناعي، بما في ذلك:

  • penguin-sdk
  • penguin-cli
  • agenthub-models
  • vllm
  • ollama
  • llamafactory

PenguinHarness 内置技能界面

يحتوي PenguinHarness على مهارات لبناء الوكلاء والعمل مع أدوات مثل vLLM وOllama وLlamaFactory.

تسمح هذه المهارات للمستخدمين بوصف مهام التدريب أو النشر بلغة طبيعية، ويقوم الوكيل بإعداد الملفات أو الأوامر المطلوبة.

يقسم المستودع الرسمي المهارات المدمجة إلى أربع فئات رئيسية:

مجموعة المهارات أمثلة
كفاءة المكتب تحليل البيانات وجمع بيانات الويب
تطوير البرمجيات تصميم الويب وهندسة البرمجيات
تطوير تطبيقات الذكاء الاصطناعي Penguin SDK وبوابة النماذج وvLLM وOllama وLlamaFactory
ضبط الوكلاء إنشاء الوكلاء وتصميم المعايير والتقييم والتحسين

يمكن للمستخدمين والوكلاء أيضًا إنشاء مهارات إضافية أو تحسينها.

بوابة نماذج موحدة

يتضمن PenguinHarness إعدادات نماذج مدمجة ويدعم واجهات مخصصة متوافقة مع OpenAI.

يشير المشروع إلى أنه من خلال المزودين والبوابات المدعومة، يمكن للمستخدمين الوصول إلى أكثر من 1000 نموذج عبر الإنترنت ومحلي.

OpenRouter 模型列表

البوابة الموحدة للنماذج تتيح للمستخدمين تكوين مزودي نماذج مختلفين عبر الإنترنت والمحليين.

يسرد المستودع الحالي سلاسل النماذج التالية:

  • DeepSeek
  • Kimi
  • GLM
  • Hunyuan
  • Qwen
  • GPT
  • Gemini
  • Claude

تتغير توفر النماذج وأسماء المزودين بشكل متكرر، لذا يجب اعتبار صفحة "النماذج" داخل التطبيق والوثائق الرسمية الحالية كمصدر أحدث للمعلومات.

وكيل بصري للنماذج النصية

تصف المقالة المصدر نمط تطوير يستخدم نموذجًا نصيًا أساسيًا مثل DeepSeek كوكيل رئيسي، مع نموذج يتمتع بقدرات بصرية كمساعد بصري.

يمكن للوكيل البصري فحص:

  • لقطات شاشة صفحات الويب
  • الشرائح التقديمية
  • تخطيطات الواجهات
  • لقطات الألعاب المقدمة
  • الرسوم البيانية
  • الأخطاء البصرية

يمكن للنموذج الرئيسي بعد ذلك تصحيح مخرجاته بناءً على الوصف البصري.

DeepSeek V4 Flash 游戏截图分析

وكيل يتمتع بقدرات بصرية

يمكن للوكيل فحص لقطات الشاشة بينما يظل DeepSeek هو نموذج العمل الرئيسي.*

يكون هذا مفيدًا عندما يكون النموذج الرئيسي بارعًا في البرمجة أو الاستدلال ولكنه لا يعالج الصور بشكل أصلي.

لا تمنح هذه التقنية النموذج الرئيسي قدرات بصرية مباشرة. إنها تنشئ سير عمل متعدد النماذج يسمح للنموذج البصري بتحويل لقطات الشاشة إلى معلومات يمكن للوكيل الرئيسي استخدامها.

تحليل تتبع دقيق

يسجل PenguinHarness استدعاءات النماذج وتنفيذ الأدوات والتوقيت واستخدام الرموز والموافقات وأنشطة الوكلاء الفرعيين.

تعرض واجهة التتبع (Trace) تسلسل التنفيذ في شكل خط زمني.

منطقة الإحصائيات العامة في الأعلى تعرض بوضوح قيمًا مثل عدد الدُفعات، واستدعاءات الأدوات، وعدد الاتصالات، بالإضافة إلى البيانات الأساسية مثل رموز الإدخال، ورموز الإخراج، والتكلفة، والمصروفات، وزمن التنفيذ، وTPS الفردي. الواجهة الرئيسية تعرض الخط الزمني لتنفيذ "الجولة الأولى"، حيث يتم التمييز بين كتل زمنية مختلفة حسب الفئات: تفكير النموذج، واستدعاء الأدوات، وانتظار الموافقات، وتنفيذ استدعاءات الأدوات، مع محور زمني يتوافق مع مدة التنفيذ؛ كما يعرض الجزء السفلي سجلات الرسائل التفصيلية للتنفيذ، بما في ذلك تعليمات المستخدم، وعملية تفكير النظام، وتفاصيل استدعاءات الأدوات، مما يعرض بشكل كامل التفاصيل الزمنية لتنفيذ الوكيل، ويتوافق مع عرض Trace الموضح في السياق لعرض الوكلاء الفرعيين المتوازيين، واستدعاءات النماذج، واستخدام الأدوات وغيرها.

يساعد عرض Trace المستخدمين على فحص الوكلاء الفرعيين المتوازيين، واستدعاءات النماذج، واستخدام الأدوات، وزمن الاستجابة، وتكلفة الرموز.

يساعد ذلك في تحديد:

  • استدعاءات النماذج البطيئة
  • استخدام الأدوات غير الضروري
  • حلقات التفكير المكلفة
  • إعادة المحاولة الفاشلة
  • الوكلاء الفرعيون الذين يعيقون سير العمل
  • تأخيرات الموافقة الطويلة
  • المطالبات كثيفة الرموز
  • فرص التنفيذ المتوازي

بيانات Trace هي أيضًا جوهر التطور الذاتي، لأن المُحسِّن يحتاج إلى أدلة حول سبب خسارة الإصدار السابق.

قالب وكيل مصغر بأقل مساحة

يمكن أيضًا استخدام PenguinHarness كوكيل عام بأقل مساحة، وليس فقط كأداة بناء آلية.

يستخدم المشروع Shell كواجهة عامة منخفضة المستوى، ويحافظ بوعي على مجموعة الأدوات الافتراضية صغيرة ومبسطة.

يعتبر تنفيذ الوكلاء الفرعيين خاصية أداء أساسية.

يذكر كود المصدر أن المطالبة النظامية الافتراضية تبلغ حوالي 1,300 رمز، بينما تبلغ القيمة المقارنة لمشروع Claude Code حوالي 15,000 رمز.

هذا الرقم مبلّغ عنه ذاتيًا من المشروع وقد يتغير مع تطور أي من المنتجين.

المبدأ الأساسي للتصميم مستقر: مطالبات أقصر ومجموعة أدوات أصغر تقلل من النفقات الرمزية وتجعل النماذج المفتوحة أسهل في الاستخدام.

نتائج التكلفة والاختبارات المرجعية

نشر المشروع نتائج مقارنة على مجموعة أدوات تحليل بيانات معقدة.

智能体数据分析性能对比

ذكر المشروع أنه في مقارنة تحليل البيانات المعقدة، حقق دقة أعلى بجزء صغير من تكلفة النموذج.

جدول البيانات المنشور يذكر:

الإطار النموذج الدقة استهلاك الرموز التكلفة التقديرية
PenguinHarness DeepSeek V4 Pro 66.67% 18.04M $0.55
Claude Code Claude Opus 4.8 53.33% 22.20M $38.48
OpenAI Codex GPT-5.5 53.33% 13.72M $19.41

يلخصه المشروع على النحو التالي:

  • 1/35 من قيمة Codex المبلّغة
  • حوالي 1/70 من تكلفة Claude Code المبلّغة

تدمج هذه المقارنة سلسلة الأدوات مع النماذج التي تُستخدم عادةً معها. ولا تفصل مساهمة سلسلة الأدوات عن مساهمة النموذج المختار وأسعار المزود.

لإجراء تقييم داخلي عادل، يجب على الفرق تشغيل المهام نفسها باستخدام الشروط التالية:

  • استخدام نفس النموذج قدر الإمكان
  • نفس أسعار المزود
  • نفس استراتيجية إعادة المحاولة
  • نفس صلاحيات الوصول إلى الأدوات
  • نفس الحدود الزمنية
  • نفس معايير التقييم
  • تشغيل متكرر عدة مرات

يمكن استخدام البيانات العامة كمرجع لمعايير المشروع، ولكن لا ينبغي تفسيرها على أنها معدلات تكلفة عامة تنطبق على جميع المهام.

حالات نشر إنتاجية مبلّغ عنها

يذكر المقال المصدر أن الفريق استخدم PenguinHarness في سيناريوهين إنتاجيين.

مراجعة التقارير الطبية

ذُكر أن مؤسسة فحوصات طبية استخدمت PenguinHarness لإنشاء وكيل مراجعة تقارير وُصف أداؤه بأنه يضاهي الخبراء الطبيين.

وفقًا لفريق المشروع، يمكن إكمال المراجعة التي كانت تستغرق حوالي 30 دقيقة في غضون عشرات الثواني.

الفحص في قطاع التصنيع

ذُكر أن إحدى شركات التصنيع نشرت عدة وكلاء مبنيين على PenguinHarness لمراقبة معدات خط الإنتاج بشكل مستمر ومحاولة الاسترداد التلقائي.

أفاد الفريق:

  • انخفاض وقت التوقف بنسبة 65%
  • زيادة الإنتاج إلى ما يقارب ضعف المستوى السابق

ما سبق بيانات من دراسات حالة مقدمة من المورّد. التقرير الأصلي لم يقدم أسماء العملاء أو تصميم الدراسة أو حجم العينة أو تعريفات خط الأساس أو تدقيقًا مستقلًا.

يجب اعتبار هذه أمثلة على حالات استخدام مبلّغ عنها، وليست نتائج تشغيلية مضمونة.

التثبيت والنشر

يدعم PenguinHarness أنظمة Linux وmacOS وWindows 10 أو أحدث، مع دعم x64 وArm64 عند توفرها.

يتضمن سكريبت التثبيت أحادي السطر بيئة تشغيل Node.js المدمجة. يتطلب التثبيت عبر npm Node.js 24 أو أحدث.

Linux أو macOS

curl -fsSL https://penguin.ooo/install.sh | sh
penguin web

عنوان فتح الواجهة هو:

http://127.0.0.1:7364

Windows PowerShell

irm https://penguin.ooo/install.ps1 | iex
penguin web

npm

npm install -g @prismshadow/penguin-cli
penguin web

في التثبيت عبر CLI، يكون اسم المستخدم admin لأول تسجيل دخول إلى الويب. تُطبع كلمة المرور الأولية عند أول تشغيل للخادم ويجب تغييرها فورًا.

تكوين النموذج وتشغيل المهام

يوفر المستودع الرسمي أمثلة على CLI كما يلي:

penguin config model add \
  --provider deepseek \
  --model-id deepseek-v4-flash \
  --api-key sk-... \
  --set-default

تشغيل مهمة لمرة واحدة:

penguin run -m "أنشئ ملف hello.txt يحتوي على Hello, Penguin"

بدء جلسة تفاعلية:

penguin chat

تشغيل خادم بلا واجهة:

penguin server

يجب أبدًا إرسال مفاتيح API إلى نظام إدارة كود المصدر أو لصقها في السجلات العامة.

يمكن تشغيل PenguinHarness على جهاز محلي أو خادم. تدعم واجهته في المتصفح جلسات متعددة، وإدارة الوكلاء والمهارات، وتكوين النماذج، وإحصائيات الاستخدام، ومراقبة Trace، وسير عمل التقييم.

يشير المشروع حاليًا إلى أن بعض

إصدارات سطح المكتب غير موقعة وقد تؤدي إلى تحذيرات من نظام التشغيل عند أول تشغيل. يجب على المستخدمين التنزيل فقط من الموقع الرسمي أو من

قم بتنزيل برنامج التثبيت من GitHub Releases، وتحقق من وصف المشروع قبل تجاوز أي تحذيرات.

الفريق وراء PenguinHarness

تم تطوير PenguinHarness كمشروع مفتوح المصدر بواسطة PrismShadow، وهو فريق تأسس في عام 2025، ويهدف إلى بناء بنية تحتية للوكلاء الأذكياء قادرة على التعلم من المعرفة التجارية وسير العمل والتغذية الراجعة.

الفريق المؤسس الوارد في التقرير الأصلي هو كما يلي:

عضو الفريق الخلفية
تشنغ ياواي مؤسس LlamaFactory؛ يركز على النماذج المتاحة والبنية التحتية للوكلاء
تشيان بويوي دكتوراه من جامعة كاليفورنيا في ديفيس؛ باحث سابق في IBM T. J. Watson وأستاذ سابق في جامعة فودان
وو شيويه جون عضو مؤسس سابق في قسم البرمجة اللغوية العصبية في بايدو؛ شغل مناصب عليا في علي بابا وJD Digits
هو جونهاو طالب دكتوراه في جامعة بكين؛ يشارك في أبحاث كفاءة النماذج والتخزين المؤقت
تشن شي أستاذ في كلية الأعمال بجامعة نيويورك؛ دكتوراه من جامعة كارنيجي ميلون وعالم رئيسي سابق في أمازون

السير الذاتية الواردة في المصدر مقدمة من الناشر وفريق المشروع. عندما تكون لهذه المعلومات تأثير جوهري على التوظيف أو التحقق الأكاديمي، يُنصح القراء بالتحقق منها عبر الصفحات الرسمية للمؤسسات.

من LlamaFactory إلى PenguinHarness، يظل الهدف المعلن للفريق ثابتًا: تحويل البنية التحتية المعقدة للذكاء الاصطناعي إلى أدوات أكثر سهولة في الاستخدام وأكثر موثوقية وكفاءة، لخدمة شريحة أوسع من المستخدمين.

الأسئلة الشائعة

ما هو PenguinHarness؟

PenguinHarness هو إطار عمل مفتوح المصدر للوكلاء، يتيح بناء وتشغيل وتقييم وتحسين الوكلاء الأذكياء. يوفر واجهة ويب، وأدوات سطر أوامر، وحزمة تطوير برمجيات (SDK)، ومهارات مدمجة، وإعدادات نماذج، وتتبعًا، وسير عمل لتقييم متعدد الوكلاء.

هل PenguinHarness مجاني ومفتوح المصدر؟

نعم. يصدَر الكود الأساسي بموجب ترخيص Apache 2.0. يتحمل المستخدمون تكاليف واجهات برمجة التطبيقات للنماذج أو البنية التحتية أو خدمات الطرف الثالث الناتجة عن أعباء عملهم.

هل يمكن تشغيل PenguinHarness محليًا؟

نعم. يمكن تشغيله على Linux وmacOS وWindows، سواء كتطبيق مكتبي أو عبر سطر الأوامر وواجهة المتصفح. كما يمكن تثبيته على خوادم للاستخدام عن بُعد.

هل يدعم PenguinHarness النماذج المحلية؟

نعم. يتضمن مهارات وتكاملات مرتبطة بأدوات مثل Ollama وvLLM، ويدعم نقاط نهاية مخصصة متوافقة مع OpenAI. يعتمد التوافق الفعلي على سلوك واجهة برمجة التطبيقات للنموذج والقدرات المطلوبة.

ماذا يعني التطور الذاتي في PenguinHarness؟

التطور الذاتي يعني أن النظام يقيّم الوكلاء، ويحلل الدرجات وسجلات التتبع، ويعدّل التعليمات أو المهارات أو الإعدادات المعتمدة، ويختبر النسخة التالية المرشحة. لا يتم قبول النسخة المرشحة إلا إذا كان أداؤها أفضل في ظل التقييم المكوّن.

هل يمكن للوكلاء ذاتيي التطور تعديل نواة PenguinHarness؟

ينص عقد المشروع على أن ذلك غير مسموح. يقتصر التطور على مساحات العمل والتعليمات والمهارات والإعدادات المعتمدة، بينما تبقى نواة الإطار وآليات الأمان دون تغيير.

هل تكلفة بناء وكيل ¥0.2 مضمونة؟

لا. رقم ¥0.2 مستمد من عرض توضيحي واحد للمشروع استخدم DeepSeek V4 Pro لإنشاء تطبيق RAG. التكلفة الفعلية تعتمد على تسعير النموذج، واستهلاك الرموز، وعدد المحاولات، والموفر، وتعقيد المهمة.

ما هو GDPevo؟

GDPevo هو معيار مفتوح لقياس قدرة التطور الذاتي للوكلاء على مهام تجارية حقيقية معزولة. النسخة العامة V2 تتضمن 240 مهمة موزعة على 24 فئة، وتميّز بين مهام التدريب ومهام الاختبار.

أدوات ذات صلة

  • PenguinHarness: الموقع الرسمي، يتضمن التنزيلات والوثائق والأمثلة وتعليمات التثبيت.
  • مستودع PenguinHarness على GitHub: الكود المصدري بترخيص Apache 2.0، وملف README، وإصدارات النشر، وأمثلة سطر الأوامر، ودليل المساهمة.
  • GDPevo: بيانات المعيار، وخط سير البناء، ومساحات عمل التقييم، والنتائج التجريبية المنشورة.
  • LlamaFactory: إطار عمل مفتوح المصدر من ياواي تشنغ للضبط الدقيق الفعال لنماذج اللغة ونماذج اللغة والرؤية.
  • vLLM: محرك مفتوح المصدر للاستدلال عالي الإنتاجية للنماذج محليًا وعلى الخوادم.
  • Ollama: بيئة تشغيل نماذج محلية يمكن استخدامها في سير عمل تطوير الوكلاء.
  • OpenRouter: بوابة واجهات برمجة تطبيقات موحدة للوصول إلى مزودي نماذج مستضافين متعددين.

روابط ذات صلة

  • مقدمة عن PenguinHarness: المقال الرسمي الصادر عن فريق المشروع، يشرح فلسفة "الوكلاء يبنون الوكلاء".
  • وثائق PenguinHarness: الوثائق الرسمية للتثبيت والنماذج والمهارات والاستخدام.
  • مستودع PenguinHarness على GitHub: الكود المصدري، وقائمة النماذج المدعومة حاليًا، والأوامر، وترخيص Apache 2.0.
  • إصدارات PenguinHarness: حزم التثبيت الرسمية لسطح المكتب وسطر الأوامر للمنصات المدعومة.
  • ورقة GDPevo: بحث أكاديمي يصف تصميم المعيار وقواعد الخلط ونتائج التقييم.
  • مستودع GDPevo على GitHub: المعيار الرسمي وبيانات المهام ونتائج التقييم ومساحات العمل القابلة لإعادة الإنتاج.
  • مستودع LlamaFactory على GitHub: المستودع الرسمي لإطار ضبط النماذج المُشار إليه في المقال.

الخلاصة

PenguinHarness هو منصة مفتوحة المصدر تتيح للوكلاء بناء تطبيق وكيل آخر بناءً على احتياجات اللغة الطبيعية. يمكنه توليد الهيكل البرمجي، والتعليمات، والمهارات، والإعدادات، والكود، والواجهة الأمامية، وتعليمات التشغيل، مع دعم النماذج المستضافَة والمحلية.

ينصب التركيز طويل المدى على التطور الذاتي. تعمل وكلاء تقييم متعددون على تقييم الوكيل المستهدف، ويحلل المُحسِّن النتائج ومسارات التنفيذ، ولا يتم قبول النسخة المرشحة إلا عند حصولها على درجات أعلى. يحدد ملف CONTRACT.md ما يمكن تغييره، ويتطلب لقطات، واسترجاعًا، ومعايير تقييم مخفية، وموافقات، وعزلًا للبيانات الاعتمادية، وسجلات تدقيق.

أبلغ المشروع عن تخفيضات ملحوظة في التكاليف ومكاسب إنتاجية مبكرة، لكن هذه الأرقام هي عروض توضيحية ودراسات حالة مقدمة من الفريق، وليست استنتاجات قابلة للتعميم.

ضمانات. يوفر مستودع Apache 2.0 والأوامر المنشورة ومعيار GDPevo للعديد من المطورين مواد كافية لاختبار هذه المنهجية على أعباء عملهم الخاصة.

الفكرة الأساسية لـ PenguinHarness واضحة ومباشرة: بناء الوكلاء يمكن أتمتته، لكن تحسينه بأمان يتطلب تقييمًا قابلًا للقياس، وحدودًا صارمة، وتغييرات قابلة للتراجع.