مساعد بايدو ونشين يتصدر معيار SuperCLUE XClaw بعد تصدره PinchBench v2
حصل مساعد بايدو ونشين على المركز الأول في معيار آخر من نوع الوكيل الذكي. في تقييم منتجات XClaw لشهر أغسطس 2026 من SuperCLUE، حصل مساعد ونشين على درجة إجمالية بلغت 97

مساعد وينشين من بايدو يتصدر SuperCLUE XClaw بعد تصدره PinchBench v2
مقدمة
حقق مساعد وينشين من بايدو المركز الأول في معيار تقييم آخر بأسلوب الوكيل الذكي.
في تقييم منتج XClaw الصادر عن SuperCLUE في أغسطس 2026، حصل مساعد وينشين على درجة إجمالية بلغت 97.62، وهي أعلى درجة في اللقطة المنشورة.
وكانت درجاته حسب الفئات كما يلي:
| القدرة | الدرجة |
|---|---|
| البرمجة | 90.28 |
| إنشاء المحتوى | 99.44 |
| معالجة البيانات | 98.86 |
| التحليل البحثي | 96.44 |
| الذاكرة | 100.00 |
وجاءت هذه النتيجة بعد أقل من ثلاثة أسابيع من أداء قوي آخر.
في لقطة يوليو من PinchBench v2، سجّل وكيل المهام من بايدو — المقدَّم باسم وضع أوريون — أفضل درجة بنسبة 94.6% ومتوسط درجة بنسبة 94.4%، مما وضعه في صدارة لوحة المتصدرين في تلك اللقطة.
يختلف المعياران عن بعضهما. يركز SuperCLUE XClaw على منتجات الوكلاء الصينية والمخرجات العملية عبر خمسة أبعاد للقدرات. أما PinchBench v2، الذي أنشأته Kilo، فيرتكز على مهام حاسوبية وأتمتة واقعية.
ويشير كلاهما معًا إلى نفس التحول:
ينتقل تقييم الوكلاء من "هل يمكن للنموذج الإجابة بشكل صحيح؟" إلى "هل يمكن للنظام إنجاز المهمة وتقديم شيء قابل للاستخدام؟"
يمكن لنموذج اللغة أن يعرف الإجابة ومع ذلك يفشل كوكيل لأنه ينسى المتطلبات، أو يختار الأداة الخاطئة، أو يسيء التعامل مع الملفات، أو يتوقف في منتصف سير العمل، أو يعيد ناتجًا غير صحيح.
وهذا يجعل أحدث نتائج وينشين مرتبطة بتنفيذ المهام أكثر من ارتباطها بذكاء نموذج اللغة الخام.

مساعد وينشين يتصدر SuperCLUE XClaw
تصف SuperCLUE منصة XClaw بأنها تقييم موجه نحو المنتجات للمساعدين الذكيين بأسلوب "Claw".
وبدلاً من الاعتماد بشكل أساسي على أسئلة الاختيار من متعدد، يركز المعيار على المخرجات المنجزة.
تصنف لقطة أغسطس 2026 المنتجات الرائدة على النحو التالي:
| الترتيب | المنتج | الدرجة |
|---|---|---|
| 1 | مساعد وينشين من بايدو | 97.62 |
| 2 | MiMoClaw | 96.74 |
| 3 | WorkBuddy | 96.61 |
| 4 | KimiClaw | 96.01 |
| 5 | MaxClaw | 94.79 |
يقيم المعيار خمسة أبعاد:
- معالجة البيانات.
- إنشاء المحتوى.
- الذاكرة.
- البرمجة.
- التحليل البحثي.
المنطق الأساسي واضح ومباشر: يتلقى الوكيل مهمة ويجب أن ينتج ناتجًا أو نتيجة نهائية يمكن الحكم عليها فعليًا.
وهذا يجعل اتباع التعليمات، والتعامل مع الملفات، واستخدام الأدوات، والتنفيذ طويل المدى جزءًا من الدرجة.

الذاكرة تصل إلى 100
الفئة الأكثر إثارة للانتباه هي 100.00 في الذاكرة.
الذاكرة مهمة لأن العمل الحقيقي نادرًا ما يتسع في مطالبة واحدة معزولة.
قد يقدم المستخدم قيودًا في وقت مبكر من المحادثة ويتوقع من الوكيل احترامها في وقت لاحق.
على سبيل المثال:
الدورة 1:
استخدم بيانات الربع الثاني من 2026 فقط.
الدورة 3:
أبقِ التقرير في أقل من 10 صفحات.
الدورة 6:
استخدم نفس تقسيم المنتجات الوارد في جدول البيانات.
الدورة 10:
أنشئ مستند Word النهائي.
الوكيل الذي ينسى التعليمات الأولى يمكن أن ينتج مخرجات مصقولة لكنها غير قابلة للاستخدام.
لذلك تؤثر الذاكرة على:
- الاحتفاظ بالمتطلبات.
- التخطيط متعدد الخطوات.
- الاتساق.
- إعادة العمل.
- ثقة المستخدم.
- إنجاز المهام طويلة الأمد.
الحصول على درجة مثالية في فئة واحدة من معيار تقييمي لا يعني أن المنتج لن ينسى المعلومات أبدًا في الجلسات الواقعية العشوائية. لكنه يُظهر أن وينكسين أدى بشكل ممتاز في مهام الذاكرة المضمنة في هذا التقييم من XClaw.
معالجة البيانات تحقق 98.86
حصل مساعد وينكسين على 98.86 في معالجة البيانات.
يصف المصدر هذه الفئة بأنها اختبار لقدرة النظام على تفسير الحقول، ودمج المعلومات، والحفاظ على الدقة الرقمية، وإنتاج مخرجات منظمة.
هذه مهام صعبة بشكل خادع.
قد يلخص نموذج الدردشة العام جدول بيانات بشكل جيد مع ارتكاب خطأ واحد دقيق في:
- فلتر التاريخ.
- المجموع الفرعي.
- البحث عبر الأوراق.
- تحويل الوحدات.
- القيمة العشرية.
- تعيين الفئات.
في الاستخدام التجاري، يمكن لرقم واحد خاطئ أن يبطل مستندًا كاملًا.
اختبر الناشر المصدر وينكسين بملف معلومات شركة وطلب منه إنتاج خطة عمل للربع الثاني من 2026 كمستند Word.
وفقًا لسجل الاختبار، قام الوكيل:
- باستخدام Pandoc لاستخراج الملف المرفوع.
- بتنظيم معلومات المصدر.
- بتحميل قدرة معالجة Word.
- بإنشاء مستند منسق.
- بإرجاع مستند يحتوي على أكثر من 6000 حرف صيني و148 فقرة.

هذا يُظهر الفرق بين الدردشة وعمل الوكيل.
قد يكتب نموذج الدردشة الخطة داخل المحادثة.
أما سير عمل الوكيل فيمكنه القيام بذلك:
قراءة الملف المصدر
→ استخراج المعلومات المنظمة
→ صياغة المحتوى
→ تنسيق مستند Word
→ التحقق من المخرجات
→ إرجاع ملف
المنتج النهائي هو الأداة المنجزة، وليس الاستجابة النصية.
إنشاء المحتوى يحقق 99.44
حصل وينكسين على 99.44 في إنشاء المحتوى.
في معيار تقييم الوكلاء، إنشاء المحتوى ليس مجرد كتابة إبداعية.
قد يحتاج النظام إلى تلبية قيود متعددة في وقت واحد:
- التنسيق المطلوب.
- النبرة.
- الطول.
- هيكل الأقسام.
- الجمهور.
- نوع الملف.
- الدقة الواقعية.
- العرض المرئي.
قد تكون المسودة سليمة نحويًا ومع ذلك تفشل لأنها
يتجاهل التنسيق المطلوب.
ولهذا السبب، تزداد معايير تقييم المنتجات قياسًا لاكتمال المهام بدلاً من الجودة اللغوية وحدها.
نتائج البرمجة: 90.28
كانت أدنى فئة في XClaw لـ"وينشين" هي البرمجة بمعدل 90.28.
ومع ذلك، لا يزال هذا الرقم قويًا، لكن الفجوة مقارنةً بصناعة المحتوى ومعالجة البيانات تكشف الكثير.
وكلاء البرمجة يضطرون إلى إدارة حلقة تشغيلية أوسع:
فهم المتطلب
→ اختيار التقنية
→ كتابة الملفات
→ التنفيذ أو المعاينة
→ فحص الأخطاء
→ الإصلاح
→ التحقق من التفاعل
→ تجهيز النتيجة
اختبر الناشر المصدر المنتج بطلب من جملة واحدة لبناء محاكي نظام شمسي ثلاثي الأبعاد.
سير العمل المُبلَغ عنه استخدم Three.js وأعاد ملف HTML واحد بسعة 31 كيلوبايت.
كما يعرض المقال أيضًا صفحة تعليمية لمحاكاة الطقس تم توليدها من خلال سير عمل تفاعلي مشابه.
هذه أمثلة توضيحية وليست بنودًا رسمية في معايير XClaw.

نتائج تحليل الأبحاث: 96.44
حصل "وينشين" على 96.44 في تحليل الأبحاث.
قد تتضمن المهمة البحثية الجادة الخطوات التالية:
- فهم السؤال.
- تقسيمه إلى أسئلة فرعية.
- البحث في مصادر متعددة.
- تقييم جودة المصادر.
- مقارنة الادعاءات المتضاربة.
- التحقق من التواريخ.
- استخراج القيم الرقمية.
- بناء حجة منظمة.
- إضافة الاستشهادات.
- إنتاج تقرير.
يصف المقال المصدر حالتين اختباريتين.
البحث في مشكلة كيكيا ثلاثية الأبعاد
طلب الناشر من "وينشين" البحث في حدسية كيكيا ثلاثية الأبعاد في سياق أعمال الحائز على ميدالية فيلدز "هونغ وانغ".
السلوك المُبلَغ عنه للوكيل كان:
- وضع خطة بحث من ست خطوات.
- إطلاق عدة وكلاء فرعيين بالتوازي.
- البحث في 16 مصدرًا أكاديميًا.
- إنتاج مستند Markdown.
- إنتاج ملف HTML تفاعلي بحجم 62 كيلوبايت.

عدد المصادر ليس مقياسًا للجودة بحد ذاته.
المهم هو ما إذا كان الوكيل النهائي يستخدم مصادر موثوقة، وينسب الادعاءات بشكل صحيح، ويحل التعارضات، ويتجنب البيانات القديمة، ويفصل الحقائق عن التفسير.
مقارنة نماذج الذكاء الاصطناعي والأسعار الحديثة
طلب الناشر أيضًا من "وينشين" تحليل قدرات وأسعار النماذج الرئيسية المحلية والدولية في الشهر السابق.
المقال يذكر أن الوكيل:
- حمّل مهارة بحث صناعي.
- بحث في 45 مصدرًا عبر جولتين.
- رصد عدم يقين في بعض الأرقام الرئيسية.
- أجرى بحثًا مستهدفًا إضافيًا عبر 29 مصدرًا.
- تحقق من الأسعار بشكل متقاطع.
- أنتج تقريرًا بحوالي 7000 حرف صيني مع رسوم بيانية.

حلقة البحث المفيدة هي:
بحث
→ تحديد مواطن عدم اليقين
→ البحث مرة أخرى
→ مقارنة المصادر
→ حل أو الإشارة إلى الخلاف
→ كتابة
غالبًا ما يكون هذا الفحص الإضافي هو المكان الذي تتحسن فيه جودة البحث.
المركز الأول الثاني: PinchBench v2
جاءت نتيجة SuperCLUE بعد احتلال المركز الأول في يوليو على PinchBench v2.
أنشأت Kilo منصة PinchBench لتقييم الوكلاء في سير العمل الواقعي بدلاً من معايير الأسئلة والأجوبة التقليدية.
وسّع إصدار Kilo من PinchBench 2.0 المعيار ليشمل 148 مهمة وأضاف قواعد تصنيف وترتيب أكثر صرامة.
في لقطة الترتيب لشهر يوليو التي أعادت المقالة المصدرية إنتاجها، ظهر نظام بايدو على النحو التالي:
Orion-Mission-Mode
مع:
أفضل نتيجة: 94.6%
متوسط النتيجة: 94.4%

تضع لقطة الشاشة نظام Orion Mission Mode في المقدمة أمام الأنظمة المستندة إلى نماذج من Anthropic وAlibaba وNVIDIA وXiaomi وxAI وOpenAI وغيرها في تلك اللقطة المحددة.
الكلمة المهمة هي لقطة.
تتغير ترتيبات الوكلاء بسرعة.
يمكن تحديث النماذج وأطر العمل والاستدلالات وسياسات الأدوات وإرسالات المعايير في أي وقت.
لذلك، يجب الاستشهاد بنتيجة المركز الأول في يوليو مع تاريخها بدلاً من التعامل معها كترتيب عالمي دائم.
ما يختبره PinchBench v2 فعليًا
تصف Kilo منصة PinchBench 2.0 بأنها معيار لسير عمل الوكلاء في العالم الحقيقي.
تحتوي على مهام تتطلب من النظام استخدام الأدوات وإكمال العمليات بدلاً من مجرد اختيار إجابة.
يغطي المعيار فئات مثل:
- الكتابة.
- العمل الإبداعي.
- تحليل البيانات.
- البحث والعمل المعرفي.
- البرمجة والعمليات.
- سير عمل حاسوبي أخرى.
تقول المقالة المصدرية إن 59 إدخالًا من النماذج أو الوكلاء تم تمثيلها في لقطة الترتيب.
يمكن أن يتغير هذا العدد مع إضافة أو تحديث الإرسالات.
المعيار نفسه أكثر استقرارًا من مجموعة الترتيب.
يصف الإصدار الرسمي لـ PinchBench 2.0:
148 مهمة
يصف المصدر والعديد من تقارير يوليو تقييم Wenxin عبر 147 مهمة مكتملة بينما يصفون أيضًا PinchBench كمعيار من 148 مهمة.
التفسير الأكثر أمانًا هو:
يحتوي PinchBench v2 على 148 مهمة؛ وقد يكون تقييم Orion Mission Mode المبلغ عنه قد أنتج نتائج مُسجلة على 147 منها في تلك اللقطة.
هذا التمييز مهم لأن تقارير المعايير غالبًا ما تخلط بين حجم المعيار وعدد المهام المكتملة بنجاح
المدى المُنجَز.
أفضل نتيجة مقابل متوسط النتيجة
يؤكد المصدر أن وضع مهمة أوريون سجّل:
أفضل نتيجة 94.6%
متوسط النتيجة 94.4%
الفارق البالغ 0.2 نقطة صغير.
وهذا يشير إلى تباين منخفض عبر عمليات التشغيل المُبلَّغ عنها.
ومع ذلك، لا ينبغي تفسير ذلك على أنه ضمان استقرار شامل.
يمكن أن يعتمد تباين المعايير على:
- عدد مرات التكرار.
- درجة حرارة أخذ العينات.
- توافر الأدوات.
- المواقع الخارجية.
- ظروف الشبكة.
- سلوك المُصحِّح.
- انتهاء مهلة الوكيل.
- تحديثات النموذج.
الدرس العملي هو ببساطة أن تشغيل PinchBench المُبلَّغ عنه لم يُبنَ حول نتيجة محظوظة معزولة واحدة.
فقد ظل متوسطه قريبًا من أفضل نتيجة له.
الوكيل أكثر من مجرد النموذج الأساسي
من أهم النقاط في المقال المصدر أن المعيار يقيس منتجًا أو نظام وكيل، وليس نموذجًا لغويًا مكشوفًا.
يمكن لوكيل المهمة أن يجمع بين:
- نموذج أساسي.
- البحث.
- الذاكرة.
- التعامل مع الملفات.
- اختيار الأدوات.
- التخطيط.
- الوكلاء الفرعيون.
- مهارات إنشاء المستندات.
- الوصول إلى المتصفح أو الويب.
- تنفيذ الأكواد.
- التحقق.
يمكن التعبير عن ذلك على النحو التالي:
نتيجة الوكيل
=
قدرة النموذج
+
الأدوات
+
الذاكرة
+
التخطيط
+
البحث
+
بيئة التنفيذ
+
التحقق
لهذا السبب ينبغي توخي الحذر عند القول:
"النموذج X تفوق على النموذج Y."
قد يقارن لوح الصدارة فعليًا بين مجموعتي وكلاء مختلفتين تستخدمان أدوات وتنسيقًا مختلفين.
الوصف الأكثر دقة هو:
"نظام الوكيل X حصل على نتيجة أعلى من نظام الوكيل Y ضمن إعدادات هذا المعيار."
تصبح هذه الصياغة أكثر أهمية مع تحول منتجات الذكاء الاصطناعي إلى أنظمة برمجية معقدة.
من الإجابة على الأسئلة إلى إنجاز العمل
يؤطر المقال المصدر عام 2026 على أنه العام الذي يتحول فيه معيار المنتج الذكي المفيد.
كان التفاعل القديم يبدو هكذا:
يسأل المستخدم
← يجيب النموذج
← ينفذ المستخدم العمل
النمط الوكيل الناشئ يبدو هكذا:
يعطي المستخدم هدفًا
← يخطط الوكيل
← يجمع الوكيل السياق
← يستدعي الوكيل الأدوات
← ينشئ الوكيل ملفات
← يتحقق الوكيل من النتائج
← يسلّم الوكيل المنتج النهائي
هذا يغيّر ما يلاحظه المستخدمون.
يمكن أن يكون النموذج واسع المعرفة لكنه محبط إذا لم يتمكن من:
- تذكر المتطلبات السابقة.
- فتح الملف.
- تنسيق جدول البيانات.
- إنشاء المستند المطلوب.
- إنهاء جميع الخطوات.
- تصحيح أخطائه بنفسه.
شرط النجاح الجديد أقرب إلى:
هل أُنجزت المهمة فعليًا؟
من:
هل كانت الإجابة مذهلة؟
نقطة دخول المهمة في وينكس
يعرض مقال BAAI خيار "المهمة" مباشرة داخل واجهة وينكس.

يصف الموقع الرسمي لبايدو وينكس المنتج بأنه مساعد ذكاء اصطناعي متعدد الوسائط من أجل:
- الإنشاء الموثوق.
- البحث العميق.
- الاستخدام الذكي للأدوات.
- العمل على المستندات.
- الكتابة.
- الصور.
الاستخدام عبر الأجهزة المتعددة.
كما يدرج تطبيق بايدو مساعد ونشين كميزة ذكاء اصطناعي مدمجة للبحث العميق والكتابة وتوليد الصور وتوليد الفيديو والمساعدة conversational.
وهذا يؤكد أن الذكاء الاصطناعي الموجه نحو المهام انتقل إلى الأسطح الاستهلاكية الرئيسية لبايدو بدلاً من البقاء تجربة مقتصرة على المطورين.
هل مساعد ونشين مجاني وغير محدود حقًا؟
تسلط المقالة المصدرية الضوء مرارًا على نقطة تجارية واحدة:
مساعد ونشين مجاني ولا يوجد جدار للدفع.
صفحات بايدو الرسمية لونشين تقدم حاليًا وصولًا مجانيًا أو تجربة مجانية.
ومن السهل التحقق من ذلك.
البيان الأقوى—مجاني بشكل دائم وغير محدود لكل ميزات وكلاء المهام—من الصعب التحقق منه من صفحة سياسة رسمية ثابتة.
يمكن أن تقدم منتجات الذكاء الاصطناعي:
- حصص يومية.
- حدود للاستخدام المتزامن.
- حدود خاصة بالميزات.
- عروض ترويجية مؤقتة.
- مستويات حسابات.
- قيود إقليمية.
- تغييرات مستقبلية في الأسعار.
للنشر، الصياغة الأكثر أمانًا هي:
يتوفر مساعد ونشين حاليًا للمستخدمين الأفراد مع خيارات وصول مجانية، والتجربة الموضحة في المقالة المصدرية لم تتطلب اشتراكًا مدفوعًا.
لا تبنِ مقارنة تكلفة طويلة الأجل حول "مجاني إلى الأبد" ما لم تنشر بايدو سياسة محددة تضمن ذلك.
لماذا يمكن لتجربة البحث أن تساعد الوكيل
يقول القسم الأخير من المقالة المصدرية إن سجل بحث بايدو يمنحه ميزة هيكلية في تصميم الوكلاء.
هناك تشبيه حقيقي.
يتعامل محرك البحث مع شيء مثل:
استعلام المستخدم
← فهم النية
← تحليل الاستعلام
← الاسترجاع
← الترتيب
← تجميع النتائج
← الاستجابة
ويتعامل الوكيل مع:
هدف المستخدم
← فهم النية
← تحليل المهمة
← اختيار الأداة
← التنفيذ
← تجميع النتائج
← التسليم
الخطان ليسا متطابقين.
الوكيل لديه مساحة عمل أكبر بكثير ويتحمل مخاطر تنفيذية أكبر.
لكن العديد من القدرات التقنية تنتقل بشكل طبيعي:
- فهم النية.
- إعادة كتابة الاستعلام.
- الاسترجاع.
- ترتيب المصادر.
- سياق الجلسة.
- معالجة الحداثة.
- إزالة التكرار.
- تجميع الأدلة.
هذا ذو صلة خاصة بـوكلاء البحث.
النظام الذي يمتلك بالفعل بنية بحث قوية يمكنه بناء سير عمل أعمق فوقها.
فهم استعلام البحث مقابل فهم مهمة الوكيل
ضع في اعتبارك طلب بحث تقليدي:
ابحث عن أرخص رحلة طيران من بكين إلى شنغهاي.
قد يحتاج نظام البحث إلى استنتاج:
- نقطة الانطلاق.
- الوجهة.
- تواريخ السفر.
- تفضيل السعر.
- مخزون الرحلات المؤهل.
- ترتيب الفرز.
وكيل يُسأل:
ابحث عن أرخص رحلة بكين–شنغهاي وجهّز جدول رحلة.
قد يحتاج إلى إضافة:
- اختيار الأداة.
- عمليات بحث متعددة.
- المقارنة.
- التحقق من القيود.
- توليد ملفات.
- ربما خطوة تقويم أو حجز.
النصف الأول من المشكلة يشبه البحث.
النصف الثاني هو تنسيق الإجراءات.
توفر تجربة البحث مكونات مفيدة، لكن جودة الوكيل لا تزال تعتمد على طبقة التنفيذ.
الذاكرة وجلسات البحث مرتبطتان—لكنهما ليسا نفس الشيء
يربط المصدر أيضًا درجة ذاكرة ونشين بتجربة بايدو في فهم جلسات البحث.
هناك
بعض التداخل المفاهيمي.
كلا النظامين يحتاجان إلى استنتاج أي المعلومات من التفاعلات السابقة تظل ذات صلة.
قد تحتوي جلسة البحث على:
الاستعلام 1: سيارات كهربائية
الاستعلام 2: مدى يتجاوز 600 كم
الاستعلام 3: أقل من 250,000 يوان صيني
يجب أن يفهم النظام أن الاستعلام الثالث لا يزال يتعلق بالسيارات الكهربائية.
نظام ذاكرة الوكيل لديه مهمة أصعب.
قد يحتاج إلى تذكر:
- تفضيلات المستخدم.
- قيود المهمة.
- حقائق مستمدة من الملفات.
- القرارات.
- مخرجات الأدوات.
- الحالة المؤقتة.
- التفضيلات طويلة الأجل.
خبرة جلسات البحث مفيدة، لكن ذاكرة الوكيل المستمرة تتطلب آليات إضافية للتخزين والاسترجاع والخصوصية والملاءمة.
التحليل البحثي هو المجال الذي تكون فيه بنية بايدو البحثية الأكثر صلة مباشرة
من بين فئات XClaw الخمس، يعد التحليل البحثي أوضح مكان يمكن أن تنتقل فيه خلفية بايدو البحثية مباشرة.
وكيل البحث يحتاج إلى:
- تغطية البحث.
- معلومات حديثة.
- توسيع الاستعلام.
- الترتيب.
- معالجة الاستشهادات.
- مقارنة المصادر.
- فهم الكيانات.
- الاسترجاع متعدد اللغات.
توثيق بايدو الرسمي لمساعد Qianfan AI يصف أيضًا حلاً لوكيل المؤسسات يدمج بحث بايدو، وموسوعة بايدو، والبحث بالصور، وإدارة المحادثات، وإدارة الذاكرة، وقدرات المستندات.
هذا لا يثبت أن منتج وينشين الاستهلاكي يستخدم نفس التنفيذ بالضبط.
لكنه يُظهر أن بايدو تبني حزمة وكيل مشتركة حول البحث والذاكرة والأدوات والاسترجاع متعدد الوسائط عبر مجموعة منتجاتها.
ما لا تثبته الانتصارات في الاختبارين المعياريين
درجات الاختبارات المعيارية العالية دليل مفيد.
لكنها ليست التقييم الكامل.
لا تثبت قيادة عالمية دائمة
لوحات المتصدرين تتغير.
النماذج الجديدة والطلبات الجديدة للوكلاء يمكنها تجاوز المتصدر الحالي.
لا تثبت أن كل مهمة ستحصل على 97٪
XClaw يجمع مهام وفئات مختارة.
سير العمل الحقيقي للمستخدم قد يكون مختلفًا جدًا.
لا تعزل النموذج الأساسي
النتيجة تعود للمساعد الكامل أو حزمة الوكيل الكاملة.
لا تقيس كل قضايا السلامة
الوكيل الذي يمكنه إكمال المهام بكفاءة قد لا يزال يقوم باستدعاءات أدوات غير آمنة أو يكشف معلومات حساسة في بيئة مختلفة.
لا تضمن الدقة الواقعية
وكلاء البحث قد يستشهدون بمصادر ضعيفة أو يسيئون قراءة البيانات المتغيرة.
لا تثبت الاستخدام المجاني غير المحدود
تسعير المنتج والحصص هي سياسات تجارية، وليست خصائص الاختبارات المعيارية.
كيفية تقييم مساعد وينشين بنفسك
يجب أن يحاكي الاختبار الشخصي المفيد عملك الحقيقي.
لا تطرح أسئلة تافهة فقط.
امنح الوكيل مهمة كاملة.
الاختبار 1: الذاكرة
قدّم خمسة قيود في بداية محادثة طويلة.
بعد عدة جولات غير ذات صلة، اطلب مخرجات نهائية وتحقق مما إذا كانت جميع القيود الخمسة محفوظة.
الاختبار 2: معالجة البيانات
ارفع:
- جدول بيانات.
- ملف PDF.
- ملف نصي قصير.
اطلب من الوكيل دمجها في تقرير واحد.
تحقق من كل قيمة رقمية بشكل مستقل.
الاختبار 3: البحث
اختر موضوعًا بمعلومات متغيرة.
تتطلب:
- مصادر أولية.
- تواريخ النشر.
- مقارنة المصادر المتعارضة.
- روابط مباشرة.
- قائمة بالادعاءات غير المؤكدة.
الاختبار 4: المستند
الإنشاء
اطلب إنشاء مستند Word أو عرض تقديمي أو جدول بيانات أو ملف HTML.
التقييم:
- البنية.
- التنسيق.
- الاكتمال.
- إمكانية التنزيل.
- ما إذا كان الملف يُفتح فعليًا.
الاختبار 5: البرمجة
اطلب تطبيقًا تفاعليًا صغيرًا.
تحقق من:
- هل يعمل؟
- هل توجد جميع الميزات المطلوبة؟
- هل تم إصلاح الأخطاء؟
- هل الملف النهائي مكتفٍ ذاتيًا عند الطلب؟
الاختبار 6: التنفيذ طويل المدى
قدّم مهمة تتطلب عدة أدوات.
راقب ما إذا كان النظام:
- يضع خطة.
- يختار أدوات معقولة.
- يتعافى من الإخفاقات.
- يتجنب تكرار العمل.
- يتحقق من النتيجة النهائية.
طريقة أفضل لمقارنة منتجات الوكلاء
عند مقارنة Wenxin بالوكلاء الآخرين، استخدم جدولًا أوسع من "درجة القياس".
| البُعد | ما الذي يُقاس |
|---|---|
| نجاح المهمة | هل اكتمل العمل المطلوب؟ |
| الذاكرة | هل تم الاحتفاظ بالقيود السابقة؟ |
| الدقة | هل الأرقام والادعاءات صحيحة؟ |
| جودة البحث | هل المصادر موثوقة وحديثة؟ |
| موثوقية الأدوات | هل تنجح استدعاءات الأدوات باستمرار؟ |
| جودة المخرجات | هل الملفات قابلة للاستخدام دون إصلاح يدوي؟ |
| التعافي | هل يمكن للوكيل إصلاح الخطوات الفاشلة؟ |
| زمن الاستجابة | كم يستغرق إكمال مهمة كاملة؟ |
| التكلفة | كم تكلف النتيجة المقبولة الواحدة؟ |
| الخصوصية | كيف يتم التعامل مع الملفات المرفوعة والذاكرة؟ |
| التوفر | هل الميزات الرئيسية مجانية أو محدودة الحصة أو مدفوعة؟ |
هذا يعطي صورة أكثر واقعية من ترتيب واحد في لوحة الصدارة.
التحول الأكبر: "هل يمكنه التسليم؟"
أقوى نقطة في المقال المصدر أوسع من بايدو.
منافسة الوكلاء تغير تعريف جودة الذكاء الاصطناعي.
بالنسبة للجيل الأول من روبوتات الدردشة، ركز المستخدمون على جودة الإجابات.
بالنسبة لوكلاء المهام الحاليين، أصبحت الأسئلة الرئيسية:
- هل يمكنه الحفاظ على السياق؟
- هل يمكنه العثور على المعلومات الصحيحة؟
- هل يمكنه تشغيل الأدوات؟
- هل يمكنه إنشاء الملف؟
- هل يمكنه إكمال سير عمل متعدد الخطوات؟
- هل يمكنه التحقق من نتيجته الخاصة؟
- هل يمكنني الوثوق به في العمل المتكرر؟
لهذا السبب تجذب معايير مثل XClaw وPinchBench الانتباه.
إنها تقرّب التقييم من العمل الإنتاجي الفعلي.
لا يزال هناك مسافة طويلة بين المعيار والنشر في المؤسسات.
لكن الاتجاه مفيد:
معيار المعرفة
→ معيار التفكير المنطقي
→ معيار استخدام الأدوات
→ معيار المهام الشاملة من البداية إلى النهاية
→ النتيجة الإنتاجية الحقيقية
الخطوة الأخيرة هي في النهاية ما يهم.
الأسئلة الشائعة
ما الدرجة التي حصل عليها مساعد بايدو Wenxin في SuperCLUE XClaw؟
لقطة أغسطس 2026 من SuperCLUE XClaw تعطي مساعد Wenxin درجة إجمالية قدرها 97.62، مما يضعه في المرتبة الأولى بين المنتجات المعروضة. وكانت درجات فئاته: 90.28 للبرمجة، و99.44 لإنشاء المحتوى، و98.86 لمعالجة البيانات، و96.44 للتحليل البحثي، و100 للذاكرة.
ماذا تعني درجة الذاكرة 100؟
تعني أن Wenxin حصل على علامة كاملة في مهام الذاكرة المدرجة في ذلك التقييم من XClaw. لا تعني أن المساعد لا يمكنه أبدًا نسيان السياق في أي محادثة حقيقية ممكنة.
ما هو PinchBench v2؟
PinchBench v2 هو معيار وكلاء أنشأته Kilo لتقييم الأنظمة على مهام حاسوبية ومهام سير عمل واقعية. تحتوي النسخة 2.0 على 148 مهمة ومصممة لقياس
التنفيذ من البداية إلى النهاية بدلاً من مجرد الإجابة على الأسئلة البسيطة.
ما هي نتيجة وينشين في معيار PinchBench الإصدار 2؟
في لقطة من لوحة الصدارة بتاريخ يوليو 2026، ظهر وكيل المهام الخاص بشركة بايدو تحت اسم وضع أوريون بنتيجة أفضل بلغت 94.6% ونتيجة متوسطة بلغت 94.4%. تتغير لوحات الصدارة بمرور الوقت، لذا يجب تضمين تاريخ اللقطة عند الاستشهاد بالنتيجة.
هل مساعد وينشين مجاني بالكامل؟
توفر الصفحات الرسمية لشركة بايدو الخاصة بوينشين حاليًا خيارات وصول مجاني أو تجربة مجانية، ويذكر المقال المصدر أن ميزات المهام المعروضة كانت متاحة دون اشتراك مدفوع. لم يتم العثور على ضمان رسمي ثابت بشأن الاستخدام غير المحدود بشكل دائم لجميع الميزات، لذا يجب التحقق من الحصص الحالية مباشرة في المنتج.
هل يمكن لمساعد وينشين إنشاء مستندات Word وصفحات ويب؟
يعرض المقال المصدر جلسات اختبار أنشأ فيها وينشين خطة عمل بتنسيق Word وصفحات HTML تفاعلية. توضح هذه الأمثلة سير عمل المهام في المنتج، لكنها ليست ضمانًا بأن كل طلب أو بيئة سينتج عنها نفس النتيجة.
لماذا قد تساعد تقنية البحث من بايدو وكلاء الذكاء الاصطناعي الخاصين بها؟
يشترك البحث والوكلاء في قدرات مثل فهم النية، وتفكيك الاستعلام، والاسترجاع، والترتيب، وتجميع المصادر، وسياق الجلسة. يضيف الوكلاء طبقة تنفيذ أوسع تشمل استدعاء الأدوات، وإنشاء الملفات، والذاكرة، والتخطيط، والتنفيذ الفعلي.
هل XClaw وPinchBench معايير لنماذج الذكاء الاصطناعي؟
ليس بالمعنى الضيق. فهي تقيّم أنظمة المنتجات أو الوكلاء التي قد تجمع بين النماذج والأدوات والذاكرة والبحث والاستدعاءات والتنسيق وبيئات التنفيذ. لذلك، يجب أن تُنسب نتائجهما إلى تكوين الوكيل الكامل.
الأدوات ذات الصلة
- بايدو وينشين: مساعد الذكاء الاصطناعي متعدد الوسائط الرسمي من بايدو للبحث والإبداع والمستندات والأعمال الموجهة بالمهام.
- SuperCLUE XClaw: معيار الوكلاء الصيني الموجه للمنتجات المشار إليه في المقال المصدر.
- PinchBench: معيار كيلو الواقعي لسير عمل الوكلاء في البرمجة واستخدام الحاسوب.
- Pandoc: أداة تحويل المستندات المستخدمة في سير عمل الاختبار بالمقال المصدر لاستخراج وتحويل محتوى المستندات.
- Three.js: مكتبة رسومات ثلاثية الأبعاد بلغة جافا سكريبت استُخدمت في مثال النظام الشمسي المُنشأ في المقال المصدر.
- بايدو تشيانفان: منصة بايدو المؤسسية للنماذج والوكلاء والبيانات وتطوير تطبيقات الذكاء الاصطناعي.
- باني الوكلاء من بايدو: منصة بايدو لبناء ونشر وكلاء مخصصين يعتمدون على وينشين.
الروابط ذات الصلة
- الموقع الرسمي لبايدو وينشين: نقطة الدخول الرسمية الحالية للمنتج لمساعد وينشين عبر الويب والعملاء القابلين للتنزيل.
- مساعد وينشين المكتبي لسطح المكتب: الصفحة الرسمية لسطح المكتب التي تسلط الضوء على تحليل المستندات والبحث والإبداع والتصدير والتجربة المجانية.
- [SuperCLUE XClaw أغسطس 2026
التقييم](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): صفحة المعايير المشار إليها في المقال الأصلي.
- Kilo: PinchBench 2.0 Is Here: الشرح الرسمي لمهام PinchBench v2 البالغ عددها 148 مهمة، وتغيّرات التقييم، والتقييم المتوازي، وتصميم لوحة المتصدرين.
- توثيق مساعد بايدو تشيانفان للذكاء الاصطناعي: الوثائق الرسمية التي تصف مساعد المؤسسات الذكي المتكامل مع البحث من بايدو، والذاكرة، والمحادثة، وخدمات الملفات.
- صفحة التحميل الرسمية لتطبيق بايدو: صفحة تطبيق بايدو الرسمية التي تصف مساعد وينشين المدمج وميزات البحث العميق.
- توثيق منشئ الوكلاء وينشين من بايدو: الوثائق الرسمية لبناء الوكلاء في نظام وينشين من بايدو.
الملخص
احتل مساعد وينشين من بايدو المركز الأول في لقطة XClaw لشهر أغسطس 2026 من SuperCLUE برصيد 97.62 نقطة، بما في ذلك علامة كاملة قدرها 100 في الذاكرة ودرجات تفوق 96 في معالجة البيانات، وإنشاء المحتوى، والتحليل البحثي.
تأتي هذه النتيجة بعد لقطة يوليو من لوحة متصدرين PinchBench v2 التي سجّل فيها وضع أوريون للمهام من بايدو أعلى نتيجة بنسبة 94.6% ومتوسط نتيجة بنسبة 94.4%. تستخدم المعايير مهام مختلفة، لكن كلاهما يؤكد على إنجاز المهام الفعلي بدلاً من مجرد الإجابة عن الأسئلة.
الخلاصة الأقوى ليست أن مساعداً واحداً "فاز" بشكل دائم بسباق الوكلاء. ترتيب الوكلاء يتغير بسرعة، والأنظمة التي تم قياسها تشمل النماذج، والأدوات، والبحث، والذاكرة، والاستدلالات، والتنسيق.
ما تظهره النتيجتان هو أن تقييم الذكاء الاصطناعي يتحرك نحو معيار أكثر عملية: ليس ما إذا كان النموذج يبدو ذكياً، بل ما إذا كان الوكيل قادراً على إنجاز العمل وتسليم نتيجة قابلة للاستخدام.