مساعد بايدو ونشين يتصدر معيار SuperCLUE XClaw بعد تصدره PinchBench v2

حصل مساعد بايدو ونشين على المركز الأول في معيار آخر من نوع الوكيل الذكي. في تقييم منتجات XClaw لشهر أغسطس 2026 من SuperCLUE، حصل مساعد ونشين على درجة إجمالية بلغت 97

发布于 2026年8月7日generalGEO 评分: 03 次阅读
مساعد بايدو ونشين يتصدر معيار SuperCLUE XClaw بعد تصدره PinchBench v2

مساعد وينشين من بايدو يتصدر SuperCLUE XClaw بعد تصدره PinchBench v2

مقدمة

حقق مساعد وينشين من بايدو المركز الأول في معيار تقييم آخر بأسلوب الوكيل الذكي.

في تقييم منتج XClaw الصادر عن SuperCLUE في أغسطس 2026، حصل مساعد وينشين على درجة إجمالية بلغت 97.62، وهي أعلى درجة في اللقطة المنشورة.

وكانت درجاته حسب الفئات كما يلي:

القدرة الدرجة
البرمجة 90.28
إنشاء المحتوى 99.44
معالجة البيانات 98.86
التحليل البحثي 96.44
الذاكرة 100.00

وجاءت هذه النتيجة بعد أقل من ثلاثة أسابيع من أداء قوي آخر.

في لقطة يوليو من PinchBench v2، سجّل وكيل المهام من بايدو — المقدَّم باسم وضع أوريونأفضل درجة بنسبة 94.6% ومتوسط درجة بنسبة 94.4%، مما وضعه في صدارة لوحة المتصدرين في تلك اللقطة.

يختلف المعياران عن بعضهما. يركز SuperCLUE XClaw على منتجات الوكلاء الصينية والمخرجات العملية عبر خمسة أبعاد للقدرات. أما PinchBench v2، الذي أنشأته Kilo، فيرتكز على مهام حاسوبية وأتمتة واقعية.

ويشير كلاهما معًا إلى نفس التحول:

ينتقل تقييم الوكلاء من "هل يمكن للنموذج الإجابة بشكل صحيح؟" إلى "هل يمكن للنظام إنجاز المهمة وتقديم شيء قابل للاستخدام؟"

يمكن لنموذج اللغة أن يعرف الإجابة ومع ذلك يفشل كوكيل لأنه ينسى المتطلبات، أو يختار الأداة الخاطئة، أو يسيء التعامل مع الملفات، أو يتوقف في منتصف سير العمل، أو يعيد ناتجًا غير صحيح.

وهذا يجعل أحدث نتائج وينشين مرتبطة بتنفيذ المهام أكثر من ارتباطها بذكاء نموذج اللغة الخام.

تُظهر هذه الصورة لوحة متوسط درجات تقييم SuperCLUE-XClaw لمنتجات اللوبستر لشهر أغسطس 2026، وتعرض بوضوح ترتيب منتجات الشركات المشاركة ودرجاتها المقابلة. حيث يحتل مساعد وينشين من بايدو المركز الأول بدرجة 97.62؛ ويليه MiMoClaw من شياومي في المركز الثاني بدرجة 96.74؛ ويأتي WorkBuddy من تينسنت وKimiClaw من Moonshot AI في المركزين الثاني والثاني على التوالي بدرجتي 96.61 و96.01؛ ويحتل MaxClaw من Xiyu Technology المركز الثالث بدرجة 94.79. وتشير الصفحة إلى معايير اللوحة ودفعات البيانات وغيرها من المعلومات، مما يعكس بوضوح أداء القدرات لهذه المنتجات في تقييم المنتجات الذكية الصينية، بما يتوافق مع ما ورد في الوثيقة حول حصول مساعد وينشين على أعلى درجة في تقييم SuperCLUE XClaw.

مساعد وينشين يتصدر SuperCLUE XClaw

تصف SuperCLUE منصة XClaw بأنها تقييم موجه نحو المنتجات للمساعدين الذكيين بأسلوب "Claw".

وبدلاً من الاعتماد بشكل أساسي على أسئلة الاختيار من متعدد، يركز المعيار على المخرجات المنجزة.

تصنف لقطة أغسطس 2026 المنتجات الرائدة على النحو التالي:

الترتيب المنتج الدرجة
1 مساعد وينشين من بايدو 97.62
2 MiMoClaw 96.74
3 WorkBuddy 96.61
4 KimiClaw 96.01
5 MaxClaw 94.79

يقيم المعيار خمسة أبعاد:

  1. معالجة البيانات.
  2. إنشاء المحتوى.
  3. الذاكرة.
  4. البرمجة.
  5. التحليل البحثي.

المنطق الأساسي واضح ومباشر: يتلقى الوكيل مهمة ويجب أن ينتج ناتجًا أو نتيجة نهائية يمكن الحكم عليها فعليًا.

وهذا يجعل اتباع التعليمات، والتعامل مع الملفات، واستخدام الأدوات، والتنفيذ طويل المدى جزءًا من الدرجة.

![تُظهر الصورة ترتيب مساعد وينشين من بايدو في أبعاد قدرات SuperCLUE XClaw (متوسط الدرجات). حيث بلغت درجاته في الأبعاد الخمسة — تطوير البرمجيات، إنشاء المحتوى، معالجة البيانات، التحليل البحثي، والذاكرة — 90.28 و99.44 و98.86 و96.44 و100.00 على التوالي. تتوافق هذه الصورة مع ما ورد أعلاه حول كون SuperCLUE XClaw تقييمًا موجهًا نحو المنتجات للمساعدين الذكيين بأسلوب "Claw"، وتعرض بشكل مباشر أداء مساعد وينشين من بايدو في نظام التقييم هذا، مما يوفر دعمًا بياناتيًا لتصدره في SuperCLUE XClaw.](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/08/8091b61c-6902-450f-b7a9-6798e0b4b1a9-85d3c984-465d-4f02-a847-63b0ef72d60d.png)

الذاكرة تصل إلى 100

الفئة الأكثر إثارة للانتباه هي 100.00 في الذاكرة.

الذاكرة مهمة لأن العمل الحقيقي نادرًا ما يتسع في مطالبة واحدة معزولة.

قد يقدم المستخدم قيودًا في وقت مبكر من المحادثة ويتوقع من الوكيل احترامها في وقت لاحق.

على سبيل المثال:

الدورة 1:
استخدم بيانات الربع الثاني من 2026 فقط.

الدورة 3:
أبقِ التقرير في أقل من 10 صفحات.

الدورة 6:
استخدم نفس تقسيم المنتجات الوارد في جدول البيانات.

الدورة 10:
أنشئ مستند Word النهائي.

الوكيل الذي ينسى التعليمات الأولى يمكن أن ينتج مخرجات مصقولة لكنها غير قابلة للاستخدام.

لذلك تؤثر الذاكرة على:

  • الاحتفاظ بالمتطلبات.
  • التخطيط متعدد الخطوات.
  • الاتساق.
  • إعادة العمل.
  • ثقة المستخدم.
  • إنجاز المهام طويلة الأمد.

الحصول على درجة مثالية في فئة واحدة من معيار تقييمي لا يعني أن المنتج لن ينسى المعلومات أبدًا في الجلسات الواقعية العشوائية. لكنه يُظهر أن وينكسين أدى بشكل ممتاز في مهام الذاكرة المضمنة في هذا التقييم من XClaw.

معالجة البيانات تحقق 98.86

حصل مساعد وينكسين على 98.86 في معالجة البيانات.

يصف المصدر هذه الفئة بأنها اختبار لقدرة النظام على تفسير الحقول، ودمج المعلومات، والحفاظ على الدقة الرقمية، وإنتاج مخرجات منظمة.

هذه مهام صعبة بشكل خادع.

قد يلخص نموذج الدردشة العام جدول بيانات بشكل جيد مع ارتكاب خطأ واحد دقيق في:

  • فلتر التاريخ.
  • المجموع الفرعي.
  • البحث عبر الأوراق.
  • تحويل الوحدات.
  • القيمة العشرية.
  • تعيين الفئات.

في الاستخدام التجاري، يمكن لرقم واحد خاطئ أن يبطل مستندًا كاملًا.

اختبر الناشر المصدر وينكسين بملف معلومات شركة وطلب منه إنتاج خطة عمل للربع الثاني من 2026 كمستند Word.

وفقًا لسجل الاختبار، قام الوكيل:

  1. باستخدام Pandoc لاستخراج الملف المرفوع.
  2. بتنظيم معلومات المصدر.
  3. بتحميل قدرة معالجة Word.
  4. بإنشاء مستند منسق.
  5. بإرجاع مستند يحتوي على أكثر من 6000 حرف صيني و148 فقرة.

هذه الصورة تعرض نتائج اختبار مساعد بايدو وينكسين كوكيل ذكي لإنجاز مهمة إنشاء خطة عمل تجارية. يظهر أعلى الصورة إصدار المستخدم تعليمات للوكيل لكتابة خطة عمل الربع الثاني من 2026 لشركة ناشئة في مجال الذكاء الاصطناعي للأجهزة الذكية "تشي شين وي لاي"، مع إنشاء مستند Word يلبي متطلبات الأقسام المحددة؛ ويعرض أسفل الصورة نتيجة تنفيذ المهمة، موضحة نجاح إنشاء مستند Word المطلوب، حيث يضم المستند حوالي 6000 حرف و148 فقرة، مستوفيًا متطلبات عدد الكلمات واجتاز التحقق، مع توفير خيار تنزيل المستند، مما يعكس بوضوح قدرة وينكسين في معالجة البيانات وإنشاء المحتوى المنظم.

هذا يُظهر الفرق بين الدردشة وعمل الوكيل.

قد يكتب نموذج الدردشة الخطة داخل المحادثة.

أما سير عمل الوكيل فيمكنه القيام بذلك:

قراءة الملف المصدر
→ استخراج المعلومات المنظمة
→ صياغة المحتوى
→ تنسيق مستند Word
→ التحقق من المخرجات
→ إرجاع ملف

المنتج النهائي هو الأداة المنجزة، وليس الاستجابة النصية.

إنشاء المحتوى يحقق 99.44

حصل وينكسين على 99.44 في إنشاء المحتوى.

في معيار تقييم الوكلاء، إنشاء المحتوى ليس مجرد كتابة إبداعية.

قد يحتاج النظام إلى تلبية قيود متعددة في وقت واحد:

  • التنسيق المطلوب.
  • النبرة.
  • الطول.
  • هيكل الأقسام.
  • الجمهور.
  • نوع الملف.
  • الدقة الواقعية.
  • العرض المرئي.

قد تكون المسودة سليمة نحويًا ومع ذلك تفشل لأنها

يتجاهل التنسيق المطلوب.

ولهذا السبب، تزداد معايير تقييم المنتجات قياسًا لاكتمال المهام بدلاً من الجودة اللغوية وحدها.

نتائج البرمجة: 90.28

كانت أدنى فئة في XClaw لـ"وينشين" هي البرمجة بمعدل 90.28.

ومع ذلك، لا يزال هذا الرقم قويًا، لكن الفجوة مقارنةً بصناعة المحتوى ومعالجة البيانات تكشف الكثير.

وكلاء البرمجة يضطرون إلى إدارة حلقة تشغيلية أوسع:

فهم المتطلب
→ اختيار التقنية
→ كتابة الملفات
→ التنفيذ أو المعاينة
→ فحص الأخطاء
→ الإصلاح
→ التحقق من التفاعل
→ تجهيز النتيجة

اختبر الناشر المصدر المنتج بطلب من جملة واحدة لبناء محاكي نظام شمسي ثلاثي الأبعاد.

سير العمل المُبلَغ عنه استخدم Three.js وأعاد ملف HTML واحد بسعة 31 كيلوبايت.

كما يعرض المقال أيضًا صفحة تعليمية لمحاكاة الطقس تم توليدها من خلال سير عمل تفاعلي مشابه.

هذه أمثلة توضيحية وليست بنودًا رسمية في معايير XClaw.

الصورة هي غلاف خطة العمل التجارية للربع الثاني من عام 2026، بخلفية زرقاء فاتحة، وفي الأعلى عبارة "المستقبل الذكي - خطة العمل التجارية للربع الثاني 2026". العنوان هو "خطة العمل التجارية للربع الثاني 2026"، والعنوان الفرعي "التركيز على الأجهزة الذكية بالذكاء الاصطناعي: من صنع في الصين إلى صنع بذكاء في الصين". وفي الأسفل يظهر اسم الشركة "شركة المستقبل الذكي للتكنولوجيا المحدودة"، مع الإشارة إلى أنها وثيقة سرية مخصصة للاستخدام الداخلي وللمستثمرين المهتمين فقط، بتاريخ يونيو 2026. الغلاف يقع في بداية الوثيقة، ويُقدّم للمحتوى اللاحق حول خطة الأعمال في الأجهزة الذكية بالذكاء الاصطناعي.

نتائج تحليل الأبحاث: 96.44

حصل "وينشين" على 96.44 في تحليل الأبحاث.

قد تتضمن المهمة البحثية الجادة الخطوات التالية:

  1. فهم السؤال.
  2. تقسيمه إلى أسئلة فرعية.
  3. البحث في مصادر متعددة.
  4. تقييم جودة المصادر.
  5. مقارنة الادعاءات المتضاربة.
  6. التحقق من التواريخ.
  7. استخراج القيم الرقمية.
  8. بناء حجة منظمة.
  9. إضافة الاستشهادات.
  10. إنتاج تقرير.

يصف المقال المصدر حالتين اختباريتين.

البحث في مشكلة كيكيا ثلاثية الأبعاد

طلب الناشر من "وينشين" البحث في حدسية كيكيا ثلاثية الأبعاد في سياق أعمال الحائز على ميدالية فيلدز "هونغ وانغ".

السلوك المُبلَغ عنه للوكيل كان:

  1. وضع خطة بحث من ست خطوات.
  2. إطلاق عدة وكلاء فرعيين بالتوازي.
  3. البحث في 16 مصدرًا أكاديميًا.
  4. إنتاج مستند Markdown.
  5. إنتاج ملف HTML تفاعلي بحجم 62 كيلوبايت.

هذه الصورة تعرض نتائج أحدث الأبحاث المتعلقة بحدسية كيكيا ثلاثية الأبعاد المرتبطة بميدالية فيلدز والتي أنجزها مساعد وينشين. تم تنفيذ البحث وفق خطة مكوّنة من ست خطوات مسبقًا، وشمل توضيح التعريف الأساسي للحدسية، واستعراض مسار الدراسات السابقة، ونقاط الابتكار، وتفكيك المنطق التقاطعي للمجالات المرتبطة، وجمع 16 مصدرًا أكاديميًا موثوقًا لإتمام البحث، وأخيرًا تم توليد مستند Markdown بحجم 63.746 كيلوبايت وتقرير HTML تفاعلي بحجم 62.83 كيلوبايت. وتتوافق هذه النتائج مباشرة مع حالة دراسة مشكلة كيكيا ثلاثية الأبعاد المذكورة في الوثيقة.

عدد المصادر ليس مقياسًا للجودة بحد ذاته.

المهم هو ما إذا كان الوكيل النهائي يستخدم مصادر موثوقة، وينسب الادعاءات بشكل صحيح، ويحل التعارضات، ويتجنب البيانات القديمة، ويفصل الحقائق عن التفسير.

مقارنة نماذج الذكاء الاصطناعي والأسعار الحديثة

طلب الناشر أيضًا من "وينشين" تحليل قدرات وأسعار النماذج الرئيسية المحلية والدولية في الشهر السابق.

المقال يذكر أن الوكيل:

  • حمّل مهارة بحث صناعي.
  • بحث في 45 مصدرًا عبر جولتين.
  • رصد عدم يقين في بعض الأرقام الرئيسية.
  • أجرى بحثًا مستهدفًا إضافيًا عبر 29 مصدرًا.
  • تحقق من الأسعار بشكل متقاطع.
  • أنتج تقريرًا بحوالي 7000 حرف صيني مع رسوم بيانية.

تعرض الصورة غلاف تقرير تحليل القدرات والأسعار للنماذج الكبيرة الرئيسية محليًا ودوليًا لشهر يوليو 2026. يظهر في أعلى الغلاف تاريخ "يوليو 2026"، وفي الوسط عنوان رئيسي بخط كبير "تقرير تحليل القدرات والأسعار للنماذج الكبيرة الرئيسية محليًا ودوليًا"، وفي الأسفل نص صغير "——استنادًا إلى تحليل شامل لبيانات Artificial Analysis وLMSYS Arena والبيانات العامة من الشركات المصنعة——". التقرير مميز بعلامة فحص الاقتباس الأكاديمي، وتعرض الصفحة رقم 1 من 76، وعدد الكلمات 6900. ترتبط هذه الصورة بمحتوى "تحليل قدرات وأسعار النماذج الكبيرة الرئيسية محليًا ودوليًا" في المستند، وهي صورة غلاف التقرير.

حلقة البحث المفيدة هي:

بحث
→ تحديد مواطن عدم اليقين
→ البحث مرة أخرى
→ مقارنة المصادر
→ حل أو الإشارة إلى الخلاف
→ كتابة

غالبًا ما يكون هذا الفحص الإضافي هو المكان الذي تتحسن فيه جودة البحث.

المركز الأول الثاني: PinchBench v2

جاءت نتيجة SuperCLUE بعد احتلال المركز الأول في يوليو على PinchBench v2.

أنشأت Kilo منصة PinchBench لتقييم الوكلاء في سير العمل الواقعي بدلاً من معايير الأسئلة والأجوبة التقليدية.

وسّع إصدار Kilo من PinchBench 2.0 المعيار ليشمل 148 مهمة وأضاف قواعد تصنيف وترتيب أكثر صرامة.

في لقطة الترتيب لشهر يوليو التي أعادت المقالة المصدرية إنتاجها، ظهر نظام بايدو على النحو التالي:

Orion-Mission-Mode

مع:

أفضل نتيجة:    94.6%
متوسط النتيجة: 94.4%

تُظهر هذه الصورة لقطة شاشة لترتيب درجات الأنظمة المتعلقة بـ PinchBench v2، وتعرض المؤشرات الأساسية ودرجات كل نظام ذكاء اصطناعي. تظهر الأعمدة البرتقالية في الصورة بعلامة "متوسط الدرجة"، ويحقق نظام Orion-Mission-Mode في الأعلى متوسط درجة 94.6%، ويحتل المركز الأول بدرجة 94.4%، متقدمًا بفارق كبير على أنظمة أخرى مثل anthropic/claude-opus-4.1 وqwen1.5/3.7-max. تعرض لقطة الشاشة أيضًا علامات القدرات الفرعية لكل نظام، بما في ذلك كتابة المحتوى والإبداع وتحليل البيانات وغيرها، مما يعرض بشكل مباشر أداء كل نموذج في أبعاد المهام المختلفة، بما يتماشى مع المحتوى المذكور في المستند حول احتلال Wenxin Assistant للمركز الأول في لقطة يوليو من هذا المعيار.

تضع لقطة الشاشة نظام Orion Mission Mode في المقدمة أمام الأنظمة المستندة إلى نماذج من Anthropic وAlibaba وNVIDIA وXiaomi وxAI وOpenAI وغيرها في تلك اللقطة المحددة.

الكلمة المهمة هي لقطة.

تتغير ترتيبات الوكلاء بسرعة.

يمكن تحديث النماذج وأطر العمل والاستدلالات وسياسات الأدوات وإرسالات المعايير في أي وقت.

لذلك، يجب الاستشهاد بنتيجة المركز الأول في يوليو مع تاريخها بدلاً من التعامل معها كترتيب عالمي دائم.

ما يختبره PinchBench v2 فعليًا

تصف Kilo منصة PinchBench 2.0 بأنها معيار لسير عمل الوكلاء في العالم الحقيقي.

تحتوي على مهام تتطلب من النظام استخدام الأدوات وإكمال العمليات بدلاً من مجرد اختيار إجابة.

يغطي المعيار فئات مثل:

  • الكتابة.
  • العمل الإبداعي.
  • تحليل البيانات.
  • البحث والعمل المعرفي.
  • البرمجة والعمليات.
  • سير عمل حاسوبي أخرى.

تقول المقالة المصدرية إن 59 إدخالًا من النماذج أو الوكلاء تم تمثيلها في لقطة الترتيب.

يمكن أن يتغير هذا العدد مع إضافة أو تحديث الإرسالات.

المعيار نفسه أكثر استقرارًا من مجموعة الترتيب.

يصف الإصدار الرسمي لـ PinchBench 2.0:

148 مهمة

يصف المصدر والعديد من تقارير يوليو تقييم Wenxin عبر 147 مهمة مكتملة بينما يصفون أيضًا PinchBench كمعيار من 148 مهمة.

التفسير الأكثر أمانًا هو:

يحتوي PinchBench v2 على 148 مهمة؛ وقد يكون تقييم Orion Mission Mode المبلغ عنه قد أنتج نتائج مُسجلة على 147 منها في تلك اللقطة.

هذا التمييز مهم لأن تقارير المعايير غالبًا ما تخلط بين حجم المعيار وعدد المهام المكتملة بنجاح

المدى المُنجَز.

أفضل نتيجة مقابل متوسط النتيجة

يؤكد المصدر أن وضع مهمة أوريون سجّل:

أفضل نتيجة 94.6%
متوسط النتيجة 94.4%

الفارق البالغ 0.2 نقطة صغير.

وهذا يشير إلى تباين منخفض عبر عمليات التشغيل المُبلَّغ عنها.

ومع ذلك، لا ينبغي تفسير ذلك على أنه ضمان استقرار شامل.

يمكن أن يعتمد تباين المعايير على:

  • عدد مرات التكرار.
  • درجة حرارة أخذ العينات.
  • توافر الأدوات.
  • المواقع الخارجية.
  • ظروف الشبكة.
  • سلوك المُصحِّح.
  • انتهاء مهلة الوكيل.
  • تحديثات النموذج.

الدرس العملي هو ببساطة أن تشغيل PinchBench المُبلَّغ عنه لم يُبنَ حول نتيجة محظوظة معزولة واحدة.

فقد ظل متوسطه قريبًا من أفضل نتيجة له.

الوكيل أكثر من مجرد النموذج الأساسي

من أهم النقاط في المقال المصدر أن المعيار يقيس منتجًا أو نظام وكيل، وليس نموذجًا لغويًا مكشوفًا.

يمكن لوكيل المهمة أن يجمع بين:

  • نموذج أساسي.
  • البحث.
  • الذاكرة.
  • التعامل مع الملفات.
  • اختيار الأدوات.
  • التخطيط.
  • الوكلاء الفرعيون.
  • مهارات إنشاء المستندات.
  • الوصول إلى المتصفح أو الويب.
  • تنفيذ الأكواد.
  • التحقق.

يمكن التعبير عن ذلك على النحو التالي:

نتيجة الوكيل
=
قدرة النموذج
+
الأدوات
+
الذاكرة
+
التخطيط
+
البحث
+
بيئة التنفيذ
+
التحقق

لهذا السبب ينبغي توخي الحذر عند القول:

"النموذج X تفوق على النموذج Y."

قد يقارن لوح الصدارة فعليًا بين مجموعتي وكلاء مختلفتين تستخدمان أدوات وتنسيقًا مختلفين.

الوصف الأكثر دقة هو:

"نظام الوكيل X حصل على نتيجة أعلى من نظام الوكيل Y ضمن إعدادات هذا المعيار."

تصبح هذه الصياغة أكثر أهمية مع تحول منتجات الذكاء الاصطناعي إلى أنظمة برمجية معقدة.

من الإجابة على الأسئلة إلى إنجاز العمل

يؤطر المقال المصدر عام 2026 على أنه العام الذي يتحول فيه معيار المنتج الذكي المفيد.

كان التفاعل القديم يبدو هكذا:

يسأل المستخدم
← يجيب النموذج
← ينفذ المستخدم العمل

النمط الوكيل الناشئ يبدو هكذا:

يعطي المستخدم هدفًا
← يخطط الوكيل
← يجمع الوكيل السياق
← يستدعي الوكيل الأدوات
← ينشئ الوكيل ملفات
← يتحقق الوكيل من النتائج
← يسلّم الوكيل المنتج النهائي

هذا يغيّر ما يلاحظه المستخدمون.

يمكن أن يكون النموذج واسع المعرفة لكنه محبط إذا لم يتمكن من:

  • تذكر المتطلبات السابقة.
  • فتح الملف.
  • تنسيق جدول البيانات.
  • إنشاء المستند المطلوب.
  • إنهاء جميع الخطوات.
  • تصحيح أخطائه بنفسه.

شرط النجاح الجديد أقرب إلى:

هل أُنجزت المهمة فعليًا؟

من:

هل كانت الإجابة مذهلة؟

نقطة دخول المهمة في وينكس

يعرض مقال BAAI خيار "المهمة" مباشرة داخل واجهة وينكس.

الصورة تعرض واجهة مساعد بايدو وينكس. في الأعلى يوجد مربع حوار نصه "هل تريد أن تكون 'شخصًا عالي الكفاءة' اليوم، أم تبحث عن حوار للنقاش؟"، وفي الأسفل يوجد حقل إدخال نصه "ساعدني في كتابة قالب تقديم ذاتي للمقابلة". يوجد في أسفل الواجهة عدة خيارات وظيفية، وقد تم تمييز خيار "المهمة" بإطار أحمر. هذه الصورة مرتبطة بما ذُكر أعلاه حول "نقطة دخول المهمة في وينكس"، وتعرض بشكل مباشر موقع خيار "المهمة" في واجهة وينكس، مما يؤكد ما ورد في مقال BAAI بأن خيار "المهمة" موجود مباشرة داخل واجهة وينكس.

يصف الموقع الرسمي لبايدو وينكس المنتج بأنه مساعد ذكاء اصطناعي متعدد الوسائط من أجل:

  • الإنشاء الموثوق.
  • البحث العميق.
  • الاستخدام الذكي للأدوات.
  • العمل على المستندات.
  • الكتابة.
  • الصور.

الاستخدام عبر الأجهزة المتعددة.

كما يدرج تطبيق بايدو مساعد ونشين كميزة ذكاء اصطناعي مدمجة للبحث العميق والكتابة وتوليد الصور وتوليد الفيديو والمساعدة conversational.

وهذا يؤكد أن الذكاء الاصطناعي الموجه نحو المهام انتقل إلى الأسطح الاستهلاكية الرئيسية لبايدو بدلاً من البقاء تجربة مقتصرة على المطورين.

هل مساعد ونشين مجاني وغير محدود حقًا؟

تسلط المقالة المصدرية الضوء مرارًا على نقطة تجارية واحدة:

مساعد ونشين مجاني ولا يوجد جدار للدفع.

صفحات بايدو الرسمية لونشين تقدم حاليًا وصولًا مجانيًا أو تجربة مجانية.

ومن السهل التحقق من ذلك.

البيان الأقوى—مجاني بشكل دائم وغير محدود لكل ميزات وكلاء المهام—من الصعب التحقق منه من صفحة سياسة رسمية ثابتة.

يمكن أن تقدم منتجات الذكاء الاصطناعي:

  • حصص يومية.
  • حدود للاستخدام المتزامن.
  • حدود خاصة بالميزات.
  • عروض ترويجية مؤقتة.
  • مستويات حسابات.
  • قيود إقليمية.
  • تغييرات مستقبلية في الأسعار.

للنشر، الصياغة الأكثر أمانًا هي:

يتوفر مساعد ونشين حاليًا للمستخدمين الأفراد مع خيارات وصول مجانية، والتجربة الموضحة في المقالة المصدرية لم تتطلب اشتراكًا مدفوعًا.

لا تبنِ مقارنة تكلفة طويلة الأجل حول "مجاني إلى الأبد" ما لم تنشر بايدو سياسة محددة تضمن ذلك.

لماذا يمكن لتجربة البحث أن تساعد الوكيل

يقول القسم الأخير من المقالة المصدرية إن سجل بحث بايدو يمنحه ميزة هيكلية في تصميم الوكلاء.

هناك تشبيه حقيقي.

يتعامل محرك البحث مع شيء مثل:

استعلام المستخدم
← فهم النية
← تحليل الاستعلام
← الاسترجاع
← الترتيب
← تجميع النتائج
← الاستجابة

ويتعامل الوكيل مع:

هدف المستخدم
← فهم النية
← تحليل المهمة
← اختيار الأداة
← التنفيذ
← تجميع النتائج
← التسليم

الخطان ليسا متطابقين.

الوكيل لديه مساحة عمل أكبر بكثير ويتحمل مخاطر تنفيذية أكبر.

لكن العديد من القدرات التقنية تنتقل بشكل طبيعي:

  • فهم النية.
  • إعادة كتابة الاستعلام.
  • الاسترجاع.
  • ترتيب المصادر.
  • سياق الجلسة.
  • معالجة الحداثة.
  • إزالة التكرار.
  • تجميع الأدلة.

هذا ذو صلة خاصة بـوكلاء البحث.

النظام الذي يمتلك بالفعل بنية بحث قوية يمكنه بناء سير عمل أعمق فوقها.

فهم استعلام البحث مقابل فهم مهمة الوكيل

ضع في اعتبارك طلب بحث تقليدي:

ابحث عن أرخص رحلة طيران من بكين إلى شنغهاي.

قد يحتاج نظام البحث إلى استنتاج:

  • نقطة الانطلاق.
  • الوجهة.
  • تواريخ السفر.
  • تفضيل السعر.
  • مخزون الرحلات المؤهل.
  • ترتيب الفرز.

وكيل يُسأل:

ابحث عن أرخص رحلة بكين–شنغهاي وجهّز جدول رحلة.

قد يحتاج إلى إضافة:

  • اختيار الأداة.
  • عمليات بحث متعددة.
  • المقارنة.
  • التحقق من القيود.
  • توليد ملفات.
  • ربما خطوة تقويم أو حجز.

النصف الأول من المشكلة يشبه البحث.

النصف الثاني هو تنسيق الإجراءات.

توفر تجربة البحث مكونات مفيدة، لكن جودة الوكيل لا تزال تعتمد على طبقة التنفيذ.

الذاكرة وجلسات البحث مرتبطتان—لكنهما ليسا نفس الشيء

يربط المصدر أيضًا درجة ذاكرة ونشين بتجربة بايدو في فهم جلسات البحث.

هناك

بعض التداخل المفاهيمي.

كلا النظامين يحتاجان إلى استنتاج أي المعلومات من التفاعلات السابقة تظل ذات صلة.

قد تحتوي جلسة البحث على:

الاستعلام 1: سيارات كهربائية
الاستعلام 2: مدى يتجاوز 600 كم
الاستعلام 3: أقل من 250,000 يوان صيني

يجب أن يفهم النظام أن الاستعلام الثالث لا يزال يتعلق بالسيارات الكهربائية.

نظام ذاكرة الوكيل لديه مهمة أصعب.

قد يحتاج إلى تذكر:

  • تفضيلات المستخدم.
  • قيود المهمة.
  • حقائق مستمدة من الملفات.
  • القرارات.
  • مخرجات الأدوات.
  • الحالة المؤقتة.
  • التفضيلات طويلة الأجل.

خبرة جلسات البحث مفيدة، لكن ذاكرة الوكيل المستمرة تتطلب آليات إضافية للتخزين والاسترجاع والخصوصية والملاءمة.

التحليل البحثي هو المجال الذي تكون فيه بنية بايدو البحثية الأكثر صلة مباشرة

من بين فئات XClaw الخمس، يعد التحليل البحثي أوضح مكان يمكن أن تنتقل فيه خلفية بايدو البحثية مباشرة.

وكيل البحث يحتاج إلى:

  • تغطية البحث.
  • معلومات حديثة.
  • توسيع الاستعلام.
  • الترتيب.
  • معالجة الاستشهادات.
  • مقارنة المصادر.
  • فهم الكيانات.
  • الاسترجاع متعدد اللغات.

توثيق بايدو الرسمي لمساعد Qianfan AI يصف أيضًا حلاً لوكيل المؤسسات يدمج بحث بايدو، وموسوعة بايدو، والبحث بالصور، وإدارة المحادثات، وإدارة الذاكرة، وقدرات المستندات.

هذا لا يثبت أن منتج وينشين الاستهلاكي يستخدم نفس التنفيذ بالضبط.

لكنه يُظهر أن بايدو تبني حزمة وكيل مشتركة حول البحث والذاكرة والأدوات والاسترجاع متعدد الوسائط عبر مجموعة منتجاتها.

ما لا تثبته الانتصارات في الاختبارين المعياريين

درجات الاختبارات المعيارية العالية دليل مفيد.

لكنها ليست التقييم الكامل.

لا تثبت قيادة عالمية دائمة

لوحات المتصدرين تتغير.

النماذج الجديدة والطلبات الجديدة للوكلاء يمكنها تجاوز المتصدر الحالي.

لا تثبت أن كل مهمة ستحصل على 97٪

XClaw يجمع مهام وفئات مختارة.

سير العمل الحقيقي للمستخدم قد يكون مختلفًا جدًا.

لا تعزل النموذج الأساسي

النتيجة تعود للمساعد الكامل أو حزمة الوكيل الكاملة.

لا تقيس كل قضايا السلامة

الوكيل الذي يمكنه إكمال المهام بكفاءة قد لا يزال يقوم باستدعاءات أدوات غير آمنة أو يكشف معلومات حساسة في بيئة مختلفة.

لا تضمن الدقة الواقعية

وكلاء البحث قد يستشهدون بمصادر ضعيفة أو يسيئون قراءة البيانات المتغيرة.

لا تثبت الاستخدام المجاني غير المحدود

تسعير المنتج والحصص هي سياسات تجارية، وليست خصائص الاختبارات المعيارية.

كيفية تقييم مساعد وينشين بنفسك

يجب أن يحاكي الاختبار الشخصي المفيد عملك الحقيقي.

لا تطرح أسئلة تافهة فقط.

امنح الوكيل مهمة كاملة.

الاختبار 1: الذاكرة

قدّم خمسة قيود في بداية محادثة طويلة.

بعد عدة جولات غير ذات صلة، اطلب مخرجات نهائية وتحقق مما إذا كانت جميع القيود الخمسة محفوظة.

الاختبار 2: معالجة البيانات

ارفع:

  • جدول بيانات.
  • ملف PDF.
  • ملف نصي قصير.

اطلب من الوكيل دمجها في تقرير واحد.

تحقق من كل قيمة رقمية بشكل مستقل.

الاختبار 3: البحث

اختر موضوعًا بمعلومات متغيرة.

تتطلب:

  • مصادر أولية.
  • تواريخ النشر.
  • مقارنة المصادر المتعارضة.
  • روابط مباشرة.
  • قائمة بالادعاءات غير المؤكدة.

الاختبار 4: المستند

الإنشاء

اطلب إنشاء مستند Word أو عرض تقديمي أو جدول بيانات أو ملف HTML.

التقييم:

  • البنية.
  • التنسيق.
  • الاكتمال.
  • إمكانية التنزيل.
  • ما إذا كان الملف يُفتح فعليًا.

الاختبار 5: البرمجة

اطلب تطبيقًا تفاعليًا صغيرًا.

تحقق من:

  • هل يعمل؟
  • هل توجد جميع الميزات المطلوبة؟
  • هل تم إصلاح الأخطاء؟
  • هل الملف النهائي مكتفٍ ذاتيًا عند الطلب؟

الاختبار 6: التنفيذ طويل المدى

قدّم مهمة تتطلب عدة أدوات.

راقب ما إذا كان النظام:

  1. يضع خطة.
  2. يختار أدوات معقولة.
  3. يتعافى من الإخفاقات.
  4. يتجنب تكرار العمل.
  5. يتحقق من النتيجة النهائية.

طريقة أفضل لمقارنة منتجات الوكلاء

عند مقارنة Wenxin بالوكلاء الآخرين، استخدم جدولًا أوسع من "درجة القياس".

البُعد ما الذي يُقاس
نجاح المهمة هل اكتمل العمل المطلوب؟
الذاكرة هل تم الاحتفاظ بالقيود السابقة؟
الدقة هل الأرقام والادعاءات صحيحة؟
جودة البحث هل المصادر موثوقة وحديثة؟
موثوقية الأدوات هل تنجح استدعاءات الأدوات باستمرار؟
جودة المخرجات هل الملفات قابلة للاستخدام دون إصلاح يدوي؟
التعافي هل يمكن للوكيل إصلاح الخطوات الفاشلة؟
زمن الاستجابة كم يستغرق إكمال مهمة كاملة؟
التكلفة كم تكلف النتيجة المقبولة الواحدة؟
الخصوصية كيف يتم التعامل مع الملفات المرفوعة والذاكرة؟
التوفر هل الميزات الرئيسية مجانية أو محدودة الحصة أو مدفوعة؟

هذا يعطي صورة أكثر واقعية من ترتيب واحد في لوحة الصدارة.

التحول الأكبر: "هل يمكنه التسليم؟"

أقوى نقطة في المقال المصدر أوسع من بايدو.

منافسة الوكلاء تغير تعريف جودة الذكاء الاصطناعي.

بالنسبة للجيل الأول من روبوتات الدردشة، ركز المستخدمون على جودة الإجابات.

بالنسبة لوكلاء المهام الحاليين، أصبحت الأسئلة الرئيسية:

  • هل يمكنه الحفاظ على السياق؟
  • هل يمكنه العثور على المعلومات الصحيحة؟
  • هل يمكنه تشغيل الأدوات؟
  • هل يمكنه إنشاء الملف؟
  • هل يمكنه إكمال سير عمل متعدد الخطوات؟
  • هل يمكنه التحقق من نتيجته الخاصة؟
  • هل يمكنني الوثوق به في العمل المتكرر؟

لهذا السبب تجذب معايير مثل XClaw وPinchBench الانتباه.

إنها تقرّب التقييم من العمل الإنتاجي الفعلي.

لا يزال هناك مسافة طويلة بين المعيار والنشر في المؤسسات.

لكن الاتجاه مفيد:

معيار المعرفة
→ معيار التفكير المنطقي
→ معيار استخدام الأدوات
→ معيار المهام الشاملة من البداية إلى النهاية
→ النتيجة الإنتاجية الحقيقية

الخطوة الأخيرة هي في النهاية ما يهم.

الأسئلة الشائعة

ما الدرجة التي حصل عليها مساعد بايدو Wenxin في SuperCLUE XClaw؟

لقطة أغسطس 2026 من SuperCLUE XClaw تعطي مساعد Wenxin درجة إجمالية قدرها 97.62، مما يضعه في المرتبة الأولى بين المنتجات المعروضة. وكانت درجات فئاته: 90.28 للبرمجة، و99.44 لإنشاء المحتوى، و98.86 لمعالجة البيانات، و96.44 للتحليل البحثي، و100 للذاكرة.

ماذا تعني درجة الذاكرة 100؟

تعني أن Wenxin حصل على علامة كاملة في مهام الذاكرة المدرجة في ذلك التقييم من XClaw. لا تعني أن المساعد لا يمكنه أبدًا نسيان السياق في أي محادثة حقيقية ممكنة.

ما هو PinchBench v2؟

PinchBench v2 هو معيار وكلاء أنشأته Kilo لتقييم الأنظمة على مهام حاسوبية ومهام سير عمل واقعية. تحتوي النسخة 2.0 على 148 مهمة ومصممة لقياس

التنفيذ من البداية إلى النهاية بدلاً من مجرد الإجابة على الأسئلة البسيطة.

ما هي نتيجة وينشين في معيار PinchBench الإصدار 2؟

في لقطة من لوحة الصدارة بتاريخ يوليو 2026، ظهر وكيل المهام الخاص بشركة بايدو تحت اسم وضع أوريون بنتيجة أفضل بلغت 94.6% ونتيجة متوسطة بلغت 94.4%. تتغير لوحات الصدارة بمرور الوقت، لذا يجب تضمين تاريخ اللقطة عند الاستشهاد بالنتيجة.

هل مساعد وينشين مجاني بالكامل؟

توفر الصفحات الرسمية لشركة بايدو الخاصة بوينشين حاليًا خيارات وصول مجاني أو تجربة مجانية، ويذكر المقال المصدر أن ميزات المهام المعروضة كانت متاحة دون اشتراك مدفوع. لم يتم العثور على ضمان رسمي ثابت بشأن الاستخدام غير المحدود بشكل دائم لجميع الميزات، لذا يجب التحقق من الحصص الحالية مباشرة في المنتج.

هل يمكن لمساعد وينشين إنشاء مستندات Word وصفحات ويب؟

يعرض المقال المصدر جلسات اختبار أنشأ فيها وينشين خطة عمل بتنسيق Word وصفحات HTML تفاعلية. توضح هذه الأمثلة سير عمل المهام في المنتج، لكنها ليست ضمانًا بأن كل طلب أو بيئة سينتج عنها نفس النتيجة.

لماذا قد تساعد تقنية البحث من بايدو وكلاء الذكاء الاصطناعي الخاصين بها؟

يشترك البحث والوكلاء في قدرات مثل فهم النية، وتفكيك الاستعلام، والاسترجاع، والترتيب، وتجميع المصادر، وسياق الجلسة. يضيف الوكلاء طبقة تنفيذ أوسع تشمل استدعاء الأدوات، وإنشاء الملفات، والذاكرة، والتخطيط، والتنفيذ الفعلي.

هل XClaw وPinchBench معايير لنماذج الذكاء الاصطناعي؟

ليس بالمعنى الضيق. فهي تقيّم أنظمة المنتجات أو الوكلاء التي قد تجمع بين النماذج والأدوات والذاكرة والبحث والاستدعاءات والتنسيق وبيئات التنفيذ. لذلك، يجب أن تُنسب نتائجهما إلى تكوين الوكيل الكامل.

الأدوات ذات الصلة

  • بايدو وينشين: مساعد الذكاء الاصطناعي متعدد الوسائط الرسمي من بايدو للبحث والإبداع والمستندات والأعمال الموجهة بالمهام.
  • SuperCLUE XClaw: معيار الوكلاء الصيني الموجه للمنتجات المشار إليه في المقال المصدر.
  • PinchBench: معيار كيلو الواقعي لسير عمل الوكلاء في البرمجة واستخدام الحاسوب.
  • Pandoc: أداة تحويل المستندات المستخدمة في سير عمل الاختبار بالمقال المصدر لاستخراج وتحويل محتوى المستندات.
  • Three.js: مكتبة رسومات ثلاثية الأبعاد بلغة جافا سكريبت استُخدمت في مثال النظام الشمسي المُنشأ في المقال المصدر.
  • بايدو تشيانفان: منصة بايدو المؤسسية للنماذج والوكلاء والبيانات وتطوير تطبيقات الذكاء الاصطناعي.
  • باني الوكلاء من بايدو: منصة بايدو لبناء ونشر وكلاء مخصصين يعتمدون على وينشين.

الروابط ذات الصلة

التقييم](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): صفحة المعايير المشار إليها في المقال الأصلي.

الملخص

احتل مساعد وينشين من بايدو المركز الأول في لقطة XClaw لشهر أغسطس 2026 من SuperCLUE برصيد 97.62 نقطة، بما في ذلك علامة كاملة قدرها 100 في الذاكرة ودرجات تفوق 96 في معالجة البيانات، وإنشاء المحتوى، والتحليل البحثي.

تأتي هذه النتيجة بعد لقطة يوليو من لوحة متصدرين PinchBench v2 التي سجّل فيها وضع أوريون للمهام من بايدو أعلى نتيجة بنسبة 94.6% ومتوسط نتيجة بنسبة 94.4%. تستخدم المعايير مهام مختلفة، لكن كلاهما يؤكد على إنجاز المهام الفعلي بدلاً من مجرد الإجابة عن الأسئلة.

الخلاصة الأقوى ليست أن مساعداً واحداً "فاز" بشكل دائم بسباق الوكلاء. ترتيب الوكلاء يتغير بسرعة، والأنظمة التي تم قياسها تشمل النماذج، والأدوات، والبحث، والذاكرة، والاستدلالات، والتنسيق.

ما تظهره النتيجتان هو أن تقييم الذكاء الاصطناعي يتحرك نحو معيار أكثر عملية: ليس ما إذا كان النموذج يبدو ذكياً، بل ما إذا كان الوكيل قادراً على إنجاز العمل وتسليم نتيجة قابلة للاستخدام.