مناظرة نماذج العالم في WAIC 2026: ستة فرق روبوتية تناقش الفيزياء، والتمثيل، والاستشعار اللمسي، والنشر

أصبحت نماذج العالم واحدة من أكثر مجالات البحث نشاطًا في الذكاء الاصطناعي المجسّد، لكن المجال لا يزال يفتقر إلى تعريف موحد. يختلف الباحثون حول عدة قضايا: ما الذي يجب أن تمثله نماذج العالم؟ ما هي درجة الدقة المطلوبة في النمذجة الفيزيائية؟ هل يجب توليد الحالات المستقبلية في فضاء البكسل أم الفضاء الكامن؟ كم عدد التوقعات التي يجب أن يقوم بها الروبوت قبل التصرف؟ ما هي أنماط البيانات الأكثر أهمية؟ وحتى كيفية قياس التقدم. في WAIC 2026، كان هذا الافتقار إلى الإجماع واضحًا بشكل خاص. في 19 يوليو، دارت مناظرة حول...

发布于 2026年7月25日generalGEO 评分: 06 次阅读
صورة ترويجية لمناظرة نماذج العالم في WAIC 2026. في وسط خلفية زرقاء داكنة، يظهر نص 'WAIC 2026' وتحته 'World Model Debate'. على الجانب الأيسر من الصورة، شريط ضوئي أرجواني، وعلى الجانب الأيمن، شريط ضوئي أزرق متشابك، مما يضفي شعورًا بالتكنولوجيا المستقبلية. تتناسب هذه الصورة مع فعالية مناظرة نماذج العالم في WAIC 2026 الموصوفة في المستند، وتقدم موضوع الفعالية بشكل مرئي، وتخلق جوًا مستقبليًا تقنيًا للترويج للفعالية.

نموذج العالم WAIC 2026: نقاط الاختلاف والإجماع بين ست شركات روبوتات ذكية متجسدة

مقدمة

أصبح نموذج العالم أحد أكثر الاتجاهات البحثية نشاطًا في مجال الروبوتات الذكية المتجسدة، لكن هذا المجال لا يزال يفتقر إلى تعريف موحد حتى الآن.

يختلف الباحثون حول ما يجب أن يمثله نموذج العالم، ومدى الدقة المطلوبة في النمذجة الفيزيائية، وما إذا كان يجب توليد الحالات المستقبلية في فضاء البكسل أم الفضاء الكامن، وكم عدد التنبؤات التي يحتاجها الروبوت قبل التحرك، وما هي أنماط البيانات الأكثر أهمية، وحتى كيفية قياس التقدم البحثي.

يظهر هذا النقص في الإجماع بشكل واضح في مؤتمر WAIC 2026.

في 19 يوليو، جمعت ندوة نظمتها ست شركات صينية للروبوتات الذكية المتجسدة قادة تقنيين يمثلون مسارات تقنية مختلفة لنماذج العالم للروبوتات:

  • المقدم: هاي داتشنغ، كبير العلماء في ACE Robotics
  • شين شيوجون، كبير العلماء في فريق Roboyant التابع لشركة Ant Group
  • تشو تشنغ، المؤسس المشارك وكبير العلماء في GigaAI
  • شيا تشونغبو، المؤسس المشارك والرئيس التنفيذي للتكنولوجيا المشارك في Wujie Dongli
  • رين قوانغهوي، مدير خوارزميات الذكاء الاصطناعي في AgiBot
  • وانغ هاو، المؤسس المشارك والرئيس التنفيذي للتكنولوجيا في X Square Robot

تكمن قيمة هذه المناقشة تحديدًا في أن المتحدثين لم يتوصلوا إلى حل تقني واحد.

بعضهم يريد أن يمثل نموذج العالم الهندسة والحركة والميكانيكا بدقة متزايدة. آخرون يهتمون أكثر بما إذا كان النموذج يمكنه التنبؤ بهيكل فيزيائي كافٍ لاختيار إجراءات ناجحة.

يعتقد البعض أن الاتساق طويل المدى أمر بالغ الأهمية. بينما يجادل آخرون بأنه عندما يستهلك التنبؤ الكثير من نافذة اتخاذ القرار للروبوت، فإنه يأتي بنتائج عكسية.

يتوقع البعض أن يتقارب المجال حول تمثيل مشترك معين. بينما يعتقد آخرون أن البنى الهجينة أو الإدراك اللمسي أو المعايير الموحدة ستكون نقطة البداية للإجماع.

وراء هذه الخلافات يكمن سؤال عملي أكثر:

ما هي القدرات التي يحتاجها نموذج العالم ليقدم قيمة عملية تتجاوز السيناريوهات التجريبية؟

تُظهر الصورة مشهد منتدى قمة "التنانين الستة" لنماذج العالم في WAIC 2026. الخلفية متدرجة باللون الأزرق، مكتوب عليها "WAIC 2026 المؤتمر العالمي للذكاء الاصطناعي". على المسرح سبعة ضيوف، ستة منهم جالسون على كراسي بيضاء وواحد يقف بجانب المنصة. أمام كل ضيف صورته واسمه، مثل المقدم هاي داتشنغ وشين شيوجون وتشو تشنغ وغيرهم. على اللافتة الأمامية مكتوب "منتدى قمة 'التنانين الستة' لنماذج العالم WAIC 2026". هذه الصورة مرتبطة ارتباطًا وثيقًا بالسياق، وتقدم مشهد المنتدى بصريًا، وتوفر أساسًا بصريًا لتقديم خلفية المنتدى ومعلومات الضيوف.

ثلاثة مسارات تقنية رئيسية

لم تتبنَ هذه الشركات الست بنية متطابقة تمامًا، ولكن بناءً على طريقة تنبؤ النموذج بالعالم، يمكن تلخيص المناقشات في ثلاثة مسارات تقنية.

المسار الطريقة الممثلة الفكرة الأساسية
التوليد في فضاء البكسل GigaAI التنبؤ المباشر بالحالات البصرية المستقبلية، أو التنبؤ من خلال التمثيل البصري التوليدي
التنبؤ في الفضاء الكامن اتجاه JEPA من Wujie Dongli التنبؤ بتمثيلات داخلية مدمجة، بدلاً من البكسلات الكاملة
بنية هجينة أو موحدة ACE Robotics وRoboyant وX Square Robot وAgiBot الجمع بين التوليد والتنبؤ في الفضاء الكامن والاستدلال الفضائي الصريح والتحكم VLA أو النماذج الموجهة بالمحاكاة

على الرغم من أن هذا التصنيف له قيمة مرجعية، إلا أنه لا ينبغي اعتباره معيارًا دائمًا لتقسيم الصناعة.

بعض هذه الشركات قد بدأت بالفعل في دمج آليات متعددة. الخلاف الأكبر يكمن في ما يعتقد كل فريق أن نموذج العالم المفيد يجب أن يحافظ عليه.

ما هي القدرة الأكثر أهمية؟

الخلاف الرئيسي الأول هو كيفية ارتباط نموذج العالم بالفيزياء.

الرأي الأول: التنبؤ بالحالة الفيزيائية يجب أن يكون دقيقًا

يرى شيا تشونغبو أن التقييم يجب أن يشمل دقة النموذج في التنبؤ بالحالة الهندسية ومسار الحركة والتأثيرات الميكانيكية والكميات الفيزيائية ذات الصلة.

ينظر هذا الرأي إلى نموذج العالم جزئيًا كمتنبئ منظم للحالة الفيزيائية.

بالنسبة للروبوتات التي تحتاج إلى اتخاذ قرارات حول كيفية الدفع أو الإمساك أو الرفع أو الملاحة أو التعامل مع الأشياء، قد تشمل الأسئلة ذات الصلة:

  • أين سيتحرك الجسم؟
  • هل سيصطدم بأجسام أخرى؟
  • كيف سيتغير اتجاهه؟
  • ما مقدار القوة التي يجب تطبيقها؟
  • هل سيكون القبضة ثابتة؟
  • كيف سيكون شكل البيئة بعد تنفيذ الإجراء؟

يمكن للتمثيلات الكامنة أن تجعل الانحدار الفيزيائي الصريح أكثر جاذبية - لأن النموذج لا يحتاج إلى عرض كل بكسل مستقبلي قبل تقدير هذه الكميات.

تكمن ميزته في الدقة والقابلية للتحكم.

الصعوبة تكمن في أن العالم الفيزيائي يحتوي على متغيرات يصعب ملاحظتها أو استنتاجها بشكل مباشر، مثل الاحتكاك وتوزيع الكتلة المخفي والمرونة وحالة التلامس وخصائص المواد.

لذلك يمكن للنموذج أن يكون ذا بنية فيزيائية دون أن يكون محاكيًا كاملاً.

الرأي الثاني: المعقولية الفيزيائية قد تكون أكثر أهمية من الفيزياء الدقيقة

طرح شين يوجون معيارًا مختلفًا.

قد لا يحتاج الروبوت إلى إعادة إنتاج كل معامل من معاملات النظام الفيزيائي، لكنه يحتاج إلى فهم الاختلافات الحاسمة للإجراءات التي سيتم تنفيذها.

على سبيل المثال، عندما يتم إلقاء مادتين أو عصرهما أو سحبهما أو الإمساك بهما، قد يحتاج الروبوت إلى التعرف على استجاباتهما المختلفة دون الحاجة إلى تقدير كل معامل مسبقًا.

هذا أقرب إلى الفهم الفيزيائي المرتبط بالإجراء بدلاً من المحاكاة الفيزيائية الكاملة.

يمكن تلخيص الفرق بينهما على النحو التالي:

المحاكاة الفيزيائية الدقيقة:
التنبؤ بالحالة التفصيلية للعالم بأكبر قدر ممكن من الدقة.

الاستدلال الفيزيائي المرتبط بالإجراء:
التنبؤ بحالة العالم الكافية لدعم اختيار إجراءات آمنة وفعالة.

الهدف الثاني أقل تكلفة حسابية، ويكفي للعديد من مهام الروبوتات الحقيقية.

هذا يتوافق أيضًا مع فلسفة تصميم الأنظمة المشتقة من نماذج توليد الفيديو - هذه النماذج تتعلم بشكل طبيعي أي العروض البصرية المستقبلية معقولة، حتى لو لم تكشف صراحة عن جميع المتغيرات الفيزيائية المحتملة.

السؤال الأساسي: أي خطأ يغير الإجراء؟

تشير آراء الخبراء المتباينة إلى معيار تقييم أكثر واقعية:

عندما يؤدي خطأ التنبؤ إلى تغيير قرار الروبوت، يكون هذا الخطأ هو الأكثر أهمية.

إذا كان بإمكان الروبوت وضع الكأس بنجاح دون تقدير معامل الاحتكاك الدقيق لسطح الطاولة، فقد يكون فقدان هذه القيمة غير مهم.

لكن إذا أدى فقدان هذا الفهم الفيزيائي إلى سقوط الكأس، فإن هذا الخطأ يصبح بالغ الأهمية.

لذلك، تعتمد الدقة الفيزيائية المطلوبة على:

  • المهمة المحددة
  • هامش الأمان
  • تصميم الروبوت نفسه
  • الإطار الزمني للإجراء
  • تكلفة الفشل
  • الوقت المتاح للاستدلال

الاتساق طويل المدى أم اتخاذ القرار السريع؟

الخلاف الثاني يدور حول إلى أي مدى يجب أن يتنبأ نموذج العالم بالمستقبل.

شركة Zhiyuan Robot:

الاتساق الفيزيائي طويل المدى أمر بالغ الأهمية

استثمرت شركة Zhiyuan Robot موارد كبيرة في المحاكاة والتقييم القائم على نموذج العالم.

إطار عالم Zhiyuan الرقمي الذي نشرته يوفر بيئة محاكاة عالية الدقة ومسارات خبراء مولدة تلقائيًا وأدوات تقييم النماذج.

ثم أطلقت Zhiyuan Robot إطار نموذج العالم EVAC و EWMBench، مما وسع فكرة المحاكاة التوليدية المشروطة بالإجراء.

بالنسبة لنماذج العالم المستخدمة كمحاكيات، فإن الاتساق طويل المدى أمر بالغ الأهمية.

تصبح قيمة المحاكاة أقل بكثير في حالة:

  • تغير هوية الأشياء تدريجيًا
  • انحراف البنية الهندسية
  • نسيان الروبوت للتفاعلات السابقة
  • انتهاك التسلسلات الطويلة للقوانين الفيزيائية
  • عدم تناسق مخرجات الرؤية المتعددة

بناءً على ذلك، يجب أن يحافظ نموذج العالم على حالة متماسكة على نطاق زمني ذي معنى.

شركة Square Robot: الاستدلال طويل المدى قد يصبح هدفًا زائفًا

شكك وانغ هاو في افتراض أن "التنبؤ الأطول دائمًا أفضل".

تتبنى شركة Square Robot نهج النموذج المتجسد من طرف إلى طرف الذي يدمج الإدراك والاستدلال ونمذجة العالم وتوليد الإجراءات بشكل وثيق.

تصف موادها المنشورة سلسلة WALL بأنها خطوة نحو نموذج عالم فيزيائي موحد، بدلاً من معاملة التنبؤ بالعالم والتحكم في الروبوت كأنظمة منفصلة.

في مثل هذه الأنظمة، نموذج العالم ليس مجرد محاكٍ - التنبؤ نفسه جزء من حلقة التحكم.

لذلك، فإن الاستدلال الأطول يتحمل التكاليف التالية:

كلما كان التنبؤ بالمستقبل أبعد
→ زاد حجم الاستدلال
→ زاد زمن الوصول
→ قل الوقت المتاح للعمل

إذا كانت البيئة التي يعمل فيها الروبوت تتغير بشكل أسرع من الوقت الذي يستغرقه النموذج لإكمال الاستدلال، فقد يكون التنبؤ الطويل المتماسك تمامًا عديم الفائدة على المستوى التشغيلي.

بالنسبة للتحكم، قد يكون التنبؤ القصير الذي يصل في الوقت المناسب أكثر قيمة بكثير من التنبؤ الطويل الذي يأتي متأخرًا.

يجب أن يتطابق أفق التنبؤ مع أفق التحكم

يشير هذا إلى أنه لا يوجد طول تنبؤ أمثل واحد.

قد تحتاج محاكيات المستودعات إلى تنبؤات تسلسلية طويلة.

قد يحتاج الروبوت الذي يؤدي مهمة توازن الأشياء إلى تنبؤات قصيرة المدى سريعة للغاية.

قد يحتاج الروبوت المتنقل الذي يتعامل مع مهام متعددة المراحل إلى كليهما:

  1. التخطيط طويل المدى
  2. التنبؤ الفيزيائي قصير المدى
  3. التصحيح السريع في الحلقة المغلقة

لذلك، قد يتضمن التصميم المعقول أطرًا زمنية متعددة، بدلاً من نموذج عالم كامل واحد طويل المدى.

تُظهر الصورة مشهد منتدى قمة "التنانين الستة" لنماذج العالم في WAIC 2026.

يجلس ثلاثة ضيوف على كراسي بيضاء، والضيف الأوسط يتحدث ممسكًا بميكروفون أزرق، بينما يضع الضيف الأيمن يديه متشابكتين، بينما يضع الضيف الأيسر يديه بشكل طبيعي. الخلفية داكنة، وفي الأعلى عبارة "مؤتمر WAIC 2026 العالمي للذكاء الاصطناعي" مع شعار "ACE". هذه الصورة تتوافق مع وصف منتدى نموذج العالم WAIC 2026 في الوثيقة، وتقدم مشهد المنتدى بشكل مباشر.

الأنظمة العامة الحالية تعكس بالفعل هذه الاختلافات في الأولويات

الانقسام في الآراء الذي ظهر في المنتدى قد انعكس بالفعل في أنظمة الشركات التقنية العامة.

عصر الروبوتات المتجسدة: توحيد الفهم والتنبؤ والعمل

في مؤتمر WAIC 2026، أصدرت عصر الروبوتات المتجسدة Kairos 3.1، وهو نموذج عالمي متجسد موجه نحو الحركة.

تصف المواد الصادرة علنًا بنية هجينة من المحولات تهدف إلى ربط:

  • الفهم
  • استنتاج العالم
  • الحركة
  • التفكير

وأبلغت عصر الروبوتات المتجسدة أيضًا عن زمن انتقال استنتاج قدره 125 مللي ثانية لنموذجها Kairos 3.1 ذي المعاملات 8B على منصة NVIDIA.

يستخدم Jetson Thor دقة BF16. هذه المواصفات حاسمة لأن الشركة تحدد النموذج بوضوح كنظام طرفي لسلوك الروبوتات، وليس مجرد مولد فيديو غير متصل.

مجموعة أنت/ROBBYANT: من محاكاة العالم التفاعلي إلى النموذج الأصلي المتجسد

يبدأ LingBot-World مفتوح المصدر من Robbyant من اتجاه الفيديو التوليدي. يصف مستودع الكود الرسمي: بيئة تفاعلية عالية الدقة، تناسق زمني طويل، تحكم مستخدم في الوقت الفعلي، زمن استجابة تفاعلي دون ثانية، وقدرة توليد في الوقت الفعلي بمعدل 16 إطارًا في الثانية في الإصدار السريع. قامت مجموعة أنت لاحقًا بدمج LingBot-World-Fast في منتج Lingguang المحمول، مما يسمح للمستخدمين بتحويل صورة واحدة إلى عالم توليدي يمكن استكشافه. في الوقت نفسه، توسعت Robbyant إلى أبحاث نماذج VLA والمتجسدة، لتصبح حالة نموذجية لفريق لا يقتصر على نموذج عالمي واحد.

GigaAI: توليد البكسل ومنصة GigaWorld

تقدم GigaAI نفسها كشركة روبوتات متجسدة وعامة مبنية على ثلاثة مستويات: GigaWorld (منصة نماذج العالم)، GigaBrain (نظام الذكاء المتجسد العام)، و Maker (الحامل المادي للروبوت). تركز أعمال الشركة على النماذج العالمية على الدور الأساسي للبيئات الفيزيائية التوليدية في تسريع إنشاء البيانات والتدريب والاختبار. عندما تُستخدم نماذج العالم كمحاكيات غنية بصريًا، يصبح توليد الفضاء البكسل مهمًا بشكل خاص.

روبوت تشى يوان: نموذج العالم كمحاكي توليدي

تُظهر الأعمال العامة لروبوت تشى يوان سيناريو الاستخدام الخاص بالمحاكاة بوضوح. يدمج AgiBot Digital World الأصول ثلاثية الأبعاد، والمحاكاة الفيزيائية، وتوليد مسارات الخبراء، والعشوائية النطاقية، وتوليد البيانات، وتقييم النموذج. إطاره اللاحق EVAC يولد حالات بصرية مستقبلية بناءً على تسلسلات حركة الروبوت. في مثل هذه التطبيقات، يكون التناسق الزمني والدقة في تفاعل الحركة مع البيئة أمرًا بالغ الأهمية.

إيغومان: دمج نموذج العالم مع VLA

يظهر تاريخ تطور إيغومان الرسمي أن بنية WALL-A الخاصة بها تدمج بعمق نموذج VLA مع نموذج العالم. يتجه اتجاه WALL-B لعام 2026 نحو ما تسميه الشركة بنية النموذج العالمي الموحد. هدفها التقني هو تجنب خط أنابيب يتنبأ فيه نموذج العالم بشكل منفصل، ثم يحول سياسة منفصلة التنبؤات إلى أفعال، بل دمج عمليات التنبؤ والتحكم في نظام واحد متكامل من البداية إلى النهاية.

مووجي ديناميكس: نموذج العالم الأصلي المتجسد والتنبؤ في الفضاء الكامن

تشير المواد العامة لمووجي ديناميكس إلى أن الشركة تبني "دماغًا عامًا" للروبوتات ونظامًا أساسيًا متعدد الوسائط متجسدًا يعتمد على نموذج العالم. انضم شيا تشونغبو إلى الشركة في مارس 2026، بعد أن قاد سابقًا عمل القيادة الذاتية من البداية إلى النهاية في شركة لي أوتو. يركز اتجاه البحث في الشركة على التنبؤ في الفضاء الكامن والكميات الفيزيائية والتفكير على نمط JEPA. نظرًا لأن الوثائق التقنية العامة التفصيلية لنماذج العالم لا تزال محدودة، يجب اعتبار التصريحات حول بنيتها الدقيقة كاتجاهات تقنية وصفها إدارتها، وليس كنماذج مفتوحة موثقة بالكامل.

ما هو الإجماع الأكثر احتمالاً للوصول إليه أولاً؟

السؤال التالي ليس أي بنية ستفوز في النهاية.

بل هو:

أي جزء من هذا المجال سيتوافق عليه أولاً؟

تختلف الإجابات بشكل كبير.

المرشح الأول: التمثيل الموحد

أكد كل من رين غوانغهوي وشيا تشونغبو على أهمية التمثيل.

تقاربت نماذج اللغة الكبيرة في النهاية حول التمثيل التسلسلي المعتمد على الترميز، مما جعل المهام المختلفة متوافقة مع بنية واحدة.

لا يزال الذكاء المتجسد يفتقر إلى وحدة أساسية مشتركة مماثلة.

عمل الروبوتات يشمل:

  • الصور
  • الفيديو
  • اللغة
  • مواضع المفاصل
  • السرعة
  • القوة
  • الإشارات اللمسية
  • الهندسة ثلاثية الأبعاد
  • الحركة
  • المكافأة
  • حالات البيئة

إذا كانت هذه الوسائط معزولة عن بعضها البعض، فسيحتاج كل نظام إلى بناء جسور معقدة بينها.

يمكن للتمثيل الموحد أن يسمح للنموذج بالاستدلال على الإدراك والحالة والتنبؤ والحركة في نفس الفضاء المشترك.

التحدي هو أن الإشارات الفيزيائية غير قابلة للتبادل بطبيعتها.

نبضة لمسية، وإطار كاميرا، وأمر ماسك لها معدلات تشغيل مختلفة وتحمل معلومات مختلفة.

لذلك، قد يكون "رمز الروبوت" أكثر صعوبة في التعريف من رمز النص.

المرشح الثاني: البنية الهجينة

توقع وانغ هاو هو دمج البنى.

من هذا المنظور، كل طريقة لنماذج العالم تحل جزءًا من المشكلة:

  • توليد الفيديو جيد في التنبؤ البصري المستقبلي.
  • التنبؤ الكامن فعال للاستدلال.
  • النماذج ثلاثية الأبعاد الصريحة توفر ذاكرة مكانية.
  • نماذج VLA تربط الإدراك بالحركة.
  • التحكم التقليدي يوفر استقرارًا حتميًا على المستوى المنخفض.

قد تجمع البنية النهائية بين هذه الآليات بدلاً من اختيار واحدة والتخلي عن الأخرى.

هذا النمط شائع في مجال الذكاء الاصطناعي.

التقنيات التي تتنافس في البداية غالبًا ما تصبح مكونات لأنظمة أكبر بعد أن تتضح نقاط القوة والضعف.

المرشح الثالث: الإدراك اللمسي

يعتقد شين يوجون أن المعلومات اللمسية قد تصبح واحدة من أولى المجالات التي يتوافق عليها القطاع.

حاليًا، تُدرَّب معظم نماذج العالم الكبيرة بشكل أساسي على البيانات البصرية واللغوية.

الروبوتات تعمل من خلال التلامس.

تحتاج إلى اكتشاف:

  • ما إذا كان الجسم ينزلق.
  • ما إذا كان السطح صلبًا أم ناعمًا.
  • ما إذا كانت القبضة ثابتة.
  • مقدار القوة المطبقة.
  • ما إذا كان الجسم القابل للتشكيل قد تغير شكله.
  • ما إذا كان هناك تلامس حتى عندما يكون مجال الرؤية محجوبًا.

بالنسبة لمهام التشغيل، في اللحظة التي يكون فيها اللمس أكثر فائدة، قد يكون البصر غامضًا.

هذا حجة قوية على أن الإدراك اللمسي يجب أن يكون وسيلة أصلية، وليس مستشعرًا اختياريًا يُضاف بعد تدريب النموذج.

يعكس اتجاه بحث Robbyant أيضًا تحولًا واسعًا من النماذج القائمة على الفيديو الرقمي إلى النماذج المصممة حول التحكم المتجسد.

الفرق المهم هو:
``نص عادي
هدف نموذج الفيديو هو توليد مستقبل معقول.

هدف نموذج العالم المتجسد هو دعم الأفعال الناجحة.
``

هذان الهدفان متداخلان، لكنهما ليسا متطابقين.

المرشح الرابع: المعايير المرجعية المشتركة

قدم تاو داتشنغ إجابة مختلفة: قد يحدث التقارب أولاً في التقييم، وليس في البنية.

هناك سابقة تاريخية.

الرؤية الحاسوبية لم تتقارب لأن الباحثين لم يتفقوا مسبقًا على تمثيل معين. مجموعات البيانات المشتركة والمعايير المرجعية مثل ImageNet قدمت هدف قياس مشترك للأنظمة المتنافسة. بمجرد تقييم جميع الأنظمة على نفس المقياس، اختفت الأفكار الضعيفة بشكل أسرع، وانتشرت الأفكار المفيدة عبر الحدود البنيوية. هذا هو المنطق وراء إطلاق معدل الذكاء الفيزيائي في المنتدى.

معدل الذكاء الفيزيائي: مقياس موحد للذكاء المتجسد

تم تقديم معدل الذكاء الفيزيائي في مؤتمر العالم للذكاء الاصطناعي 2026 كمعيار مرجعي موحد للذكاء الفيزيائي المتجسد. تشير المعلومات العامة إلى أن هذه المبادرة شاركت فيها:

  • جمعية شنغهاي للذكاء الاصطناعي
  • معهد شنتشن للاقتصاد الدائري
  • الفرع الشرقي لأكاديمية الصين لتكنولوجيا المعلومات والاتصالات

وشاركت أكثر من 20 جامعة ومنظمة صناعية. تهدف المنصة إلى مقارنة الأنظمة المختلفة عبر الأبعاد التالية:

  • أشكال روبوتية مختلفة
  • سيناريوهات عالمية حقيقية متعددة
  • فئات مهام مختلفة
  • بروتوكولات تقييم موحدة

![صورة تظهر مشهدًا من طاولة مستديرة لقمة "التنانين الستة" لنماذج العالم 2026. هناك سبعة ضيوف، ستة منهم واقفون وواحد جالس على اليسار. الخلفية داكنة، مع شعار "مؤتمر WAIC 2026 العالمي للذكاء الاصطناعي" في الأعلى وعبارة "ACE". يرتدي الضيوف ملابس بأنماط مختلفة، وبعضهم يحمل بطاقات تعريف. في الزاوية اليسرى العليا، توجد عبارة "طاولة مستديرة للتنانين الستة لنماذج العالم - دفع الذكاء الاصطناعي الفيزيائي من 'الفهم' إلى 'التنفيذ'".

هذه الصورة مرتبطة بمحتوى مناقشة المائدة المستديرة حول "التنانين الستة" الواردة في المستند، وتُظهر المتحدثين بوضوح.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/c242a920-2b42-4966-92ce-2e70518c2ac6-7fb4c60a-1a46-46c3-9743-2b5a5a5a322e.jpeg)

لا يمكن لاختبار ذكاء فيزيائي مفيد أن يعتمد فقط على ما إذا كان الفيديو المُنشأ يبدو واقعياً. بل يحتاج إلى طرح الأسئلة التالية:

  • هل أكمل الروبوت المهمة؟
  • هل الحركة صحيحة فيزيائياً؟
  • هل يتعافى من الأحداث غير المتوقعة؟
  • ما مقدار التدخل المطلوب؟
  • هل السلوك آمن؟
  • هل تنتقل الاستراتيجية إلى بيئة جديدة؟
  • ما مدى قدرته على التعميم عبر الأشياء والأشكال؟
  • ما مقدار الوقت والحساب المطلوب لكل قرار؟

تحتاج المنهجية المحددة للذكاء الفيزيائي إلى توثيق مفتوح مستمر واعتماد واسع النطاق حتى تصبح معياراً صناعياً حقيقياً. ومع ذلك، فإن هذا التوجه يحل مشكلة عملية. فمن الصعب المقارنة بين الادعاءات المختلفة حول النماذج العالمية الحالية، لأن شركة قد تبلغ عن جودة الفيديو، وأخرى عن معدل نجاح المهمة، وثالثة عن خطأ الحالة الفيزيائية، ورابعة عن اتساق المحاكاة. وبدون مقياس موحد، يمكن لكل نظام أن يكون الأفضل في المقياس الذي صُمم لتحسينه.

الواقعية البصرية لا تعادل الفهم الفيزيائي

تعكس المناقشات حول الذكاء الفيزيائي أيضاً قضايا بحثية أوسع في مجال الفيديو التوليدي. فقد قدم باحثو جوجل ديب مايند اختباراً مستقلاً يُسمى الذكاء الفيزيائي لتقييم ما إذا كانت نماذج الفيديو تفهم المبادئ الفيزيائية حقاً. ووجدت الدراسة أن الواقعية البصرية والصحة الفيزيائية قد تكونان منفصلتين. فقد يبدو الفيديو المُنشأ مقنعاً لكنه ينتهك:

  • ميكانيكا الأجسام الصلبة
  • سلوك الموائع
  • البصريات
  • الديناميكا الحرارية
  • المغناطيسية

هذا التمييز ضروري لنماذج العالم الخاصة بالروبوتات. فالتنبؤات المستقبلية المقنعة بصرياً لا تكون مفيدة إلا إذا احتفظت بالخصائص اللازمة للحركة. وفي الوقت نفسه، لا يحتاج الروبوت إلى حل كتاب فيزياء كامل قبل التصرف. المعيار العملي يقع بين هذين الطرفين.

غير كافٍ:
يبدو واقعياً لكنه يتوقع نتائج خاطئة.

قد يكون مفرطاً:
يحسب كل متغير فيزيائي حتى لو لم يكن ضرورياً للحركة.

التنبؤات المفيدة تلتقط الاختلافات الفيزيائية التي تغير قرارات الروبوت.

هذه المنطقة الوسطى هي حيث يقع الخلاف البحثي الحالي.

من العرض إلى النشر

على الرغم من الخلافات حول بنية النماذج، تصبح آراء الخبراء أكثر اتساقاً عندما ينتقل النقاش من النموذج إلى الروبوت المادي.

المعيار النهائي بسيط:

هل يمكن للروبوت إكمال المهمة بشكل موثوق في العالم المادي؟

يستخدم المتحدثون المختلفون لغة مختلفة لوصف ذلك.

  • أكد شيا تشونغبو على فعالية القرار النهائي.
  • ركز رين غوانغهوي على مدى تحسين النموذج العالمي للاستراتيجيات اللاحقة.
  • شدد زو تشنغ على معدل النجاح في المهام المتعددة على الروبوتات المادية.

المصطلحات مختلفة، لكن السؤال التشغيلي واحد.

النموذج العالمي لا يكون ذا معنى إلا إذا حسّن السلوك الفعلي للروبوت.

لماذا قد تظل 99% من العروض منتجاً سيئاً

يمكن تحسين العروض بشكل شبه لا نهائي.

يمكن للفريق:

  • إعادة تعيين البيئة.
  • اختيار الأشياء المواتية.
  • تحديد مسار مسبقاً.
  • تكرار المحاولات الفاشلة.
  • الضبط لسيناريو واحد لأسابيع.
  • وجود مهندس في الموقع.
  • إزالة حالات الحواف النادرة.

النشر يزيل هذه الحماية.

المتاجر والفنادق والمستودعات والمنازل تواجه أحداثاً غير متوقعة يومياً.

وصف وانغ هاو منحنى التكلفة بأنه غير خطي بقوة.

نقل النظام من:

90% → 99%

لا يتطلب بالضرورة نفس الجهد مثل:

99% → 99.9%

الفشل المتبقي غالباً ما يكون حالات الحواف الطويلة الصعبة.

معدل فشل 1% يبدو صغيراً في المختبر.

إذا نفذ الروبوت 10,000 حركة يومياً، فإن 1% يعني 100 فشل.

حتى مع موثوقية 99.9%، عندما يكون حجم المهام كبيراً، لا يزال ينتج تدخلاً بشرياً متكرراً.

التأثير التجاري يشمل:

  • التدخل البشري.
  • إعادة العمل.
  • التوقف.
  • شكاوى العملاء.
  • مخاطر السلامة.
  • تكاليف الصيانة.
  • فقدان الإنتاجية.
  • مشرفين إضافيين.

لهذا السبب يغير النشر معنى جودة النموذج.

الأحداث العشوائية هي القاعدة في العالم الحقيقي

قدم شين يوجون مثالاً من قطاع التجزئة.

قد يحتاج الروبوت إلى البحث عن علبة خضروات.

عادةً ما تُخزَّن السلع في مكان واحد، لكن العميل قد يأخذها ويضعها في ثلاجة أخرى.

من منظور مجموعة بيانات مُعدة بعناية، يبدو هذا كحالة شاذة.

لكن من منظور روبوت يخدم آلاف العملاء، يصبح الشذوذ هو القاعدة.

لذلك، يحتاج النموذج العالمي إلى التعامل مع:

  • أشياء في مواقع غير متوقعة.
  • مخزون مفقود.
  • أشخاص يعرقلون المسار.
  • إعادة ترتيب مفاجئة.
  • ملاحظات محلية.
  • تغيرات في الإضاءة.
  • مجموعات جديدة من الأشياء.
  • افتراضات خاطئة ناتجة عن المهام السابقة.

هذا هو المكان الذي تكون فيه القدرة على التعميم أكثر أهمية من إعادة عرض العروض المحفوظة.

الاستدلال الحدي هو متطلب للنشر

أكد تاو داتشنغ على قيد عملي آخر: زمن الاستجابة.

العديد من النماذج المتقدمة تعمل في السحابة.

لا يتوفر للروبوت دائماً وقت لانتظار الرحلة ذهاباً وإياباً إلى السحابة.

نافذة القرار قد تكون ملي ثانية فقط.

عشرات أو مئات المللي ثانية.

قد تكون الشبكة أيضاً:

  • مزدحمة
  • غير متاحة
  • غير موثوقة
  • مكلفة للغاية
  • مقيدة بمتطلبات الخصوصية أو الأمان

لهذا السبب تؤكد ACE Robotics على أداء Kairos 3.1 في الحافة.

نموذج أقل قدرة لكنه يستجيب ضمن الحدود الزمنية للتحكم قد يكون أكثر فائدة من نموذج أقوى يصل بعد انتهاء نافذة الحركة.

بالنسبة للنشر، يجب أن يصبح الذكاء:

  • رخيصاً بما يكفي
  • سريعاً بما يكفي
  • موثوقاً بما يكفي
  • محلياً بما يكفي
  • قابلاً للتنبؤ بما يكفي

هذا يقود إلى تمييز مفيد:

العرض يظهر الحد الأعلى للقدرة، النشر يكشف الحد الأدنى للقدرة.

ما هو الصحيح بعد عامين؟

الجزء الأخير من النقاش دعا المتحدثين إلى التخيل بالنظر إلى الوراء من عام 2028.

أي الاستثمارات التي ستثبت صحتها؟

أيها قد يبدو مضللاً؟

مرة أخرى، كشفت الإجابات عما يعتبره كل فريق دائماً.

قدرة النموذج ومخرج النموذج المرئي

ميّز شين يوجون بين مفهومين:

القدرات الأساسية

تتضمن أمثلة:

  • كفاءة التعميم
  • التفاعلية
  • جودة التمثيل
  • اشتراط الحركة
  • كفاءة البيانات
  • الاتساق السببي

المخرجات المرئية

تتضمن أمثلة:

  • فيديوهات مولدة مبهرة بصرياً
  • عروض متقنة
  • مهام طويلة الأمد ناجحة منفردة
  • جمالية عالية

قد يحسن النموذج قدراته الأساسية دون إنتاج العرض الأكثر إثارة للإعجاب فوراً.

على العكس، يمكن تحسين النظام بشكل كبير حول المخرجات المرئية دون رفع القدرات اللازمة للذكاء الفيزيائي العام.

هذا أحد أسباب حاجة الصناعة إلى تقييم أفضل.

البنية التحتية للبيانات قد تظل ذات قيمة

يعتقد شين أيضاً أن العمل المستثمر في خطوط أنابيب البيانات سيظل مفيداً على الأرجح.

حتى لو تغيرت البنية، سيظل الذكاء المجسد بحاجة إلى:

  • مسارات العالم الحقيقي
  • بيانات اللمس
  • حالات الفشل
  • التصحيحات البشرية
  • حركات الروبوت
  • مزامنة المستشعرات
  • بيانات المحاكاة
  • تصفية الجودة
  • مجموعات بيانات التقييم

عدم اليقين ليس في ما إذا كانت البيانات مهمة.

بل في ما إذا كانت البيانات التي تم جمعها اليوم ستظل متطابقة مع التمثيلات وطرق التدريب المستخدمة في النماذج المستقبلية.

عندما يحدث ما يلي، قد تصبح مجموعات البيانات أقل فائدة:

  • تتغير تكوينات المستشعرات
  • تتغير مساحة الحركة
  • التسميات تُشفِّر افتراضات قديمة
  • تفتقر البيانات إلى الوسائط الضرورية
  • استراتيجية الجمع ضيقة جداً
  • النماذج الجديدة تتطلب دقة زمنية مختلفة

لذلك، بناء خط أنابيب بيانات مرن قد يكون أكثر دواماً من تحسين مجموعة بيانات ثابتة.

لا تتدخل مبكراً مع النموذج الأساسي

حذر تشو تشنغ من أن الصناعة قد تستكشف الكثير من السيناريوهات التجارية قبل أن يستقر النموذج الأساسي نفسه.

هذه معضلة مألوفة للشركات الناشئة.

النشر التجاري يوفر:

  • الإيرادات
  • البيانات
  • ملاحظات العملاء
  • قيود حقيقية

لكنه قد يسحب فريق النموذج نحو:

  • التكامل لمرة واحدة
  • سير عمل مخصص
  • قواعد خاصة بالعميل
  • تكيف الأجهزة
  • الدعم والتشغيل

إذا كانت البنية الأساسية لا تزال تتغير بسرعة، فإن التخصص المبكر قد يبطئ تقدم البحث الأساسي.

التوازن بين أبحاث النماذج والنشر التجاري يختلف من شركة لأخرى.

لا توجد إجابة واحدة تناسب الجميع.

البنى المجسدة الأصلية قد تظهر

توقع رين غوانغهوي أن نماذج العالم ستتجه بشكل متزايد نحو الأصلية المجسدة.

هذا يعني أن النموذج يُصمم من البداية حول التفاعل المادي، بدلاً من تكييفه لاحقاً من مهام إنشاء فيديو الإنترنت أو الصور.

قد يتضمن التدريب الأصلي المجسد:

  • حركات الروبوت.
  • الإدراك الذاتي.
  • القوى.
  • بيانات اللمس.
  • فيديو من منظور الشخص الأول.
  • ملاحظات متعددة الزوايا.
  • حالة ثلاثية الأبعاد.
  • تغذية راجعة من الأدوات.
  • بيانات التدخل.
  • نجاح المهمة وفشلها.

قد تُصمم البنية نفسها أيضاً حول حلقة التحكم.

المشكلة الأساسية هي ما إذا كان النموذج يمثل المتغيرات اللازمة لتنفيذ الروبوت للأفعال، وليس ما إذا كان هيكله الداخلي مشابهاً لنماذج توليد الوسائط.

نقطة الخلاف هي بالضبط الفرصة الأكبر

لم ينته هذا النقاش بهندسة واحدة متفق عليها بين الجميع.

قد يعني هذا أن المجال لا يزال في مراحله المبكرة، وليس في حالة جمود.

لا تزال عدة مجالات مهمة معلقة بلا حل:

السؤال وجهات نظر مختلفة
ما الذي يجب أن يتنبأ به النموذج؟ البكسلات، الحالات الكامنة، الهندسة الصريحة، أو نهج هجين
ما مدى الدقة الفيزيائية المطلوبة؟ تقدير دقيق للحالة مقابل المعقولية المرتبطة بالفعل
إلى أي مدى يجب أن يمتد نطاق التنبؤ؟ الاتساق طويل المدى مقابل التحكم قصير المدى منخفض الكمون
ما الذي سيوحد هذا المجال؟ التمثيلات، البنى، بيانات اللمس، أو المعايير
أين يجب أن يعمل الاستدلال؟ السحابة، الحافة، أو نشر هجين
ما هو مؤشر النجاح الحقيقي؟ جودة المحاكاة، التنبؤ الفيزيائي، تحسين السياسات، أو معدل نجاح المهام الفعلية
ما هي البيانات الأكثر أهمية؟ الفيديو، مسارات الروبوت، القوة، اللمس، المحاكاة، أو بيانات هجينة

في المجالات الناضجة، تميل البنى إلى أن تكون متشابهة.

في المجالات الناشئة، يكشف الخلاف بالضبط عن أكبر الفرص التي لم يتم التغلب عليها بعد.

إذا تمكن فريق من إثبات صحة إحدى الفرضيات المثيرة للجدل حالياً، فيمكنه بناء ميزة تقنية قبل أن يتوصل القطاع إلى توافق.

إطار عملي لتقييم نماذج العالم للروبوتات

بالنسبة للمطورين وفرق الروبوتات، يمكن تحويل هذا النقاش إلى قائمة تقييم أكثر تحديداً.

1. هدف التنبؤ

تحديد ما يتنبأ به النموذج:

  • البكسلات.
  • الحالات الكامنة.
  • الهندسة.
  • الأفعال.
  • القوة.
  • الملاحظات المستقبلية.
  • مزيج مما سبق.

يجب أن يتطابق المخرج مع مشكلة التحكم النهائية.

2. نطاق التنبؤ

قياس الأداء في المستويات التالية:

  • الخطوة التالية الفورية.
  • الدورة القصيرة.
  • دورة مدتها ثوانٍ.
  • دورة المهمة الطويلة.

لا تقيّم النموذج فقط في نطاق التنبؤ الذي يؤدي فيه أفضل أداء.

3. الكمون

قياس وقت الاستدلال الفعلي على الأجهزة المستهدفة للنشر.

النماذج التي لا تفي بمتطلبات وقت التحكم لا ينبغي أن تحصل على درجات كاملة بسبب دقة تنبؤها.

4. الصحة الفيزيائية

تشمل الاختبارات:

  • التصادمات.
  • التلامس.
  • التوازن.
  • التشوه.
  • الأفعال الحساسة للاحتكاك.
  • ثبات الأشياء.
  • الاتساق من زوايا متعددة.

5. تحسين السياسات

ربما يكون السؤال الأكثر عملية هو:

هل يؤدي إضافة نموذج العالم إلى تحسين معدل نجاح المهام الفعلية؟

مقارنة أداء السياسات النهائية مع وبدون نموذج العالم——

السياسات التي تتضمن مكونات نموذج العالم وتلك التي لا تتضمنها.

6. قدرة التعميم

اختبار أشياء جديدة:

  • الأشياء
  • التخطيطات
  • هياكل الروبوت
  • الإضاءة
  • المواد
  • السلوك البشري
  • تركيبات المهام

7. القدرة على التعافي

قياس ما يحدث بعد الخطأ الأول.

يجب أن يكون النظام المنشور قادراً على اكتشاف الأعطال، تحديث حالته، ومحاولة مسار آخر.

8. السلوك على الحافة والسحابة

اختبار ظروف الشبكة العادية والمتدهورة.

عندما لا يكون الاستدلال عن بُعد متاحاً، يجب أن يفشل الروبوت بأمان.

9. معدل التدخل

تتبع المساعدة البشرية لكل:

  • ساعة
  • مهمة
  • 100 حركة
  • 1000 حركة

هذا غالباً ما يكشف عن جودة النشر بشكل أفضل من معدل النجاح الفردي.

10. التكلفة لكل مهمة ناجحة

تشمل:

  • استدلال النموذج
  • الأجهزة
  • الشبكة
  • التدخل البشري
  • إعادة العمل
  • الصيانة
  • استهلاك الطاقة
  • وقت التوقف

أفضل نموذج عالم ليس بالضرورة هو الأعلى في درجات المعايير.

بل هو النموذج الذي يجعل نظام الروبوت بأكمله يعمل بشكل أفضل.

الأسئلة الشائعة

ما هو نموذج العالم في الذكاء الاصطناعي المُجسَّد؟

نموذج العالم هو نموذج يمكنه تمثيل أو توقع كيف تتغير البيئة بمرور الوقت، أو بفعل حركات الروبوت، أو أحداث أخرى. في الروبوتات، يمكنه دعم التخطيط، المحاكاة، اختيار الأفعال، توليد بيانات التدريب، أو تحسين السياسات.

ما هي طرق نماذج العالم الرئيسية التي نوقشت في WAIC 2026؟

غطى النقاش على نطاق واسع التوليد في فضاء البكسلات، التنبؤ في الفضاء الكامن (مثل أساليب نمط JEPA)، والأنظمة الهجينة أو الموحدة التي تجمع بين التنبؤ العالمي والتحكم VLA، أو الاستدلال ثلاثي الأبعاد، أو تمثيلات أخرى. هذه الفئات تتداخل لأن عدة شركات تستخدم تقنيات متعددة.

هل تحتاج نماذج العالم للروبوتات إلى محاكي فيزيائي دقيق؟

ليس بالضرورة. بعض الباحثين يدعون إلى التنبؤ الدقيق بالهندسة والحركة والقوة، بينما يعطي آخرون الأولوية للاستدلال الفيزيائي الكافي لاختيار الفعل الصحيح. الدقة المطلوبة تعتمد على المهمة وتكلفة الفشل.

لماذا يعتبر الاتساق طويل المدى مثيراً للجدل؟

تمديد التسلسلات الطويلة مفيد للمحاكاة والتخطيط طويل المدى، لكنه يزيد من تكلفة الاستدلال وقد يبطئ التحكم في الوقت الفعلي. قد يحتاج الروبوت الفيزيائي إلى تنبؤات قصيرة وسريعة للأفعال الفورية، بينما يستخدم آلية أخرى للتخطيط طويل المدى.

ما هو PHYSICAL IQ؟

PHYSICAL IQ هي مبادرة لإنشاء معيار للذكاء الفيزيائي المُجسَّد تم إطلاقها خلال WAIC 2026. تهدف إلى توفير بروتوكول تقييم مشترك لهياكل الروبوتات المختلفة، السيناريوهات، والمهام.

هل PHYSICAL IQ و Physics-IQ من Google DeepMind هما نفس الشيء؟

لا، إنهما مشروعان مختلفان. PHYSICAL IQ هو منصة تقييم للروبوتات المُجسَّدة تم إطلاقها في WAIC 2026، بينما Physics-IQ هو معيار بحثي لاختبار ما إذا كانت نماذج الفيديو التوليدية تفهم الفيزياء.

لماذا يعتبر الاستشعار باللمس مهماً لنماذج العالم؟

الرؤية لا تكشف بشكل كامل عن قوى التلامس، الانزلاق، الضغط، المطاوعة، وبعض خصائص المواد. توفر إشارات اللمس والقوة للروبوت معلومات مباشرة عن التفاعلات الفيزيائية، وقد تصبح أكثر أهمية لنماذج العالم التي تركز على المناولة.

ما هو الأهم من عرض توضيحي جيد للروبوت؟

النشر.

الموثوقية. تحتاج الفرق إلى قياس معدلات النجاح الحقيقية للمهام، الكمون، معدلات التدخل، التعافي من الأحداث غير المتوقعة، الأمان، التكلفة، والأداء عبر بيئات عديدة، وليس فقط لحالات عرض توضيحية مختارة.

الأدوات ذات الصلة

  • مجموعة Kairos 3.1 على Hugging Face: المجموعة العامة من ACE Robotics لأعمالها في نماذج العالم المُجسَّدة الموجهة نحو الفعل.
  • LingBot-World: محاكي عالم تفاعلي مفتوح المصدر من Robbyant، يتضمن كوداً ونماذج ووثائق تقنية.
  • العالم الرقمي لـ AgiBot: إطار المحاكاة الرسمي من AgiBot لتوليد البيانات، التدريب، وتقييم النماذج المُجسَّدة.
  • GigaAI: الموقع الرسمي لـ GigaWorld و GigaBrain ومنصة الذكاء الاصطناعي المُجسَّد للشركة.
  • روبوتات X²: الموقع الرسمي الذي يصف عائلة النماذج الأساسية المُجسَّدة WALL وتكامل نموذج العالم / VLA.
  • Physics-IQ: معيار بحثي مستقل لتقييم الفهم الفيزيائي في نماذج الفيديو التوليدية.
  • NVIDIA Isaac Sim: منصة محاكاة للروبوتات لتوليد بيانات اصطناعية واختبار أنظمة الروبوتات.

الروابط ذات الصلة

antgroup.com/en/news-media/press-releases/1777280400000: إعلان رسمي من مجموعة Ant Group يصف دمج LingBot-World-Fast في LingGuang.

  • مستودع LingBot-World على GitHub: كود مفتوح المصدر من Robbyant، تعليمات التثبيت، الأوزان، وروابط الأوراق البحثية.
  • AgiBot العالم الرقمي: مقدمة رسمية من AgiBot حول إطار المحاكاة والبيانات المجسدة.
  • AgiBot EVAC و EWMBench: عمل رسمي من AgiBot حول نماذج العالم المشروطة بالفعل والتقييم.
  • روبوت X²: معلومات رسمية عن عائلة نماذج WALL والذكاء المجسد من البداية إلى النهاية.

ملخص

أظهرت المائدة المستديرة لنماذج العالم في WAIC 2026 أنه لا يوجد إجماع في مجال الذكاء المجسد حول تعريف نموذج العالم أو تمثيله أو بنيته. الانقسامات الرئيسية تتعلق بالدقة الفيزيائية، نطاق التنبؤ، طرق التمثيل، الإدراك اللمسي، والعلاقة بين النمذجة العالمية والفعل.

أقوى إجماع يظهر في المراحل المتأخرة من مجموعة التقنيات. في النهاية، يجب أن تجعل نماذج العالم الروبوتات المادية أكثر موثوقية: معدلات نجاح أعلى في المهام، تدخلات أقل، قرارات أسرع، تعافي أكثر أمانًا، وتكاليف نشر أقل.

يهدف PHYSICAL IQ إلى إنشاء طبقة تقييم مشتركة، وقبل ذلك، تتقارب البنى نفسها. يبقى أن نرى ما إذا كان هذا المعيار سيُعتمد على نطاق واسع، لكن الحاجة إلى طرق قابلة للمقارنة لقياس الذكاء الفيزيائي واضحة.

الخلافات الحالية في هذا المجال ليست ضعفًا، بل خريطة لمشاكل لم تُحل بعد، والتي قد تحدد اتجاه تطور الجيل القادم من الذكاء الاصطناعي المجسد.