دليل نشر Qwen-AgentWorld: تشغيل نموذج عالم اللغة المفتوح 35B محليًا

دليل عملي باللغة الإنجليزية حول Qwen-AgentWorld، نموذج عالم اللغة من Alibaba Qwen لوكلاء الذكاء الاصطناعي. تعرّف على تصميمه ذي المجالات السبعة، وخط أنابيب التدريب، ونتائج AgentWorldBench، وأوامر النشر باستخدام SGLang وvLLM، والاستدلال المحلي عبر Transformers، واستدعاءات واجهة API، وسير عمل التقييم، وخيارات الضبط الدقيق.

发布于 2026年7月5日generalGEO 评分: 554 次阅读
Qwen-AgentWorldنشر Qwen AgentWorldنموذج عالم لغويمحاكي وكيل ذكاء اصطناعيAgentWorldBenchQwen 35B A3BSGLang Qwen AgentWorldvLLM Qwen AgentWorldالاستدلال المحلي باستخدام Transformersنموذج عالم لغوي من Qwenمحاكاة بيئة الوكيلوكيل MCPمعيار تقييم وكيل SWEتدريب وكلاء الذكاء الاصطناعي
غلاف نظيف لمدونة تقنية بنسبة 16:9 مع خلفية داكنة لبنية تحتية للذكاء الاصطناعي، وعقدة Qwen-AgentWorld مركزية، وسبعة مجالات وكلاء متصلة، ولوحة طرفية صغيرة للنشر. بسيط وحديث ويركّز على محاكاة وكلاء الذكاء الاصطناعي.

Qwen-AgentWorld هو نموذج عالم لغوي أصدره فريق Qwen لمحاكاة بيئات الوكلاء. وبدلًا من الاكتفاء بالإجابة عن الأسئلة مثل نموذج محادثة عام، صُمم للتنبؤ بما ستعيده البيئة بعد أن يتخذ الوكيل إجراءً ما.

وهذا يجعله ذا صلة خاصة بأبحاث وكلاء الذكاء الاصطناعي، والتعلّم المعزز المُحاكى، وتقييم المعايير، والتجارب المحلية حول بيئات الطرفية، وهندسة البرمجيات، والبحث، وMCP، والويب، ونظام التشغيل، والبيئات الشبيهة بأندرويد.

هذه المقالة نسخة أُعيدت صياغتها قليلًا وتُرجمت من المقالة الصينية الأصلية. وقد حُوفظ على البنية، والتدفق التقني، والأوامر، والجداول، والأفكار الرئيسية، مع تعديل اللغة لتكون أكثر سلاسة في القراءة بالإنجليزية ومناسبة للنشر وفق تحسين محركات البحث.

ملاحظة المصدر: نُشرت المقالة الأصلية على CSDN وتذكر أنها تتبع ترخيص CC BY-SA 4.0. المصدر الأصلي: دليل النشر الكامل لـ Qwen-AgentWorld: مجاني ومفتوح المصدر، بأداء يتجاوز GPT-5.4، ويعمل خلال 5 دقائق. ملاحظة التحقق: تؤكد صفحات Qwen الرسمية الإتاحة العامة لأوزان نموذج Qwen-AgentWorld-35B-A3B وAgentWorldBench. أما النموذج الأكبر Qwen-AgentWorld-397B-A17B فهو مُدرج ضمن نتائج المعايير الرسمية، لكن صفحة النموذج العامة وإصدار GitHub يشيران أساسًا إلى أوزان نموذج 35B-A3B.


1. الخلفية: لماذا نحتاج إلى نموذج عالم لغوي؟

على مدار العامين الماضيين، انتقلت وكلاء الذكاء الاصطناعي بسرعة من مساعدين بسيطين للدردشة إلى أدوات يمكنها تشغيل مواقع الويب، وتنفيذ أوامر الطرفية، والتحكم في تطبيقات الهاتف المحمول، وإنجاز مهام هندسة البرمجيات.

لكن تدريب وكيل قوي مكلف. فهو يتطلب غالبًا كميات كبيرة من التفاعل مع بيئات حقيقية، وهذا يخلق عدة مشكلات عملية:

  • بناء البيئات وصيانتها أمر شاق.

  • جمع البيانات بطيء ويصعب توسيع نطاقه.

  • تنطوي البيئات الحقيقية على مخاطر، خاصة عند اختبار حالات الفشل أو إدخال اضطرابات مضبوطة.

تم بناء نموذج العالم اللغوي، أو LWM، لحل هذه المشكلة. الفكرة بسيطة لكنها قوية: اجعل نموذجًا يؤدي دور البيئة. بالنظر إلى إجراء الوكيل وسجل التفاعل، يتنبأ النموذج بالحالة التالية للبيئة.

بفضل هذا الإعداد، يمكن تدريب الوكلاء وتقييمهم في المحاكاة بدلًا من الاعتماد دائمًا على الأنظمة الحقيقية.

في 2026-06-24، أصدر فريق Qwen نموذج Qwen-AgentWorld، وهو نموذج عالم لغوي أصلي يوحّد سبعة مجالات لتفاعل الوكلاء في نموذج واحد. كما تم إصدار المعيار المصاحب، AgentWorldBench.

الموارد الرسمية:

GitHub: QwenLM/Qwen-AgentWorld


2. الفكرة الأساسية: ما الذي يجعله نموذج عالم «أصليًا»؟

كلمة أصلي مهمة هنا. إن Qwen-AgentWorld ليس مجرد نموذج لغوي كبير عام الغرض جرى تكييفه بعد التدريب لمحاكاة بيئة ما. بل إن هدفه في نمذجة العالم مدمج في عملية التدريب منذ البداية.

بُعد المقارنة

النهج التقليدي

Qwen-AgentWorld

نقطة بدء التدريب

ضبط دقيق لنموذج لغوي كبير عام

اعتبار نمذجة البيئة هدفًا بدءًا من CPT فصاعدًا

عملية التدريب

عادةً SFT أو RL فقط

CPT → SFT → RL

معرفة البيئة

تُضاف عبر بيانات إضافية أو تكييف

تُستوعب داخليًا أثناء التدريب

تغطية المجال

نطاق واحد أو بضعة نطاقات

سبعة نطاقات في نموذج واحد

بعبارة أخرى، ليس Qwen-AgentWorld مجرد نموذج عام مُغلّف بالمطالبات. بل يتم تدريبه من الطبقات الدنيا في مسار المعالجة للتنبؤ بالحالة التالية للبيئة.

وهذا يمنح النموذج فهمًا أكثر تنظيمًا لديناميكيات البيئة، خاصةً عند محاكاة مسارات تفاعل طويلة.


3. سبعة نطاقات: بيئات نصية وواجهات مستخدم رسومية في نموذج واحد

يقسّم Qwen-AgentWorld سيناريوهات تفاعل الوكلاء إلى مجموعتين كبيرتين: بيئات قائمة على النص وبيئات قائمة على واجهة المستخدم الرسومية.

┌──────────────────────────────────────────┐
│             Qwen-AgentWorld              │
│                                          │
│  بيئات نصية       بيئات واجهة رسومية     │
│  ┌──────────┐       ┌──────────────────┐ │
│  │  MCP     │       │  الويب           │ │
│  │  البحث   │       │  نظام التشغيل    │ │
│  │  الطرفية │       │  أندرويد         │ │
│  │  SWE     │       └──────────────────┘ │
│  └──────────┘                            │
└──────────────────────────────────────────┘

النطاق

النوع

الوصف

MCP

نص

استدعاء الأدوات وتفاعلات بروتوكول سياق النموذج

البحث

نص

التفاعل مع محرك البحث وسلوك الاسترجاع

الطرفية

نص

تنفيذ أوامر طرفية لينكس

SWE

نص

rowspan="1">

مهام هندسة البرمجيات، مثل إصلاحات الشيفرة

الويب

واجهة المستخدم الرسومية

التفاعل مع المتصفح وصفحات الويب

نظام التشغيل

واجهة المستخدم الرسومية

التفاعل مع نظام تشغيل سطح المكتب

أندرويد

واجهة المستخدم الرسومية

التفاعل مع تطبيقات الهاتف المحمول وواجهات المستخدم بأسلوب أندرويد

بالنسبة إلى مجالات واجهة المستخدم الرسومية الثلاثة، تُمثَّل الملاحظات على هيئة شيفرة قابلة للعرض بدلاً من إطارات بكسلات خام. وهذا يتيح لنموذج عالم قائم على النصوص تغطية البيئات المرئية دون معالجة تسلسلات صور كاملة مباشرةً.

دُرِّب النموذج على أكثر من 10 ملايين مسار تفاعل واقعي عبر المجالات السبعة.


4. خط أنابيب تدريب من ثلاث مراحل

يستخدم Qwen-AgentWorld خط أنابيب تدريب متصلًا من ثلاث مراحل: CPT → SFT → RL.

المرحلة 1: CPT — حقن معرفة البيئة

أثناء التدريب المسبق المستمر، يتعلم النموذج من مسارات تفاعل واسعة النطاق مع بيئات حقيقية. تُضمّن هذه المرحلة ديناميكيات البيئة داخل أوزان النموذج.

تذكر المقالة الأصلية أيضًا قناع خسارة معلوماتي على مستوى الدور. والهدف هو تحديد أدوار الحوار التي تحمل فعليًا معلومات عن حالة البيئة وتقليل الضوضاء من الأدوار الأقل فائدة.

المرحلة 2: SFT — تنشيط الاستدلال بسلسلة الأفكار

يحوّل الضبط الدقيق الخاضع للإشراف التنبؤ بالحالة التالية إلى نمط استدلال بأسلوب سلسلة الأفكار.

بدلًا من إخراج نتيجة متوقعة مباشرةً، يتعلم النموذج الاستدلال حول سبب وجوب تغيّر الحالة قبل توليد الملاحظة التالية.

المرحلة 3: RL — تحسين دقة المحاكاة

تستخدم مرحلة التعلم المعزز إشارات مكافأة هجينة، بما في ذلك خوارزمية GSPO، لتحسين جودة المخرجات.

يركز التحسين على:

  • صحة التنسيق

  • الدقة الواقعية

اتساق السياق

الواقعية

الجودة الإجمالية للمحاكاة

السلوكيات الناشئة المذكورة في المقالة الأصلية: يُقال إن Qwen-AgentWorld يُظهر سلوك التصحيح الذاتي، ومنع تسرّب المعلومات في سيناريوهات البحث، والاستدلال السببي متعدد الخطوات لبعض تنبؤات مخرجات الأوامر.


5. قائمة النماذج مفتوحة المصدر

الإصدار

المعلمات

المعلمات المُفعَّلة

طول السياق

التموضع

Qwen-AgentWorld-35B-A3B

35B

3B

256 ألف رمز

نموذج مفتوح عام وفعّال

Qwen-AgentWorld-397B-A17B

397B

17B

غير مذكور بوضوح في الجدول الأصلي

border-border px-3 py-2 align-top" colspan="1" rowspan="1">

نموذج قياسي رائد

AgentWorldBench

معيار تقييم

تفاصيل بنية 35B-A3B

  • النموذج الأساسي: Qwen3.5-35B-A3B-Base

  • نوع النموذج: نموذج لغة سببي / نموذج عالم لغوي

  • نمط البنية: انتباه خطي هجين + MoE

  • البعد المخفي: 2048

  • الطبقات: 40 طبقة

  • تخطيط الطبقات: مجموعات متكررة تضم مكونات Gated DeltaNet وGated Attention وMoE

  • الخبراء: 256 خبيرًا

الخبراء المُفعَّلون: 8 خبراء موجَّهون + خبير مشترك واحد

طول السياق: 262,144 رمزًا

  • الحد الأدنى الموصى به للسياق: 128 ألف رمز لتحسين جودة محاكاة المسارات الطويلة

تشير وثائق Hugging Face الرسمية أيضًا إلى أن النموذج متوافق مع Transformers وvLLM وSGLang.


6. مقارنة الأداء: نتائج AgentWorldBench

يقيّم AgentWorldBench كل نموذج عبر خمسة أبعاد: التنسيق، والواقعية المعلوماتية، والاتساق، والواقعية، والجودة. تُطبَّع الدرجات إلى مقياس من 0 إلى 100، حيث تكون الدرجة الأعلى أفضل.

الترتيب الكامل حسب الدرجة الإجمالية

60.85

النموذج

MCP

البحث

الطرفية

SWE

أندرويد

الويب

نظام التشغيل

الإجمالي

Qwen-AgentWorld-397B-A17B

68.24

37.82

57.73

68.49

60.20

50.98

67.89

58.71

GPT-5.4

70.10

37.26

53.69

66.29

60.00

51.80

68.58

58.25

Claude Opus 4.6

69.90

29.30

57.51

64.55

61.74

51.42

70.20

57.80

Claude Opus 4.8

54.93

35.14

59.18

64.10

61.50

54.66

66.62

56.59

Qwen-AgentWorld-35B-A3B

64.79

36.69

53.96

65.63

58.17

49.55

65.92

56.39

Claude Sonnet 4.6

70.00

28.79

56.98

64.52

58.03

50.78

63.17

56.04

Qwen3.5-397B-A17B

68.31

30.81

55.30

64.44

54.90

48.55

54.74

Gemini 3.1 Pro

59.07

30.21

52.47

59.07

61.40

52.83

66.92

54.57

DeepSeek-V4-Pro

63.27

27.61

51.26

59.44

55.17

50.32

63.70

52.97

Qwen3.5-35B-A3B

57.87

25.98

46.13

47.58

53.18

47.10

56.27

47.73

أهم الخلاصات من المقال الأصلي:

  • يحقق Qwen-AgentWorld-397B-A17B درجة إجمالية قدرها 58.71 ويحتل المرتبة الأولى في جدول AgentWorldBench المدرج.

  • يتحسن Qwen-AgentWorld-35B-A3B بمقدار +8.66 نقطة مقارنةً بنموذج الأساس Qwen3.5-35B-A3B.

ملاحظة عملية: تعامل مع أرقام المقاييس المرجعية على أنها بيانات مرجعية من إعداد الاختبار الرسمي. ستعتمد النتائج الفعلية على العتاد، وتصميم الموجّهات، وإطار عمل التقديم، وطول السياق، والبيئة التي تتم محاكاتها.


7. أربعة أنماط تطبيقية والنتائج التجريبية

النمط 1: توسيع بيئات خارج التوزيع قابل للتعميم

تصف المقالة الأصلية استخدام Qwen-AgentWorld-397B-A17B للتعلّم المعزّز المُحاكى عبر 4,000 بيئة OpenClaw خارج التوزيع، ثم اختبار التعميم دون أمثلة مسبقة في مجالات جديدة.

طريقة التدريب

Claw-Eval

QwenClawBench

Base SFT

65.4

47.9

تعلم التعزيز بالمحاكاة باستخدام محاكي نموذج عام

66.7

47.8

تعلم التعزيز بالمحاكاة باستخدام محاكي Qwen-AgentWorld

69.7

55.0

التحسن

+4.3

+7.1

النمط 2: المحاكاة القابلة للتحكم — الاضطراب الموجّه عبر MCP

يمكن للاضطرابات المضبوطة أن تكشف نقاط الضعف في الوكيل بفعالية أكبر من التدريب القياسي في البيئة الواقعية.

الإعداد

ديكاثلون الأدوات

MCPMark

SFT الأساسي

32.4

21.5

التعلم المعزز بالمحاكاة دون تحكم

31.5

24.6

التعلم المعزز بالمحاكاة مع التحكم

36.1

33.8

التحسن

+3.7

+12.3

النمط 3: بناء عالم خيالي — مجال البحث

تستخدم تجربة مجال البحث عالم بحث خياليًا لكنه متسق ذاتيًا للتدريب، ثم تقيّم التعميم على مهام بحث حقيقية.

الإعداد

عنصر WideSearch F1

صف WideSearch F1

النموذج الأساسي SFT، 35B

34.02

13.72

+ عالم خيالي بتعلّم تعزيزي بالمحاكاة

50.31

24.21

التحسن

+16.29

+10.49

النمط 4: النموذج الأساسي للوكيل — نقل الإحماء بالتعلّم التعزيزي في LWM

تصف المقالة أيضًا التمهيد باستخدام LWM RL كطريقة لتحسين أداء الوكيل في المهام اللاحقة دون إجراء ضبط دقيق إضافي بالتعلم المعزز على تلك المهام المحددة.

المقياس

Terminal-Bench 2.0

SWE-Bench Verified

SWE-Bench Pro

WideSearch F1

Claw-Eval

BFCL v4

SFT الأساسي

33.25

64.47

42.18

33.38

53.60

62.29

+ إحماء LWM RL

39.55

67.86

47.42

46.17

64.88

71.25

التحسّن

+6.30

+3.39

+5.24

+12.79

+11.28

+8.96

أبرز النقاط: تأتي بيانات الإحماء من مسارات أحادية الدور وغير وكيلية، ومع ذلك ينتقل التحسّن إلى مهام وكيل أكثر تعقيدًا متعددة الأدوار تستدعي الأدوات. وهذا يشير إلى أن معرفة نمذجة العالم يمكن أن تنتقل إلى ما يتجاوز صيغة تدريبها الأصلية.


8. دليل النشر السريع

الطريقة 1: النشر باستخدام SGLang

يوصى باستخدام SGLang في المقالة الأصلية لتقديم خدمة سريعة.

pip install sglang
python -m sglang.launch_server \
    --model-path Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tp-size 4 \
    --context-length 262144 \
    --reasoning-parser qwen3

بعد بدء التشغيل، تكون نقطة نهاية واجهة برمجة التطبيقات المتوافقة مع OpenAI هي:

http://localhost:8000/v1

الطريقة 2: النشر باستخدام vLLM

pip install vllm
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --trust-remote-code

ملاحظة من الوثائق الرسمية: توصي بطاقة النموذج الحالية على Hugging Face أيضًا باستخدام --language-model-only مع vLLM لأن بنية النموذج تتضمن تعريفات لمكوّنات مرئية، بينما تحتوي نقطة التحقق على أوزان نموذج اللغة. إذا فشلت تهيئة vLLM، فجرّب إضافة هذا الخيار.

vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --language-model-only \
    --trust-remote-code

الطريقة 3: الاستدلال المحلي باستخدام Transformers

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen-AgentWorld-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto",
)

# مثال في مجال الطرفية: اطلب من النموذج التنبؤ بمخرجات الأمر.
messages = [
    {
        "role": "system",
        "content": "أنت نموذج عالم لغوي يحاكي بيئة طرفية Linux. "
                   "بالنظر إلى أمر المستخدم، تنبأ بمخرجات الطرفية."
    },
    {
        "role": "user",
        "content": "الإجراء: execute_bash\nالأمر: ls -la /home/user/project/"
    }
]

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)
print(response)

الطريقة 4: الاستدعاء عبر واجهة برمجة تطبيقات متوافقة مع OpenAI

تعمل هذه الطريقة بعد تقديم النموذج عبر SGLang أو vLLM.

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

messages = [
    {
        "role": "system",
        "content": "أنت نموذج عالم لغوي يحاكي بيئة طرفية Linux."
    },
    {
        "role": "user",
        "content": "الإجراء: execute_bash\nالأمر: pwd"
    }
]

response = client.chat.completions.create(
    model="Qwen/Qwen-AgentWorld-35B-A3B",
    messages=messages,
    max_tokens=32768,
    temperature=0.6,
)

print(response.choices[0].message.content)

أفضل الممارسات

  • إعدادات أخذ العينات الموصى بها: temperature=0.6، top_p=0.95، top_k=20

طول المخرجات الموصى به: حوالي 32,768 رمزًا لمعظم الملاحظات الطويلة

  • استخدم مطالبات النظام الخاصة بالمجال من دليل prompts/ في المستودع لتحسين جودة المحاكاة

  • حافظ على طول السياق عند 128K على الأقل عند الإمكان؛ سياق النموذج الافتراضي هو 256K


9. سير عمل تقييم AgentWorldBench

إذا كنت تريد اختبار نموذج العالم الخاص بك على AgentWorldBench، فإن المقالة الأصلية تقدم سير عمل من ثلاث خطوات.

# 1. استنسخ مستودع التقييم
git clone https://github.com/QwenLM/Qwen-AgentWorld.git
cd Qwen-AgentWorld

# 2. نزّل مجموعة بيانات التقييم
huggingface-cli download Qwen/AgentWorldBench --repo-type dataset --local-dir ./AgentWorldBench

# 3. ثبّت التبعيات
pip install openai

cd eval

# الخطوة 1: استدلال نموذج العالم
python eval.py infer \
    --data-dir ../AgentWorldBench \
    --model-base-url http://localhost:8000/v1 \
    --model-name Qwen/Qwen-AgentWorld-35B-A3B \
    --output-dir ./results

# الخطوة 2: تسجيل حكم نموذج اللغة الكبير. يتطلب ذلك مفتاح API من OpenAI.
export OPENAI_API_KEY="your-api-key"
python eval.py judge \
    --predictions ./results/predictions.jsonl \
    --judge-base-url https://api.openai.com/v1 \
    --judge-model gpt-5.2-2025-12-11 \
    --output-dir ./results

# الخطوة 3: تجميع الدرجات
python eval.py score --predictions ./results/judged.jsonl

يتضمن كل نموذج اختبار بيانات ملاحظة مرجعية من تنفيذ بيئة حقيقية. يقيّم هذا المعيار قدرة نمذجة العالم عبر التنسيق، والواقعية المعلوماتية، والاتساق، والواقعية، والجودة.


10. اقتراحات الضبط الدقيق

إذا كنت ترغب في تخصيص Qwen-AgentWorld لمجال محدد، فإن المقالة الأصلية توصي بثلاثة أطر شائعة للضبط الدقيق.

الإطار

نقطة القوة

السيناريو المناسب

ms-swift

تكامل عالٍ مع ModelScope

تجارب سريعة وسير عمل ضمن منظومة Alibaba

LLaMA-Factory

مجتمع نشط ودعم واسع لاستراتيجيات التدريب

النشر الهندسي العملي

com/unslothai/unsloth">Unsloth

تحسين قوي لاستخدام الذاكرة

الضبط الدقيق في بيئات محدودة الموارد


11. ملاحظات المصدر والتعامل مع الصور

تتضمن المقالة الأصلية عدة صور مرتبطة بمجالات Qwen-AgentWorld ونتائج المعايير المرجعية. وقد أُبقيت هذه الصور في الأقسام ذات الصلة.

تمت إزالة أيقونات منصة CSDN، ووحدات الترويج، وكتل اشتراك المؤلف، ورموز QR، وأزرار المكافآت، وصور التوصيات غير ذات الصلة وفقًا لمتطلبات النشر.


الأسئلة الشائعة

ما هو Qwen-AgentWorld؟

Qwen-AgentWorld هو نموذج عالم لغوي من فريق Qwen. يتنبأ بحالة البيئة التالية بعد أن يتخذ الوكيل إجراءً، مما يجعله مفيدًا لمحاكاة الوكلاء وتدريبهم وتقييمهم.

هل Qwen-AgentWorld هو نفسه نموذج محادثة عادي؟

لا. نموذج المحادثة العادي مُحسَّن أساسًا للمحادثة واتباع التعليمات. أما Qwen-AgentWorld فقد دُرِّب كمحاكي للبيئة، لذلك فإن حالة استخدامه الرئيسية هي التنبؤ بالملاحظات في بيئات تفاعل الوكلاء.

أي نموذج من Qwen-AgentWorld متاح للعامة؟

تدرج الصفحات الرسمية Qwen-AgentWorld-35B-A3B بوصفه وزن النموذج المُصدر للعامة. كما يتوفر AgentWorldBench كمعيار تقييم. يظهر النموذج الأكبر 397B في جداول المعايير المرجعية، لكن إصدار النموذج العام يشير أساسًا إلى نسخة 35B-A3B.

هل يمكن نشر Qwen-AgentWorld باستخدام vLLM؟

نعم. تتضمن بطاقة نموذج Hugging Face مثالًا على تقديم الخدمة باستخدام vLLM. إذا واجهت مشكلات في التهيئة، توصي بطاقة النموذج الرسمية بإضافة --language-model-only لأن نقطة التحقق تحتوي على أوزان نموذج اللغة.

هل يمكن نشر Qwen-AgentWorld باستخدام SGLang؟

نعم. يُعد SGLang أحد خيارات تقديم الخدمة الموصى بها ويمكنه إتاحة نقطة نهاية API متوافقة مع OpenAI. بعد ذلك يمكن استدعاء النموذج عبر طلبات API محلية.

لماذا يحتاج Qwen-AgentWorld إلى نافذة سياق طويلة؟

غالبًا ما تعتمد محاكاة بيئة الوكيل على سجلات تفاعل طويلة. قد تؤدي نافذة سياق أقصر إلى فقدان معلومات مهمة عن الحالة، لذلك توصي الإرشادات الرسمية بالحفاظ على ما لا يقل عن 128 ألف رمز مميز عندما يكون ذلك ممكنًا.

ما استخدام AgentWorldBench؟

AgentWorldBench هو المعيار المرجعي الذي أُصدر مع Qwen-AgentWorld. يقيّم نماذج العوالم اللغوية عبر سبعة مجالات باستخدام أبعاد مثل التنسيق، والدقة الواقعية، والاتساق، والواقعية، والجودة.

هل Qwen-AgentWorld مناسب للاستخدام في الإنتاج؟

يمكن أن يكون مفيدًا للبحث والتقييم والمحاكاة والتجارب الداخلية. بالنسبة لأنظمة الإنتاج، لا تزال بحاجة إلى تقييم زمن الاستجابة، وتكلفة الأجهزة، والسلامة، وموثوقية المطالبات، وما إذا كانت النتائج المُحاكاة تطابق بيئتك الحقيقية بدرجة كافية.


الأدوات ذات الصلة

  • Qwen-AgentWorld GitHub: المستودع الرسمي لشيفرة Qwen-AgentWorld والمطالبات وسير عمل التقييم.

  • Qwen-AgentWorld-35B-A3B على Hugging Face: صفحة النموذج الرسمية للأوزان العامة 35B-A3B.

  • AgentWorldBench: مجموعة بيانات معيارية رسمية لتقييم نماذج العالم اللغوية.

  • SGLang: إطار عمل سريع لتقديم نماذج اللغة الكبيرة.

  • vLLM: محرك استدلال عالي الإنتاجية لتقديم نماذج اللغة الكبيرة.

  • Transformers: مكتبة Hugging Face لتحميل النماذج محليًا وإجراء الاستدلال.

  • OpenAI Python SDK: عميل Python يمكنه استدعاء خوادم النماذج المحلية المتوافقة مع OpenAI.

  • ms-swift: إطار عمل ModelScope للتدريب والضبط الدقيق لسير عمل نماذج اللغة الكبيرة.


روابط ذات صلة

  • LLaMA-Factory: إطار عمل مفتوح المصدر شائع لتجارب الضبط الدقيق لنماذج اللغة الكبيرة ونشرها.