تقرير: ByteDance تخطط لإطلاق نموذج ذكاء اصطناعي يزيد عن 5 تريليونات معلمة، وتشير تقارير لاحقة إلى ما يصل إلى 10 تريليونات
سباق النماذج الرائدة في الصين يدخل الآن عصر تريليونات المعلمات. فقد وصل نموذج Qwen3.8-Max من阿里巴巴 إلى 2.4 تريليون معلمة، بينما رفع Kimi K3 من月之暗面 العدد إلى

تقارير: ByteDance تخطط لتدريب نموذج ذكاء اصطناعي يتجاوز 5 تريليونات معامل، وتقارير لاحقة تشير إلى ما يصل إلى 10 تريليونات
مقدمة
سباق النماذج المتطورة في الصين يدخل بجدية عصر تريليونات المعاملات.
نموذج Qwen3.8-Max من阿里巴巴 وصل إلى 2.4 تريليون معامل، بينما رفعت شركة Moonshot AI نموذج Kimi K3 إلى 2.8 تريليون معامل.
يبدو أن ByteDance تستعد للقفزة التالية.
ذكرت AIBase نقلاً عن تقرير LatePost أن ByteDance كانت تناقش في 7 أغسطس 2026 تدريب نموذج أساسي يتجاوز 5 تريليونات معامل. ووفقاً للتقرير، لا يزال المشروع في مراحله المبكرة، ولا يوجد ضمان بأن النموذج النهائي سيُطرح.

من حيث الحجم فقط، سيكون هذا المشروع من أكبر مشاريع نماذج الذكاء الاصطناعي المعلن عنها في الصين.
ومع ذلك، كان هناك تحديث مهم آخر في نفس اليوم.
في وقت لاحق من 7 أغسطس، ذكرت رويترز نقلاً عن صحيفة فاينانشال تايمز البريطانية ومصادر مطلعة أن ByteDance تدرب نموذجاً يصل إلى 10 تريليونات معامل، وأن النموذج دخل بالفعل مرحلة ما قبل التدريب. لم ترد ByteDance علناً على هذا التقرير في ذلك الوقت.
التقريران ليسا بالضرورة متناقضين. فالمشروع الذي نوقش في البداية بأنه "أكثر من 5 تريليونات" قد يستهدف في النهاية تكويناً أكبر. ولكن نظراً لأن ByteDance لم تكشف رسمياً عن بنية النموذج أو عدد معاملاته، فيجب اعتبار جميع الأرقام في هذا المقال خططاً مذكورة في التقارير، وليست مواصفات مؤكدة للنموذج.
حسبما ورد، ByteDance تتجه نحو حاجز 5 تريليونات معامل
ذكر التقرير الأصلي لـLatePost أن ByteDance تناقش نموذجاً يتجاوز 5 تريليونات معامل.
وهذا سيجعله متقدماً بفارق كبير على الأحجام المعلنة حالياً لعدة نماذج صينية متطورة.
| النموذج | إجمالي المعاملات المعلن | الحالة |
|---|---|---|
| Qwen3.8-Max | 2.4 تريليون | أعلنته阿里巴巴 |
| Kimi K3 | 2.8 تريليون | أعلنته Moonshot AI |
| نموذج ByteDance المذكور في التقارير | أكثر من 5 تريليونات | خطة مذكورة في التقارير |
| بيانات FT/رويترز اللاحقة | حتى 10 تريليونات | مذكور في تقارير، دون تأكيد رسمي |
وصفت Moonshot AI رسمياً Kimi K3 بأنه نموذج خليط خبراء بـ 2.8 تريليون معامل، مع تفعيل 104 مليار معامل لكل رمز.
ذكرت رويترز في 3 أغسطس أن Qwen3.8-Max من阿里巴巴 يحتوي على 2.4 تريليون معامل إجمالي.
إذا قامت ByteDance في النهاية بتدريب ونشر نموذج يتراوح بين 5 و10 تريليونات معامل، فهذا يمثل قفزة كبيرة في الحجم الإجمالي للنموذج.
لكن هذا لا يعني تلقائياً أن قدرات النموذج ستكون ضعفين أو ثلاثة أضعاف.
عدد المعاملات لا يساوي مستوى الذكاء
وصفت مصادر AIBase نموذج 5 تريليونات معامل بأنه في نفس الفئة الكمية للأنظمة المتطورة الأمريكية الرائدة مثل GPT-5.6 أو أحدث نماذج Anthropic عالية المستوى.
هذه المقارنة تحتاج إلى شرط مهم.
OpenAI وAnthropic لم تكشفا علناً عن العدد الدقيق لمعاملات GPT-5.6 أو Claude Fable 5 أو Claude Mythos 5.
أشارت رويترز في تقريرها في 7 أغسطس إلى نفس النقطة: من الصعب إجراء مقارنة مباشرة في الحجم مع الأنظمة الأمريكية الرائدة لأن تلك المختبرات لا تنشر عدد معاملات نماذجها.
عدد المعاملات هو مجرد بُعد واحد لقياس قدرات النموذج.
يعتمد الأداء أيضاً على:
- بنية النموذج
- عدد المعاملات المفعلة لكل رمز
- جودة بيانات التدريب
- عدد رموز التدريب
- تصفية البيانات
- تصميم المُحسِّن
- التعلم المعزز
- ما بعد التدريب
- استخدام الأدوات
- الحساب وقت الاختبار
- بنية السياق الطويل
- كفاءة الاستدلال
هذه النقطة مهمة بشكل خاص لنماذج خليط الخبراء.
قد يحتوي نموذج MoE المتناثر على تريليونات من المعاملات الإجمالية، لكنه يفعل فقط مجموعة فرعية صغيرة جداً منها لكل رمز.
Kimi K3 مثال جيد.
مواصفاته الرسمية تذكر:
- 2.8 تريليون معامل إجمالي
- 10.4 مليار معامل مفعل
- 896 خبيراً موزعاً
- اختيار 16 خبيراً لكل رمز
لذلك، العدد الإجمالي للأوزان ليس هو نفس مقدار الحساب المستخدم في كل خطوة استدلال.
لم تكشف ByteDance علناً ما إذا كان النموذج المذكور في التقارير يستخدم بنية متناثرة مماثلة، ولم تكشف عن عدد المعاملات التي سيتم تفعيلها لكل رمز.
نموذج بـ 5 تريليونات معامل سيتطلب قوة حاسوبية هائلة للتدريب
استخدم التقرير الأصلي معالجات NVIDIA H100 كمثال لتوضيح الحجم.
تشير تقديراته إلى أن تدريب نموذج بـ 5 تريليونات معامل يتطلب تقريباً:
- 100,000 وحدة معالجة رسومية بمستوى H100 تعمل لمدة 347 يوماً، أو
- 1,000,000 وحدة معالجة رسومية تعمل لمدة حوالي 35 يوماً
كلا السيناريوهين يضعان إجمالي وقت المسرعات في نفس النطاق تقريباً:
| السيناريو | عدد وحدات GPU | المدة | أيام GPU تقريباً |
|---|---|---|---|
| مجموعة طويلة الأمد | 100,000 | 347 يوماً | 34.7 مليون |
| مجموعة قصيرة الأمد واسعة النطاق | 1,000,000 | 35 يوماً | 35 مليون |
يجب فهم هذه الأرقام كتقديرات سيناريو تقريبية من المصادر، وليست معادلة هندسية عامة.
تعتمد متطلبات التدريب الفعلية إلى حد كبير على:
- البنية
- التنشيط المتناثر مقابل الكثيف
- عدد الرموز
- الدقة
- كفاءة استخدام وحدات الفاصلة العائمة للنموذج
- حفظ نقاط التفتيش
- كفاءة الشبكة
- جيل الأجهزة
- استقرار التدريب
- أداء خط أنابيب البيانات
- عمليات الفشل وإعادة التشغيل
تظهر مواصفات NVIDIA الرسمية لـ H100 أن إصدار SXM يصل استهلاكه الحراري الأقصى إلى 700 واط، ويدعم تدريب المحولات على نطاق واسع عبر محرك Transformer الخاص بمعمارية Hopper وبنية NVLink.
على نطاق مئات الآلاف من المسرعات، تصل مجموعة GPU وحدها إلى حجم تصبح فيه الطاقة والشبكات والتبريد وسعة مراكز البيانات قيوداً ذات أولوية قصوى.
لماذا لا يعني "مليون وحدة GPU" أن ByteDance ستدرب بهذه الطريقة
أشارت مصادر AIBase بشكل صحيح إلى أن تشغيل مليون وحدة H100 في وقت واحد سيكون تكويناً بنيوياً متطرفاً.
المشروع الواقعي أكثر قد يوزع التدريب على مجموعة أصغر لكنها لا تزال ضخمة.
اقترحت المصادر سيناريو أقرب:
- 200,000 إلى 300,000 مسرّع
- تعمل لمدة حوالي ثلاثة إلى أربعة أشهر
سيبقى هذا واحداً من أكبر مجموعات التدريب على الإطلاق.
واحداً من أكثر مشاريع تدريب النماذج طموحاً في تاريخ البشرية.
وما قبل التدريب ليس سوى مرحلة واحدة.
النموذج المتطور يحتاج أيضاً إلى وقت وقوة حاسوبية لإكمال الخطوات التالية:
- إعداد البيانات
- تجارب البنية
- أبحاث توسيع النطاق
- ما قبل التدريب
- تقييم نقاط التفتيش
- ما بعد التدريب الخاضع للإشراف
- التعلم المعزز
- اختبارات السلامة
- تدريب الأدوات والعوامل الذكية
- تحسين الخدمة
لذلك، قدّرت المقالة الأصلية لـAIBase أن العملية بأكملها تتطلب ستة أشهر على الأقل، وقد تقترب المدة الإجمالية من عام قبل ظهور نموذج مكتمل.
لاحقاً، ذكر تقرير صحيفة فاينانشال تايمز (كما لخصته رويترز) أن النموذج دخل مرحلة ما قبل التدريب، مشيراً إلى أن هذه المرحلة تستغرق عادة حوالي ثلاثة إلى ستة أشهر قبل الانتقال إلى الضبط الدقيق ومرحلة الإصدار.
كلا الوصفين يشيران إلى نفس الاستنتاج العملي: مشروع بهذا الحجم هو مشروع بنية تحتية طويل الأمد، وليس نموذجاً يظهر فور تشغيل أول مجموعة تدريب.
ByteDance لديها القدرة على المحاولة
التدريب على هذا النطاق ليس مجرد مسألة بحثية.
إنه أيضاً مسألة بنية تحتية ورأسمال.
ByteDance هي واحدة من الشركات الصينية القليلة التي تمتلك الموارد المالية والقنوات التوزيعية للمستهلكين والبنية التحتية السحابية وسعة مراكز البيانات وفريق هندسة الذكاء الاصطناعي اللازمة لمحاولة جدية في مشروع بهذا الحجم.
تمتد منظمة Seed الرسمية لهذه الشركة إلى المجالات التالية:
- التدريب المسبق للنماذج الأساسية
- التدريب اللاحق
- التعلم التعزيزي
- الاستدلال عالي الأداء
- التدريب الموزع
- تجميع الأجهزة غير المتجانسة
- النماذج متعددة الوسائط
- أنظمة الوكلاء
يصف فريق البنية التحتية في ByteDance عمله بوضوح على أنه يشمل التدريب الموزع، وأنظمة التعلم التعزيزي، والاستدلال عالي الأداء، وتقنيات التجميع الموجهة للنماذج الأساسية.
كما تذكر مواد التوظيف الخاصة بهم بوضوح محاور العمل التالية:
- التدريب فائق الضخامة
- استقرار التدريب
- استغلال وحدات الفلوبس في النماذج
- التصميم المشترك للأجهزة والبرمجيات
- الاستدلال متعدد العقد
- التوازي
- تحسين الجدولة
هذه هي بالضبط مشكلات هندسة الأنظمة التي تصبح بالغة الأهمية عند تدريب نماذج بحجم تريليونات المعلمات.
أعداد وحدات معالجة الرسوميات في المصدر هي مجرد تقديرات وليست بيانات معلنة رسميًا
كما استشهد AIBase بتقديرات جهات خارجية لحجم القدرة الحاسوبية المتاحة للعديد من المختبرات الرائدة.
الأرقام التقريبية المذكورة في المقال:
- OpenAI حوالي مليوني وحدة معالجة رسومية
- Anthropic حوالي 620 ألف وحدة
- DeepSeek حوالي 60 ألف وحدة
لا ينبغي اعتبار هذه الأرقام بيانات جرد مدققة.
لا تقوم OpenAI وAnthropic بالإعلان علنًا عن العدد اللحظي لجميع المسرعات المتاحة في منشآتها الخاصة وشركائها السحابيين وسعتها المحجوزة.
تقدير DeepSeek بحوالي 60 ألف مسرّع جاء في الأصل من تحليلات SemiAnalysis، ومنذ ذلك الحين تم الاستشهاد به على نطاق واسع في تقارير مختلفة. تشمل هذه التقديرات مزيجًا من مسرعات متعددة مثل A100 وH100 وH800 وH20، وليس أسطولًا موحدًا من نوع واحد.
الأكثر موثوقية من أي رقم جرد دقيق هو النقطة الرئيسية الأوسع:
أصبح تطوير النماذج المتطورة يعتمد بشكل متزايد على الوصول إلى قدرة حاسوبية فائقة الضخامة، ومع استمرار نمو حجم النماذج، يمكن أن تصبح الفجوة بين الشركات التي تمتلك بنية تحتية فائقة الضخامة والمختبرات الأصغر شاسعة جدًا.
مع الارتفاع إلى تريليونات المعلمات.
مقارنة H100 هي مجرد خط أساس
استخدام القوة الحاسوبية المكافئة لـ H100 يجعل النقاش حول الحوسبة أكثر قابلية للفهم، لكن ByteDance قد لا تعتمد بالضرورة على نوع واحد من المسرعات.
يمكن لشركات الذكاء الاصطناعي الكبيرة دمج استخدام:
- H100
- H200
- أنظمة NVIDIA من جيل Blackwell
- رقائق NVIDIA المخصصة للسوق الصينية
- مسرعات ذكاء اصطناعي محلية
- أجهزة مخصصة
- مناطق سحابية ومراكز بيانات متعددة
يمكن للمسرعات الأحدث أن تغير عدد وحدات معالجة الرسوميات المادية المطلوبة لإنجاز نفس القدر من الحساب التدريبي.
البرمجيات لا تقل أهمية.
التحسينات في:
- كفاءة النواة
- درجة التوازي
- توجيه الخبراء
- إدارة الذاكرة
- الاتصالات
- حفظ نقاط التفتيش
- التكميم
- تحميل البيانات
يمكن أن تغير بشكل كبير العلاقة بين الحجم الإجمالي للنموذج وتكلفة التدريب.
لذلك، "النموذج X يتطلب بالضبط Y وحدة GPU" يجب دائمًا اعتباره افتراضًا سيناريويًا وليس قاعدة ثابتة.
لماذا قد تحتاج ByteDance إلى نموذج بهذا الحجم
يؤطر المصدر الخطة بشكل أساسي كمحاولة لدفع مستوى ذكاء Doubao نحو الحدود العالمية.
هذا على الأرجح مجرد جزء من الدافع.
قد تدعم النماذج الأساسية الأكبر أجزاء متعددة من نظام ByteDance البيئي للذكاء الاصطناعي.
Doubao
Doubao هو أحد منتجات الذكاء الاصطناعي الاستهلاكية الرئيسية لـ ByteDance في السوق الصينية.
يمكن لنموذج أساسي أقوى أن يحسّن:
- الاستدلال العام
- العمل المعرفي
- البرمجة
- البحث
- مهام السياق الطويل
- سلوك الوكلاء
- التفاعل متعدد الوسائط
أبحاث Seed
ستوفر النماذج فائقة الضخامة أيضًا لفريق Seed منصة بحثية جديدة لاستكشاف:
- قوانين التوسع
- البنى المتناثرة
- التعلم التعزيزي
- تدريب الوكلاء
- كفاءة النماذج
- الذاكرة
- الاستدلال طويل المدى
Volcano Engine
يمكن لـ ByteDance أيضًا تسويق قدرات النماذج من خلال خدمات المؤسسات والخدمات السحابية.
لذلك، تمتلك النماذج المتطورة قيمة محتملة تتجاوز روبوتات الدردشة الاستهلاكية.
النماذج الأكبر لا تزال بحاجة إلى تحقيق عائد اقتصادي
السؤال الأخير في مقال AIBase هو الأكثر أهمية.
هل يمكن لنموذج بتكلفة تدريب عالية جدًا أن يحقق عوائد مقابل ذلك؟
لا تتحمل المختبرات المتطورة تكلفة تدريب التشغيل النهائي فحسب.
يمكن أن يشمل إجمالي الإنفاق:
- وحدات معالجة الرسوميات
- مراكز البيانات
- الكهرباء
- الشبكات
- التخزين
- رواتب الباحثين
- إعداد البيانات
- التجارب الفاشلة
- التدريب اللاحق
- الاستدلال
- الأعمال المتعلقة بالسلامة
- تكامل المنتجات
بعد ذلك، يجب على النموذج خلق قيمة من خلال مزيج من:
- الاشتراكات الاستهلاكية
- الإعلانات
- التجارة الإلكترونية
- واجهات برمجة تطبيقات المؤسسات
- الخدمات السحابية
- منتجات أدوات الكفاءة
- أدوات البرمجة
- الوكلاء
- تحسين الكفاءة الداخلية
حجم المعلمات لا يكون منطقيًا اقتصاديًا إلا عندما يتحول إلى قدرات مفيدة بتكلفة استدلال مقبولة.
لهذا السبب تؤكد النماذج المتطورة الحالية بشكل متزايد على كفاءة التوسع، وليس فقط إجمالي عدد المعلمات.
على سبيل المثال، يبلغ إجمالي معلمات Kimi K3 2.8 تريليون، لكنه ينشط 104 مليار معلمة فقط لكل رمز. تقول Moonshot AI إن بنيتها حققت تحسنًا في كفاءة التوسع مقارنة بالجيل السابق.
لذلك، المنافسة الحقيقية ليست:
من لديه أكبر عدد من المعلمات؟
بل أقرب إلى:
من يستطيع تحويل أقل الموارد إلى أقوى القدرات؟
إلى الذكاء الأكثر فائدة بتكلفة تدريب واستدلال مستدامة؟
ما هو مؤكد وما لا يزال مجرد تقارير
مؤكد
- وفقًا لمعلومات من Moonshot AI، يبلغ إجمالي معلمات Kimi K3 2.8 تريليون.
- وفقًا لتقارير Alibaba ورويترز، يبلغ إجمالي معلمات Qwen3.8-Max 2.4 تريليون.
- يعمل فريق Seed في ByteDance على التدريب المسبق واسع النطاق والتدريب اللاحق والاستدلال والبنية التحتية للنماذج.
- Doubao هو منتج الذكاء الاصطناعي الموجه للمستهلكين من ByteDance.
- صُممت NVIDIA H100 خصيصًا لتدريب المحولات واسعة النطاق وأحمال عمل الذكاء الاصطناعي بحجم تريليونات المعلمات.
تم الإبلاغ عنه ولكن لم تؤكده ByteDance رسميًا
- تقوم ByteDance ببناء نموذج يتجاوز 5 تريليونات معلمة.
- الهدف النهائي قد يصل إلى 10 تريليونات معلمة.
- الحجم الدقيق لمجموعة التدريب.
- إجمالي القوة الحاسوبية المكافئة لـ H100 المطلوبة.
- تاريخ الإصدار النهائي.
- ما إذا كان النموذج سيُطلق للجمهور في النهاية.
- بنية النموذج وعدد المعلمات النشطة.
لا يمكن التحقق منه من مواصفات النماذج المتاحة علنًا
- نموذج بـ 5 تريليونات معلمة ينتمي تلقائيًا إلى "مستوى GPT-5.6".
- التنبؤ بمستوى ذكاء النموذج بناءً على عدد المعلمات فقط.
- العدد الدقيق لمعلمات نماذج مستوى GPT-5.6 أو Fable/Mythos من Anthropic.
- المخزون الدقيق الحالي من وحدات معالجة الرسوميات لدى OpenAI أو Anthropic.
الأسئلة الشائعة
هل تقوم ByteDance حقًا بتدريب نموذج بـ 5 تريليونات معلمة؟
ذكر AIBase نقلاً عن LatePost أن ByteDance تناقش نموذجًا يتجاوز 5 تريليونات معلمة. وفي وقت لاحق من نفس اليوم، ذكرت رويترز نقلاً عن Financial Times أن ByteDance تقوم بالفعل بالتدريب المسبق لنموذج قد يصل إلى 10 تريليونات معلمة. لم تؤكد ByteDance علنًا الرقم الدقيق.
هل سيدعم هذا النموذج Doubao؟
توقع المصدر أن يعزز النموذج نظام Doubao البيئي في ByteDance، لكن ByteDance لم تعلن رسميًا بعد عن كيفية نشر النموذج المذكور في التقرير. قد تدعم النماذج المتطورة أيضًا واجهات برمجة تطبيقات المؤسسات والوكلاء والأبحاث ومنتجات ByteDance الأخرى.
هل نموذج بـ 5 تريليونات معلمة أفضل بالضرورة من Kimi K3 أو Qwen3.8-Max؟
ليس بالضرورة. لا يحدد إجمالي عدد المعلمات جودة النموذج بشكل مباشر. البنية والمعلمات النشطة وبيانات التدريب والتدريب اللاحق والتعلم التعزيزي والتفكير أثناء الاستدلال واستخدام الأدوات قد تكون جميعها بنفس الأهمية.
كم عدد معلمات Kimi K3؟
أعلنت Moonshot AI رسميًا أن إجمالي معلمات Kimi K3 يبلغ 2.8 تريليون، مع 104 مليار معلمة نشطة. يستخدم بنية خليط الخبراء المتناثر (MoE).
كم عدد معلمات Qwen3.8-Max؟
وفقًا لتقارير Alibaba ورويترز، يبلغ إجمالي معلمات Qwen3.8-Max من Alibaba 2.4 تريليون. كما يعتمد على تصميم نموذج متناثر بدلاً من تفعيل جميع المعلمات لكل رمز.
كم عدد وحدات H100 المطلوبة لتدريب نموذج بـ 5 تريليونات معلمة؟
قدم المصدر سيناريو تقريبيًا يعادل حوالي 35 مليون وحدة H100 GPU·يوم، على سبيل المثال 100 ألف وحدة H100 تعمل لمدة 347 يومًا، أو مليون وحدة H100 تعمل لحوالي 35 يومًا. قد تختلف الاحتياجات الفعلية بشكل كبير اعتمادًا على البنية والدقة وكفاءة الاستغلال وعدد الرموز والأجهزة وكفاءة التدريب.
هل يحتوي GPT-5.6 على 5 تريليونات معلمة؟
لم تكشف OpenAI علنًا عن عدد معلمات GPT-5.6. أي ادعاء حول معلمات GPT-5.6
المقارنة العددية المباشرة مع أحد النماذج
وفقًا للتقارير، لا يزال نموذج بايت دانس أحد التكهنات في الوقت الحالي.
متى قد تصدر بايت دانس هذا النموذج؟
لم يتم الإعلان عن تاريخ إصدار رسمي حتى الآن. ذكرت رويترز استنادًا إلى تقرير صحيفة فاينانشال تايمز البريطانية أن النموذج في مرحلة ما قبل التدريب، وهي مرحلة قد تستغرق عدة أشهر قبل أن يتمكن من الانتقال إلى مراحل الضبط الدقيق والتقييم والنشر.
الأدوات ذات الصلة
- ByteDance Seed: المركز الرسمي لأبحاث بايت دانس ومركز النماذج الأساسية وأنظمة الوسائط المتعددة وأبحاث الذكاء الاصطناعي.
- ByteDance Seed LLM: النظرة الرسمية لبايت دانس حول ما قبل التدريب وما بعد التدريب والاستدلال والذاكرة والتعلم وأبحاث النماذج الأساسية.
- دوباو: المساعد الذكي الاستهلاكي لبايت دانس، وأحد المنتجات الرئيسية التي قد تستفيد من نماذج أساسية أقوى.
- Kimi: المنصة الرسمية لمنتجات Moon's Dark Side ومدخل الوصول إلى سلسلة نماذج Kimi.
- تونغيتشيوان: البوابة الرسمية لنماذج Qwen ومنتجاتها لدى علي بابا.
- NVIDIA H100: مواصفات مسرع H100 ومعلومات أداء التدريب المقدمة رسميًا من NVIDIA.
الروابط ذات الصلة
- رويترز: بايت دانس تستهدف نموذج ذكاء اصطناعي ضخم: تقرير لاحق في نفس اليوم أفاد بأن حجم النموذج قد يصل إلى 10 تريليونات معامل.
- نماذج ByteDance Seed: الكتالوج الرسمي لفريق ByteDance Seed واتجاهات البحث.
- البنية التحتية لـ ByteDance Seed: النظرة الرسمية لبايت دانس حول التدريب الموزع والاستدلال وأعمال البنية التحتية لأنظمة الذكاء الاصطناعي.
- المدونة التقنية لـ Kimi K3: الشرح الرسمي من Moon's Dark Side لمعمارية Kimi K3 بمعاملات 2.8T ومعاملات تفعيل 104B.
- مستودع Kimi K3 على GitHub: المستودع الرسمي لنموذج Kimi K3 والمواصفات التقنية.
- الموقع الرسمي لتونغيتشيوان: البوابة الرسمية لنماذج علي بابا ومدخل API.
- NVIDIA H100 GPU: المواصفات الرسمية لـ H100 ومعلومات تدريب النماذج الكبيرة.
الملخص
وفقًا للتقارير، تستعد بايت دانس لإعداد نموذج أساسي فائق الضخامة يتجاوز حجمه النماذج الصينية المعلن عنها حاليًا. وصفت AIBase وديانديان LatePost المشروع في البداية بأنه يتجاوز 5 تريليونات معامل، بينما ذكرت تقارير لاحقة من رويترز/فاينانشال تايمز في نفس اليوم أن النموذج قد يصل إلى 10 تريليونات معامل، وأنه في مرحلة ما قبل التدريب بالفعل.
مشروع بهذا الحجم سيتطلب موارد حوسبة هائلة. قدرة الحوسبة التي ذكرتها المصادر مثل H100 تعادل تقريبًا 35 مليون يوم GPU، لكن متطلبات التدريب الفعلية تعتمد على المعمارية ومعاملات التفعيل وجيل الأجهزة ومعدل الاستخدام وكفاءة التدريب.
السؤال الأكبر ليس ما إذا كان بإمكان بايت دانس بناء أكبر نموذج. إجمالي المعاملات مقياس غير مكتمل للذكاء، خاصة بالنسبة لأنظمة الخبراء المختلطين المتفرقين.
الاختبار الحقيقي يكمن في
ما إذا كانت بايت دانس قادرة على تحويل هذا القدر الهائل من الحوسبة إلى نموذج يتفوق بشكل ملحوظ في الأداء، وتكون كفاءته كافية لدعم الخدمات، وتكون قيمته مبررة للبنية التحتية التي تقف خلفه.