هل كسر الذكاء الاصطناعي خندق NVIDIA's CUDA؟ ما الذي بنته Infinity في 10 ساعات
أُعلن مرارًا وتكرارًا عن زوال خندق CUDA الخاص بـ NVIDIA حتى أصبح هذا القول شبه طقس صناعي. يظهر مسرّع جديد. يدخل مُصرّف مرحلة الاختبار التجريبي. مزوّد سحابي...

هل كسر الذكاء الاصطناعي خندق كودا الخاص بـ NVIDIA؟ ما الذي بنته Infinity بالفعل في 10 ساعات
مقدمة
إعلان نهاية خندق كودا الخاص بـ NVIDIA أصبح شبه طقس احتفالي تتكرر مراسمه في الصناعة.
يظهر مسرّع جديد. يدخل مُصرّف مرحلة الاختبار العام. تروّج إحدى شركات الخدمات السحابية لشريحة الذكاء الاصطناعي الخاصة بها. يعد تجريد برمجي بنقل النواة (Kernels) بين المنصات. يعلن أحدهم أن المطورين لم يعودوا بحاجة لكتابة كودا يدويًا.
ومع ذلك، لا تزال كودا تحتل موقعًا محوريًا في البنية التحتية للذكاء الاصطناعي من الجيل التالي.
التحدي الأحدث أكثر إثارة للاهتمام لأنه يأتي من الذكاء الاصطناعي نفسه.
شركة Infinity، وهي شركة ناشئة للبنية التحتية للذكاء الاصطناعي أسسها الباحث السابق في Google Brain جيريمي نيكسون، تدّعي أن وكيلها Ignition نقل مكونات حاسمة من حزمة برمجيات الاستدلال إلى مسرّع d-Matrix Corsair غير المألوف، بسرعة تفوق بكثير عمليات الهندسة التقليدية.
النتيجة الأكثر لفتًا للانتباه: في حوالي 10 ساعات، حقق Ignition ضرب المصفوفات المتوازي عبر جميع وحدات الحوسبة الـ 32، ووصل إلى 92% من الحد الأقصى المحسوب عمليًا للشريحة.
هذه نتيجة ذات دلالة. لكنها لا تعني إعادة بناء كودا في 10 ساعات.
تشير دراسة حالة Infinity نفسها إلى أن مسار استدلال Qwen3 الكامل من البداية إلى النهاية استغرق حوالي 10 أيام، حيث أُعيدت كتابة كل عملية مطلوبة للأجهزة الجديدة. وكودا ليست مجرد تنفيذ لضرب المصفوفات أو بيئة تشغيل لنموذج. إنها منصة ناضجة تتضمن مُصرّفات وبيئات تشغيل ومكتبات وأدوات تحليل أداء وتصحيح أخطاء وأنظمة اتصالات وتكاملًا مع الأطر البرمجية وتوثيقًا وما يقرب من عقدين من الخبرة الإنتاجية.
السؤال الأفضل ليس ما إذا كان الذكاء الاصطناعي قد نسخ كودا بين ليلة وضحاها.
بل هل تستطيع الوكلاء البرمجية تقليص الوقت اللازم لجعل شريحة ذكاء اصطناعي جديدة مفيدة بشكل جذري؟
الإجابة تميل بشكل متزايد نحو "نعم".

خندق كودا لم يكن أبدًا مجرد وحدات معالجة رسومية
الأكثر شهرة لدى NVIDIA هو العتاد: H100 وBlackwell وRubin والأنظمة الضخمة المبنية حولها.
لكن ميزتها الأكثر ديمومة هي البرمجيات المبنية حول العتاد.
كودا تعني بنية الأجهزة الموحدة للحوسبة. تصفها NVIDIA بأنها منصة حوسبة متسارعة، وليست مجرد لغة برمجة.
منصة كودا تشمل:
- نموذج برمجة وحدات معالجة الرسوميات.
- سلسلة أدوات المُصرّف.
- مكتبات بيئة التشغيل.
- واجهات برامج التشغيل.
- مكتبات رياضية ومكتبات ذكاء اصطناعي عالية التحسين.
- أدوات تصحيح الأخطاء وتحليل الأداء.
- برمجيات اتصالات متعددة وحدات المعالجة الرسومية.
- تكامل مع الأطر البرمجية.
- توثيق وتدريب وأمثلة برمجية.
- نظام بيئي ضخم من المطورين والشركاء.
في القاع، تتيح كودا للمهندسين كتابة نواة تنفذ مباشرة على وحدات معالجة الرسوميات من NVIDIA.
وفوقها توجد مكتبات مثل cuBLAS وcuDNN وcuFFT وNCCL وTensorRT وTensorRT-LLM. وفوق المكتبات توجد PyTorch وTensorFlow وJAX وخوادم الاستدلال والأكواد البحثية والأنظمة الداخلية للشركات.
يظهر عرض مبسّط على النحو التالي:
التطبيقات وأطر الذكاء الاصطناعي
↓
المكتبات المحسّنة والأنظمة الموزعة
↓
المُصرّفات وبيئات التشغيل ومحللات الأداء والمُصححات والنواة
↓
وحدات معالجة الرسوميات من NVIDIA وتقنيات الربط
الشركات لا تبقى في نظام NVIDIA البيئي فقط لأنها معتادة على صيغة كودا، بل لأن النماذج والاختبارات وأنظمة النشر وتوقعات الأداء وسير عمل التصحيح وفرق الإنتاج كلها تعتمد على الحزمة البرمجية بأكملها.
تغيير العتاد قد يعني أكثر بكثير من مجرد ترجمة الكود المصدري، بل قد يتطلب إعادة بناء الثقة.
ما الذي فعلته Infinity فعليًا في 10 ساعات
دراسة حالة Infinity الرسمية أكثر دقة من العناوين المنتشرة على نطاق واسع.
تعاونت الشركة مع d-Matrix، وهي شركة ناشئة متخصصة في عتاد استدلال الذكاء الاصطناعي التوليدي. يعتمد مسرّع Corsair على بنية ومجموعة تعليمات مختلفة عن وحدات معالجة الرسوميات من NVIDIA. تقول Infinity إن الشريحة لم يكن لديها تقريبًا أي سجل برمجي عام يمكن لنماذج البرمجة العامة إعادة إنتاجه مباشرة من بيانات التدريب.
حصل Ignition على معلومات العتاد وبدأ في توليد البرمجيات منخفضة المستوى اللازمة لتشغيل أعباء عمل الذكاء الاصطناعي.
وفقًا لشركة Infinity، خلال حوالي 10 ساعات، حقق النظام:
- ضرب مصفوفات متوازي عبر جميع وحدات حوسبة Corsair الـ 32.
- وصولًا إلى 92% من أداء "سرعة الضوء".
- تعرّف Infinity "سرعة الضوء" على أنها نسبة ذروة الحوسبة القابلة للتحقيق للشريحة التي يحققها النواة المُولّد. والسقف التجريبي المنشور في دراسة الحالة نفسها يبلغ حوالي 90% من الذروة النظرية.
هذه نتيجة ممتازة للانطلاق السريع للنواة، لكنها ليست منصة مكافئة لكودا بشكل كامل.
عشر ساعات: ضرب مصفوفات عالي الأداء
ضرب المصفوفات هو جوهر استدلال المحولات (Transformers)، لكنه واحد فقط من فئة العمليات.
النموذج الكامل يتطلب أيضًا آليات الانتباه والتطبيع ودوال التنشيط والتوجيه والكمية وإدارة ذاكرة التخزين المؤقت للـ KV وأخذ العينات ونقل المصفوفات ومعالجة الحالات وخدمة النماذج وغيرها من الأعمال الإضافية.
عشرة أيام: استدلال نموذج شامل من البداية إلى النهاية
تقول Infinity إنه خلال حوالي 10 أيام، كان Qwen3 يعمل على Corsair من البداية إلى النهاية. وأعلن إعلانها التمويلي اللاحق أن ثلاثة نماذج رائدة أصبحت تعمل من البداية إلى النهاية خلال تلك الفترة الزمنية، مع كتابة النواة من الصفر.
هذا الجدول الزمني الأطول لا يزال مثيرًا للإعجاب.
الانتقال بمسرّع غير مألوف من العمليات الأساسية إلى بيئة تشغيل نموذج عاملة، من أشهر إلى أيام، قد يغيّر جذريًا الاقتصاديات الكامنة وراء طرح عتاد جديد.
| الادعاء | التفسير الأكثر دقة |
|---|---|
| "الذكاء الاصطناعي أعاد بناء كودا في 10 ساعات" | مبالغة |
| ضرب المصفوفات يعمل في 10 ساعات | ما ذكرته Infinity |
| الأداء يصل إلى 92% من السقف التجريبي | ما ذكرته Infinity |
| Qwen3 يعمل من البداية إلى النهاية في حوالي 10 أيام | ما ذكرته Infinity |
| Infinity تبني مكتبة استدلال عامة | أكدت Infinity ذلك |
| تمت إعادة إنتاج نظام كودا البيئي بالكامل | لا |
Ignition هو وكيل هندسة نواة واستدلال آلي
تصف Infinity Ignition بأنه وكيل أبحاث للذكاء الاصطناعي.
هدفه هو توليد وتحسين البرمجيات منخفضة المستوى، وتحويل عمليات النموذج إلى عمل فعال على شريحة محددة.
تشبه هذه الدورة عملية هندسة أداء آلية:
توليد الكود
→ الترجم
→ التشغيل على العتاد
→ اختبار الصحة
→ قياس الأداء
→ تشخيص الاختناقات
→ تعديل التنفيذ
→ التكرار

لا يزال المهندسون البشريون يقدمون الأهداف ومعلومات الأجهزة والقيود ومعايير القبول والتوجيه عالي المستوى. بينما تقوم Ignition بتنفيذ قدر كبير من أعمال البحث والتحسين المتكررة.
هذا النوع من المهام مناسب للغاية للوكلاء، لأن البيئة تولّد تغذية راجعة واضحة بشكل استثنائي.
يمكن تقييم النوى المولّدة وفقًا لمشكلات محددة:
- هل يمكن تجميعها؟
- هل يمكن تشغيلها؟
- هل المخرجات الرقمية صحيحة؟
- هل هي مستقرة؟
- ما مقدار أداء الأجهزة الذي تم تحقيقه؟
- هل أدى التغيير الأحدث إلى تحسين النتائج؟
توفر الأجهزة والاختبارات أساسًا موضوعيًا للحقائق.
لماذا تُعد هندسة النوى مشكلة مثالية للوكلاء
تتسم معايير القبول في العديد من مهام البرمجيات بالغموض. أما تحسين النوى، ورغم صعوبته، فإن جزءًا من مراحله قابل للقياس الكمي.
يجب أن يستوفي التنفيذ الفعّال معيارين مستقلين.
الصحة
يجب أن تُنتج النواة مخرجات ضمن نطاق تفاوت عددي مقبول.
الأداء
يجب أن تستخدم النواة الأجهزة المستهدفة بكفاءة كافية لتبرير استبدال التنفيذ الحالي.
يمكن للوكيل توليد مئات المرشحين، ورفض المرشحين غير الصحيحين، وقياس أداء المرشحين الباقين، وتحسين المسار الأقوى باستمرار.
يظهر النمط نفسه في وكيل NVIDIA المتخصص في CUDA، ومصنع PTX Kernel Factory من INT21، وعمل TileKernels من DeepSeek، والأنظمة البحثية التي تولّد نوى Triton أو TileLang.
التغيير الأخير هو أن النماذج الأساسية يمكنها الآن المشاركة في حلقة أكثر اكتمالًا، بدلًا من مجرد سدّ أسطر قليلة من الكود النحوي.
Infinity تجمع 15 مليون دولار بتقييم 100 مليون دولار
جذبت القصة التقنية لشركة Infinity المستثمرين.
أعلنت الشركة في يوليو 2026 عن إتمام جولة تمويل أولي بقيمة 15 مليون دولار، بتقييم بعد الاستثمار يبلغ 100 مليون دولار وفق التقارير. شاركت كل من Touring Capital وPrincipal Venture Partners في الاستثمار، بالإضافة إلى مسؤولين تنفيذيين في صناعة الرقائق وباحثين مرتبطين بمختبرات الذكاء الاصطناعي الرئيسية.

تبني Infinity طبقة برمجيات استدلال مدركة للنموذج لموردي الأجهزة ومقدمي خدمات الاستدلال. سير العمل المحدد لديها هو في الواقع:
مواصفات الأجهزة
← توليد برمجيات استدلال بمستوى إنتاجي
كما يُقال إن Infinity قد ولّدت محرك استدلال NVIDIA من الصفر، محققًا أداءً أعلى بنسبة تصل إلى 34.3% من تنفيذ vLLM المطابق للإعدادات على نموذج Qwen3-8B.
يتم الإبلاغ عن هذه النتيجة ذاتيًا من قبل الشركة، وتعتمد على الأجهزة وإعدادات الدفعات وتكوين النموذج وطرق القياس. ومع ذلك، يشير هذا إلى أن طموح Infinity يتجاوز بكثير مجرد تشغيل الرقائق الأساسية.
نوى TileKernels من DeepSeek تتطلب الدقة نفسها
ذُكر أيضًا في النص الأصلي مستودع TileKernels الخاص بشركة DeepSeek.
TileKernels هي مكتبة نوى GPU محسّنة مكتوبة باستخدام TileLang، وهي لغة مجال متخصصة مبنية على Python لتطوير النوى عالية الأداء.
يحتوي المستودع على العمليات التالية:
- بوابة الخبراء المختلطين (MoE).
- توجيه MoE.
- التكميم FP8 وFP4.
- التحويل (التبديل).
- بوابة Engram.
- الاتصال الفائق المتعدد (Manifold HyperConnection).
- غلاف الاشتقاق التلقائي لـ PyTorch.
تشير DeepSeek إلى أن العديد من النوى قد اقتربت من حدود الأجهزة من حيث كثافة الحوسبة أو عرض النطاق الترددي للذاكرة، وأن بعض النوى تُستخدم داخليًا بالفعل.
يقلل TileLang من كمية كود CUDA C++ منخفض المستوى التي يجب على المهندسين كتابتها يدويًا.
بشكله الحالي، لا يشير هذا إلى أن DeepSeek قد ألغت اعتمادها على حزمة تقنيات NVIDIA.
تشمل المتطلبات الحالية الرسمية لـ TileKernels:
NVIDIA SM90 أو SM100 GPU
CUDA Toolkit 13.1 أو إصدار أحدث
PyTorch 2.10 أو إصدار أحدث
TileLang 0.1.9 أو إصدار أحدث
المكتبة الحالية مصممة لأحدث بنى NVIDIA. إنها تقلل الاعتماد على كتابة كود مصدر CUDA يدويًا، لكنها لا تقلل الاعتماد على أجهزة NVIDIA أو حزمة أدوات CUDA.
نطاق TileLang أوسع من مكتبة DeepSeek الحالية
لدى TileLang نفسه طموحات أوسع.
يصف المشروع نموذج برمجة مقسمًا إلى بلاطات (tiled) لوحدات المعالجة الرسومية ووحدات المعالجة المركزية ومسرعات النوى، باستخدام بنية أسلوب Python ومبنيًا على البنية التحتية لمترجم TVM.
الهدف هو فصل تدفق البيانات الذي يريده المهندس عن الجدولة منخفضة المستوى اللازمة للتنفيذ الفعّال.
يواصل TileLang إضافة دعم للغات متعددة الخلفيات ومسارات أجهزة تتضمن CUDA وROCm وMetal.
يمكن لهذه القابلية للنقل أن تخفض تكاليف التبديل بين الموردين، بشرط أن تكون النتائج المولّدة صحيحة ومستقرة وقابلة للتصحيح ومنافسة مقارنة بمكتبات الموردين.
النواة التي تعمل في كل مكان ولكن بأداء ضعيف لا يمكنها أن تحل محل مسار CUDA في بيئات الإنتاج.
الكود الصحيح قد يكون أبطأ بمئات المرات
بحثت ورقة بحثية في يوليو 2026 في الفجوة بين صحة النوى وجودة البدائل في Triton وTileLang.
وجد المؤلفون أن النوى يمكن أن تجتاز اختبارات الصحة العددية ولكن أداءها أقل بكثير من خط الأساس المحسّن. وفق التقارير، كان تنفيذ LayerNorm في TileLang أبطأ بأكثر من 300 مرة من خط الأساس PyTorch، على الرغم من اجتيازه فحوصات الصحة.
لا تعارض الورقة TileLang نفسه، بل تدعو إلى تقييم النوى المولّدة من بُعدين:
الصحة
+
كفاءة الأجهزة
أصبح توليد الكود أسرع باستمرار. لكن إثبات أن الكود المولّد كافٍ لاستبدال برمجيات الإنتاج الناضجة لا يزال صعبًا.
الاستدلال هو ساحة المعركة الأولى
يشكل التحدي الموجه إلى CUDA مصداقية أكبر في مجال الاستدلال مقارنة بمجال تدريب النماذج المتطورة.
التدريب يولي الأولوية للحجم الأقصى والاستقرار
قد تتضمن عمليات التدريب واسعة النطاق آلافًا أو عشرات الآلاف من
المسرعات التي تعمل معًا لأسابيع أو أشهر.
يجب أن تتعامل منصات التدريب مع الاتصالات الموزعة عبر أعداد كبيرة من الأجهزة، ونقاط التفتيش، واستعادة الأعطال، وإدارة الذاكرة، والتوازي، وقابلية إعادة الإنتاج، والتصحيح.
قد يؤدي عطل واحد في الأجهزة أو البرمجيات إلى إهدار قدر كبير من القدرة الحاسوبية. لذلك، غالبًا ما تكون المؤسسات حذرة للغاية عند نقل أعباء التدريب المهمة من الأنظمة الناضجة.
تمنح CUDA ومكتبات CUDA-X وNCCL ودعم PyTorch وقدرات الشبكات المتكاملة من NVIDIA الشركة موقعًا قويًا في هذا المجال.
الاستدلال يولي الأولوية لتكلفة كل إجابة مفيدة
الاستدلال هو مرحلة تقديم الخدمة بعد اكتمال تدريب النموذج.
غالبًا ما تكون مؤشرات الأعمال ذات الصلة أقرب إلى:
جودة المخرجات المقبولة
÷
التكلفة الإجمالية للخدمة
يمكن توزيع الاستدلال على مسرع واحد أو مجموعات صغيرة أو أساطيل واسعة النطاق أو أجهزة مخصصة.
لا تحتاج الرقائق الجديدة إلى استبدال NVIDIA في جميع السيناريوهات. قد تحتاج فقط إلى إثبات أنها تقدم ميزة لنموذج أو حمل معين من حيث التكلفة الأقل أو السرعة الأعلى أو استهلاك الطاقة الأقل أو الإنتاجية الأعلى أو زمن الاستجابة الأكثر قابلية للتنبؤ.
هذا الهدف الأضيق يوفر نقطة دخول واقعية للأجهزة المتخصصة.
d-Matrix مبنية حول استدلال الذكاء الاصطناعي التوليدي
تأسست d-Matrix في عام 2019، وتركز على تسريع الاستدلال. تستخدم منصتها Corsair كميات كبيرة من SRAM على الشريحة، وتهدف إلى تقليل تكلفة تشغيل النماذج التوليدية واستهلاكها للطاقة.

عمل Infinity يحل واحدة من المشاكل الكلاسيكية التي تواجه المسرعات الجديدة.
قد تمتلك الشريحة عتادًا واعدًا، لكن قبل أن تصبح النواة، وتنفيذ النموذج، ومعالجة الذاكرة، والقياس الكمي، ومنطق الخدمة، ومخطط التكامل جاهزة، لا يمكن للعملاء استخدامها بكفاءة.
إذا تمكن الوكلاء الأذكياء من ضغط عملية التشغيل هذه من أشهر إلى أيام، فلن تتمكن الشركات الناشئة في مجال العتاد من تقديم الدعم بالقرب من إصدار النماذج فحسب، بل وستعرض قدرات العتاد في وقت أبكر.
هذا يضعف جزءًا من ميزة برمجيات NVIDIA، لكنه لا يلغيها بالكامل.
جهات أخرى تستهدف نفس الثغرة
سوق الاستدلال يضم عدة منافسين:
| الشركة أو المنصة | التموضع العام |
|---|---|
| Rebellions | مسرعات وأنظمة استدلال ذكاء اصطناعي مخصصة |
| Cerebras | أنظمة بمقياس الرقاقة الكاملة للتدريب والاستدلال |
| AWS Inferentia | شريحة استدلال من تصميم أمازون، تستخدم Neuron SDK |
| Google TPU | مسرعات جوجل مدعومة عبر XLA والأطر الرئيسية |
| AMD Instinct | وحدات معالجة رسومية لمراكز البيانات تستخدم منصة ROCm |
| d-Matrix | تسريع استدلال ذكاء اصطناعي توليدي يعتمد على SRAM |
| NVIDIA | وحدات معالجة رسومية وحزمة حوسبة معجلة عبر CUDA |
الضغط يأتي من طبقات البرمجيات التي تسمح للمستخدمين بنشر النماذج دون إعادة كتابة كل عملية يدويًا، بما في ذلك AWS Neuron وGoogle XLA وAMD ROCm وModular MAX وMojo وTileLang وTriton وأنظمة توليد النوى بالذكاء الاصطناعي.
كلما زادت أتمتة هذه الطبقات البرمجية، قلّ التدخل اليدوي المطلوب من مطوري التطبيقات.
محتوى مباشر حول CUDA.
البرمجيات عبر الشرائح يمكن أن تقلل تأثير القفل
تأثير قفل CUDA يكون أقوى عندما تكون التطبيقات ونواتها المحسّنة مرتبطة بشدة بعتاد NVIDIA.
طبقة استدلال قابلة للنقل تهدف إلى تحقيق سير العمل التالي:
نموذج
→ طبقة تنفيذ قابلة للنقل
→ توليد أو اختيار نواة العتاد
→ المسرع المستهدف
العالم الحقيقي أكثر تعقيدًا، لأن الشرائح المختلفة تمتلك هياكل ذاكرة مختلفة، وتنسيقات رقمية، وطرق ترابط، وسلوكيات جدولة، وعمليات مدعومة.
الأداء العالي غالبًا ما يظل يتطلب عملًا مخصصًا لعتاد معين.
الفكرة الأساسية لـ Infinity هي أن الوكلاء الأذكياء يمكنهم توليد هذا العمل التخصصي تلقائيًا.
خندق CUDA ليس مجرد الكود الحالي
نتائج 10 ساعات لا يمكنها نسخ الأصول التي تجعل استبدال CUDA أمرًا صعبًا.
تشمل هذه الأصول:
المكتبات الناضجة
تستخدم العديد من المؤسسات مكتبات الموردين بدلاً من كتابة النوى مباشرة. cuBLAS وcuDNN وTensorRT وNCCL وغيرها تحمل سنوات من الخبرة في التحسين.
أدوات التصحيح والتحليل
تساعد NVIDIA Nsight والأدوات المرتبطة بها المهندسين على فهم الصحة، وسلوك الذاكرة، والخطوط الزمنية، والاتصالات، والأداء.
دعم الأطر
عادةً ما يتم دمج ميزات النماذج الجديدة وتحسينها مبكرًا لعتاد NVIDIA.
المعرفة بالنشر
فرق الإنتاج تعرف كيف تتصرف أنظمة NVIDIA تحت الحمل.
التوثيق والتدريب
يتضمن النظام البيئي أمثلة، ودورات، ومحاضرات مؤتمرات، وإجابات مجتمعية، وموارد خبراء.
الاستثمارات القائمة
تمتلك الشركات ملايين الأسطر من الكود، والاختبارات، وعمليات الشراء، ومهارات الموظفين المرتبطة بالمنصة.
قد يقلل الذكاء الاصطناعي من تكلفة الترجمة، لكنه لا يلغي تلقائيًا تكاليف التحول على المستوى التنظيمي.
التحقق قد يصبح خندق CUDA التالي
يعتقد Bing Xu، مؤسس INT21 والمؤسس السابق لـ HippoML التي استحوذت عليها NVIDIA، أن التحقق هو العائق الرئيسي.

يمكن للوكلاء الأذكياء توليد الكود بسرعة. لكن فرق الإنتاج ما زالت بحاجة إلى دليل على أنه:
- ينتج مخرجات رقمية صحيحة.
- يعمل مع مختلف الأشكال وأنواع البيانات.
- يتعامل مع الحالات الحدية.
- لا يكسر الذاكرة.
- يظل مستقرًا تحت التوافقية.
- يقدم أداءً جيدًا عبر مختلف أعباء العمل.
- يتحمل تغييرات برامج التشغيل والعتاد.
- يتفاعل بشكل صحيح مع بقية حزمة البرمجيات.
تمتلك NVIDIA بالفعل كميات كبيرة من اختبارات الامتثال، واختبارات الأداء، والتطبيقات المرجعية، والمحاكيات، ومحللات الأداء، وتشخيصات المترجم، وأعباء عمل الإنتاج، وبيانات الأخطاء التاريخية.
هذه الأصول تجعل الوكلاء الأذكياء أكثر فائدة.
لذلك، قد ينقل الذكاء الاصطناعي الخندق من توليد الكود إلى جودة بيئة التحقق.
NVIDIA تبني وكيل CUDA الخاص بها
التقنيات التي تتحدى CUDA تنطبق على NVIDIA نفسها.
نقل Business Insider عن Ankit Patel، نائب رئيس النظام البيئي للمطورين في NVIDIA، أن الشركة تستخدم وكلاء ترميز بالذكاء الاصطناعي لتطوير CUDA بشكل أسرع وإجراء تحقق على نطاق أوسع.
NVIDIA لديها بالفعل
كما اقترحت استراتيجية ذكاء CUDA تجمع بين المعرفة الحالية بـ CUDA، والخبرة في التحسين، وتحميل الأداء السحابي، وأدوات Nsight، والمعايير، والخدمات القائمة على MCP.
تحتفظ NVIDIA بـ ComputeEval، وهو معيار مفتوح لكود CUDA وكود مكتبات الحوسبة الأساسية المولّد بالذكاء الاصطناعي.
يغطي هذا المعيار مهامًا تتضمن نوى Tensor، والذاكرة المشتركة، والبدائيات على مستوى الخيوط، ورسوم CUDA البيانية، والتدفقات، والأحداث.
لذلك، هذه السباق نسبي:
سرعة اللحاق ببرمجيات المنافسين
مقابل
سرعة تحسين برمجيات NVIDIA
Chris Lattner: الضجيج حقيقي لكنه مبالغ فيه
يقدم Chris Lattner، المؤسس المشارك والرئيس التنفيذي لشركة Modular، رأيًا أكثر تحفظًا.

يعتقد أن وكلاء الترميز يقدمون تحسينًا تدريجيًا، وليس تدميرًا فوريًا لميزة CUDA.
لخص المقال المصدر ثلاثة أسباب.
كتابة الكود ليست سوى جزء من الهندسة
تحسين بيئة الإنتاج هو ما يحدد الجدوى الاقتصادية للشريحة. النسب المئوية الأخيرة من الأداء قد تتطلب قدرًا كبيرًا من العمل المتخصص.
بيانات التدريب العامة لبرمجيات GPU أقل
كود التطبيقات متوفر بكثرة على الإنترنت.
هندسة النواة والمُجمّع المتطورة مجالٌ صغير نسبيًا، ولا يزال الكثير من أقوى الأعمال فيه خاصًا وغير معلن.
الأنظمة الحالية لا تزال بحاجة إلى النقل والتحويل
الجدوى التقنية وحدها لا تُلغي تكاليف الاعتماد، أو المخاطر التشغيلية، أو إعادة تدريب الموظفين، أو الالتزامات التعاقدية، أو متطلبات الموثوقية، أو تكاليف الفرصة البديلة.
هذه الملاحظات لا تعني أن هندسة النواة بالوكالة (Agentic Kernel Engineering) غير مهمة. إنما توضح لماذا لا يتحول العرض التوضيحي القوي فورًا إلى بديل حقيقي في السوق.
الخندق الواقي (Moat) يتحرك، ولا يختفي
القراءة الأقوى ليست "CUDA ماتت".
بل إن طبقة معينة من المزايا التاريخية لـ CUDA أصبحت أكثر قابلية للنسخ والتقليد.
الوكلاء (Agents)، واللغات الخاصة بالمجال (DSLs)، والمُجمّعات الآلية يمكنها تقليص الوقت اللازم لبناء النوى (Kernels)، وبيئات التشغيل (Runtimes)، ودعم النماذج للرقائق الجديدة.
الطبقة الأكثر تعرضًا للخطر هي التكيف السريع للاستدلال المبكر (Early Inference).
أما الطبقة الأكثر حماية فما تزال تشمل التدريب واسع النطاق، والمكتبات التوليدية الناضجة، والتحقق، وتصحيح الأخطاء، وتنسيق المجموعات (Cluster Orchestration)، وتكامل الأطر (Framework Integration)، وسير عمل العملاء الحاليين، والتحسين المستمر.
السؤال الاستراتيجي قد يتحول من:
من يملك أكبر قدر من أكواد النوى المكتوبة يدويًا؟
إلى:
من يملك أفضل حلقة مغلقة للتوليد الآلي، والقياس،
والتحقق، والتحسين؟
NVIDIA في موضع جيد لأنها تمتلك بالفعل العتاد، والأدوات، والمكتبات، وأعباء العمل، وبيانات التغذية الراجعة. أما المنافسون الجدد فيستفيدون من انخفاض حاجز الدخول بفضل الوكلاء.
كلا الأمرين يمكن أن يصحا في الوقت نفسه.
ما الذي تغيّره نتيجة "10 ساعات" حقًا
نتيجة شركة Infinity غيّرت التوقعات لدى الشركات الناشئة في مجال العتاد.
لم يعد على المُسرّعات الجديدة أن تفترض أن كل نواة مفيدة سيكتبها يدويًا فريق صغير من الخبراء.
الوكيل يمكنه القيام بما يلي:
- قراءة وصف البنية المعمارية.
- توليد النواة الأولية.
- تجميعها وتشغيلها.
- مقارنة المخرجات بالنتائج المرجعية.
- قياس مدى استغلال العتاد.
- البحث عن جداول تشغيل بديلة.
- الاحتفاظ بأفضل تنفيذ.
- التوسع من المشغّلات (Operators) إلى النموذج الكامل.
هذا يمكن أن يقصّر الفترة الزمنية بين أول تدفق للشريحة (First Silicon) وتحقيق استدلال نموذجي قابل للاستخدام.
هذا التقليص يمكّن موردي الرقائق من عرض عتادهم في وقت أبكر، ودعم النماذج الجديدة بسرعة أكبر، وتخفيف ضغط التوظيف في مجال البرمجيات، واختبار المزيد من الأفكار، والمنافسة في أسواق الاستدلال الأكثر تخصصًا.
هذه النتيجة لا تمحو CUDA، لكنها تجعل الخطوة الأولى نحو منافستها أقل رهبة.
ما يستحق المتابعة في الفترة القادمة
إعادة الإنتاج بشكل مستقل
النتائج التي أعلنتها Infinity جاءت من الشركة وشركائها في العتاد. المعايير الخارجية ستقدم دليلًا أقوى.
تغطية النماذج
طبقة الاستدلال العامة يجب أن تدعم بنى متعددة، وصيغًا متعددة (Modalities)، وتنسيقات تكميم (Quantization)، وأنماط خدمة متنوعة.
الموثوقية الإنتاجية
العرض التوضيحي الذي يعمل من البداية إلى النهاية شيء، والبرمجيات التي تعمل بشكل مستمر لأشهر تحت حركة مرور العملاء شيء آخر تمامًا.
حجم التحقق
السؤال الجوهري هو كيف يمكن للأنظمة الذكية أن تُثبت الصحة والأداء عبر مساحة اختبار ضخمة.
قابلية النقل
إذا كان التنفيذ الواحد يحقق نتائج ممتازة على NVIDIA وAMD وApple وغيرها من المُسرّعات، فإن TileLang وغيره من اللغات الخاصة بالمجال ستصبح أكثر أهمية من الناحية الاستراتيجية.
رد فعل NVIDIA
NVIDIA تعمل بنشاط على بناء الوكلاء، والمعايير، والذكاء الاصطناعي للمُجمّعات، وتجريدات CUDA الجديدة. الشركة المهيمنة الحالية ليست واقفة في مكانها.
الأسئلة الشائعة
هل أعاد وكلاء الذكاء الاصطناعي فعلاً تنفيذ CUDA خلال 10 ساعات؟
لا. أوضحت Infinity أن Ignition تولّى خلال 10 ساعات كتابة برمجيات ضرب المصفوفات المتوازي عبر المصفوفات (Tensor Parallel Matrix Multiplication) لرقاقة d-Matrix Corsair، ووصل إلى 92% من الحد الحسابي التجريبي للشريحة. أما استدلال نموذج Qwen3 من البداية إلى النهاية فاستغرق حوالي 10 أيام، ولم يُعد المشروع إنتاج النظام البيئي الكامل لـ CUDA.
ما هو Infinity Ignition؟
Ignition هو وكيل أبحاث وهندسة الذكاء الاصطناعي من Infinity، يُستخدم لتوليد واختبار وتصحيح وتحسين برمجيات الاستدلال منخفضة المستوى. يعتمد على التغذية الراجعة من العتاد الحقيقي لتحسين النوى وبيئات تشغيل النماذج بشكل تكاملي.
ما هي d-Matrix Corsair؟
Corsair هي منصة استدلال للذكاء الاصطناعي التوليدي من شركة d-Matrix. استخدمتها Infinity كمنصة هدفية للتوليد التلقائي لعمليات المتوازي عبر المصفوفات ومكدس استدلال النماذج الكامل.
هل ستحل DeepSeek TileKernels محل CUDA؟
لا. TileKernels تقلل من الحاجة إلى كتابة نوى CUDA منخفضة المستوى يدويًا باستخدام TileLang، لكن متطلباتها الحالية تشمل عتاد NVIDIA SM90 أو SM100 وCUDA Toolkit الإصدار 13.1 أو أحدث.
لماذا يكون الاستدلال أكثر استعدادًا لقبول بدائل CUDA من التدريب؟
الاستدلال يمكن أن يعمل على أنظمة أصغر، ويُقيَّم عادةً من حيث تكلفة نموذج واحد، أو استهلاك الطاقة، أو الإنتاجية، أو زمن الاستجابة. أما التدريب المتقدم فيتطلب مجموعات أكبر، وأنظمة اتصالات ناضجة، وقدرة على التعافي من الأعطال، واستقرارًا مُثبتًا.
ما هو أكبر خندق واقٍ لـ CUDA؟
يشمل خندق CUDA الواقي المكتبات الناضجة، وتكامل الأطر، وأدوات تصحيح الأخطاء وتحليل الأداء، والأنظمة الموزعة، والوثائق، وسجل الإنتاج التشغيلي، وأكواد العملاء الحالية. التحقق والتحسين المستمر قد يصبحان أكثر أهمية مع انخفاض تكلفة توليد الكود تدريجيًا.
هل يمكن لنوى الذكاء الاصطناعي أن تكون صحيحة ولكن بطيئة جدًا؟
نعم. تُظهر الأبحاث أن النوى قد تنجح في اختبارات الصحة الرقمية، لكن أداءها قد يكون أقل بكثير من التنفيذات المكتبية المحسّنة. التقييم الإنتاجي يتطلب فحوصات الصحة وفحوصات كفاءة العتاد معًا.
هل تستخدم NVIDIA أيضًا وكلاء برمجة بالذكاء الاصطناعي؟
نعم. صرّحت NVIDIA بأنها تستخدم الوكلاء لتسريع تطوير CUDA والتحقق منها، واستعرضت علنًا سير عمل وكيل خاص بـ CUDA، وتكامل تحليل الأداء، ومعيار ComputeEval.
الأدوات ذات الصلة
- NVIDIA CUDA: منصة الحوسبة المتسارعة من NVIDIA، وتشمل المُجمّعات وبيئات التشغيل والمكتبات وأدوات المطورين.
- Infinity: شركة تبني Ignition وبرمجيات استدلال واعية بالنماذج لمُسرّعات الذكاء الاصطناعي الجديدة.
- DeepSeek TileKernels: مجموعة نوى LLM محسّنة من DeepSeek مكتوبة باستخدام TileLang ومرخصة بترخيص MIT.
- TileLang: لغة برمجة خاصة بالمجال بأسلوب Python مع مكدس مُجمّع لتوليد نوى عالية الأداء على خلفيات متعددة.
- INT21 PTX Kernel Factory: نظام قائم على الوكلاء لتوليد وتحسين نوى NVIDIA GPU منخفضة المستوى.
- AMD ROCm: منصة برمجيات AMD للحوسبة على GPU والذكاء الاصطناعي والحوسبة عالية الأداء.
- AWS Neuron: SDK لنشر وتحسين النماذج على رقائق AWS Trainium وInferentia.
- Modular MAX: إطار عمل للنمذجة والخدمة مُحسّن للعتاد، من أجل تنفيذ ذكاء اصطناعي عالي الأداء وقابل للنقل.
الروابط ذات الصلة
- Business Insider: الذكاء الاصطناعي يعيد كتابة الخندق البرمجي لـ NVIDIA: تغطية رئيسية شملت مقابلات مع Infinity وNVIDIA وINT21 وModular وRebellions.
- دراسة حالة Infinity حول d-Matrix Corsair: الشرح الرسمي من Infinity حول نتيجة ضرب المصفوفات خلال 10 ساعات والتشغيل الكامل للنموذج خلال 10 أيام.
- أبحاث Infinity: الصفحة الرسمية لأبحاث Infinity وتقاريرها الفنية.
inc/research): يغطي دراسات الحالة الرسمية لشركة d-Matrix، وبرمجيات الاستدلال التوليدية، ونظام أوميغا البحثي الخاص بالشركة.
- منصة NVIDIA CUDA: نظرة عامة رسمية على مترجم CUDA، ووقت التشغيل، والمكتبات، والأدوات، والنظام البيئي.
- مستودع DeepSeek TileKernels: الكود المصدري الرسمي، ومتطلبات التبعية، وأوامر الاختبار، والميزات الوظيفية، وترخيص MIT.
- ورقة TileLang: ورقة بحثية تصف نموذج البرمجة المجزأة لـ TileLang ومنهج المترجم الخاص بها.
- NVIDIA ComputeEval: معيار NVIDIA لتقييم مهام برمجة CUDA الحديثة.
الملخص
لم يعِد وكيل Ignition من Infinity بناء NVIDIA CUDA خلال 10 ساعات. بل قام بتوليد مضاعفة مصفوفات متوازية التوتر عالية الأداء لهندسة معمارية غير مألوفة.
وقد وصل مسرّع d-Matrix آنذاك إلى 92% من الحد الأقصى التجريبي لقدرة الشريحة. وبعد حوالي 10 أيام، تم تحقيق مسار استدلال كامل لنموذج Qwen3.
لا تزال هذه النتيجة ذات أهمية حتى اليوم. فهي تُظهر أن الوكلاء الذكيين قادرون على تسريع الإطلاق البرمجي المبكر لرقائق الذكاء الاصطناعي الجديدة، خاصة في مجال الاستدلال — حيث يهتم العملاء بتكلفة كل إجابة، ويمكنهم اعتماد أجهزة متخصصة لأعباء عمل أضيق.
تشير كل من TileKernels وTileLang من DeepSeek إلى الاتجاه نفسه: يمكن التعبير عن المزيد من أعمال النوى وتصحيحها تلقائيًا من خلال أنظمة أكثر رقياً. لا تزال نسخة TileKernels الحالية تعتمد على أحدث وحدات معالجة رسومية من NVIDIA وCUDA، لذا فهي تقلل من العمل اليدوي في كتابة CUDA بدلاً من إزالة المنصة.
خندق CUDA لا يزال عميقًا لأنه يتضمن أكثر بكثير من مجرد الكود المصدري. فالمكتبات، والتحقق، وتحليل الأداء، ودعم الأطر، والتدريب الموزع، وسجل الإنتاج، والاستثمارات التنظيمية القائمة كلها أمور يصعب نسخها.
لم يعبر الذكاء الاصطناعي خندق CUDA بأكمله خلال 10 ساعات — لكنه ربما خفّض تكلفة الوصول إلى أول حاجز، محوّلًا المنافسة طويلة الأمد من ملكية الكود إلى التوليد التلقائي والتحقق والتحسين.