DeepSeek V4 Pro مقابل Grok 4.6: أول اختبار في العالم الحقيقي يضع النموذجين في الصدارة

أدى الإطلاق المتزامن تقريبًا لنموذجي الذكاء الاصطناعي إلى وضع DeepSeek V4 Pro وGrok 4.6 في دائرة الضوء مباشرة. يتألق DeepSeek V4 Pro في الوكيل و

发布于 2026年8月14日generalGEO 评分: 05 次阅读
DeepSeek V4 Pro مقابل Grok 4.6: أول اختبار في العالم الحقيقي يضع النموذجين في الصدارة

DeepSeek V4 Pro مقابل Grok 4.6: أول اختبار في العالم الحقيقي يضع النموذجين في مصافّ الطراز الأول

مقدمة

أصدرت شركتان نموذجين بارزين من نماذج الذكاء الاصطناعي في الوقت نفسه تقريبًا، مما جعل DeepSeek V4 Pro وGrok 4.6 في دائرة الضوء مباشرة.

حقّق DeepSeek V4 Pro قفزة هائلة في أداء العملاء الأذكياء وهندسة البرمجيات، بينما تركّز Grok 4.6 بقوة على البرمجة والعمل المعرفي والقدرات الشاملة. تصف المقالة المصدر الإصدارين بأنهما تحدٍّ مباشر للنماذج الحدودية الحالية لدى OpenAI وAnthropic.

ما يجعل هذه المقارنة مثيرة للاهتمام بشكل خاص هو أن النموذجين لم يُختبرا فقط على لوحات المعايير القياسية. بل تضمّنت الاختبارات المبكرة في العالم الحقيقي مطالبة النموذجين باستخدام نفس المطالبات النصية لبناء مواقع ويب، وصنع ألعاب، وإعادة إنتاج تصاميم بصرية، وتوليد تجارب ثلاثية الأبعاد.

النتيجة لم تكن مجرد سباق بسيط يفوز فيه طرف واحد، بل كانت مواجهة متكافئة إلى حد كبير — حيث تفوّق كل نموذج في مجالات خاصة به.

DeepSeek V4 Pro يدخل الساحة، وGrok 4.6 ينضم في الوقت نفسه

تسلّط المقالة المصدر الضوء على نتائج متعددة لمعايير DeepSeek V4 Pro.

في تقييم CyberGym لعملاء الأمن السيبراني الأذكياء، سجّل DeepSeek V4 Pro 83.3، متقدّمًا بهامش ضئيل على Fable 5 البالغ 83.1 وOpus 4.8 البالغ 78.3.

على معيار AutomationBench، بلغت نتيجته 31.8، متقدّمًا على Fable 5 البالغ 29.1 وOpus 4.8 البالغ 27.2.

كانت النتائج الأكثر تقاربًا على معيار Terminal-Bench 2.1. حيث سجّل DeepSeek V4 Pro 87.9، بينما حقّق Opus 4.8 85.0 وFable 5 88.0.

كما أبلغت المقالة المصدر عن نتيجة 60.0 في إعداد "اختبار الإنسانية الأخير" مع تفعيل الأدوات، مقابل 57.9 لـ Opus 4.8 و63.0 لـ Fable 5.

كان DeepSWE أيضًا تحسّنًا كبيرًا آخر في التقرير. حيث بلغ DeepSeek V4 Pro 62.7، مقارنة بـ 12.8 في النسخة التجريبية السابقة — قفزة هائلة — وأعلى من 58.0 المُبلَغ عنها لـ Opus 4.8، لكنه ما زال أقل من 70.0 لـ Fable 5.

أما Grok 4.6 فقد خضع لاختبارات مقارنة مع GPT-5.6 وFable 5 في مجالات متعددة.

تذكر المقالة المصدر أن مؤشر ذكائه الشامل بلغ 61، متأخرًا بنقطة واحدة عن Fable 5 الذي حصل على 62.

على معيار CursorBench، سجّل Grok 4.6 69.9%، متقدّمًا على GPT-5.6 البالغ 67.2%، ومقتربًا من Fable 5 البالغ 70.5%.

على معيار FrontierCode، بلغ 61.3%، متقدّمًا أيضًا بهامش طفيف على GPT-5.6 البالغ 60.6%، ومتأخرًا عن Fable 5 البالغ 63.6%.

تُظهر المقالة المصدر أن الأداء في العمل المعرفي كان أقوى. إذ احتل Grok 4.6 المركز الأول في جميع التقييمات الثلاثة الرئيسية: 1,753 Elo على GDPval-AA v2، و1,577 Elo على AA-Briefcase، و15.8% على معيار Harvey LAB القانوني المتخصص.

الاستنتاج الرئيسي الذي تستخلصه المقالة المصدر من هذه البيانات مباشر: كلا النموذجين دخلا بالفعل حوار المنافسة مع الأنظمة الحدودية الرائدة.

الفرق في الأسعار جزء من القصة أيضًا

الأداء ليس سوى نصف المقارنة.

تسلّط المقالة المصدر الضوء أيضًا على تكلفة الاستدلال. وتذكر أسعار كل مليون توكن إخراج وقت الإصدار:

النموذج سعر كل مليون توكن إخراج (وفقًا للتقارير)
DeepSeek V4 Pro 0.87 دولار
Grok 4.6 6 دولارات
GPT-5.6 Sol 30 دولارًا
Claude Opus 5 25 دولارًا
Fable 5 50 دولارًا

في عرض الأسعار الحالي بالدولار، تبلغ تكلفة كل مليون توكن إدخال 0.435 دولار عند عدم اصطدام الذاكرة المؤقتة، و0.003625 دولار عند اصطدامها.

توثّق وثائق DeepSeek أيضًا

أن نموذج V4 يدعم نافذة سياقية تبلغ مليون توكن، واستدعاء الأدوات، والوصول عبر واجهات برمجة التطبيقات بتنسيق OpenAI وتنسيق Anthropic.

تتغير أسعار النماذج الأخرى بمرور الوقت، لذا ينبغي النظر إلى مقارنات الأسعار بين النماذج في المقالة الأصلية على أنها لقطة زمنية لتاريخ إصدارها، وليست جدول أسعار ساريًا على المدى الطويل.

أول اختبار عملي: DeepSeek V4 Pro يبني كرة أرضية ثلاثية الأبعاد

الاختبار العملي الأول الموصوف في المقالة وضع أمام DeepSeek V4 Pro مطلبًا عاليًا إلى حد كبير.

بمطالبة نصية واحدة فقط، أنشأ النموذج تجربة كاملة لكرة أرضية ثلاثية الأبعاد تفاعلية داخل المتصفح.

وفقًا للتقارير، تدعم النتيجة السحب والتدوير والتكبير والتصغير كتفاعلات أساسية، وتتضمن أيضًا تدفقات بيانات عالمية ومسارات ديناميكية وعلامات جغرافية موزعة حول العالم.

التفاصيل البصرية ذهبت أبعد من ذلك. فتشتّت الغلاف الجوي، والغيوم، وإضاءة النهار والليل، والواجهة المحيطة — كلها كانت مدمجة في التجربة المُولَّدة.

التركيز في هذا الاختبار لم يكن فقط على أن النموذج أنشأ صفحة ويب، بل على إظهار المدى الذي يمكن أن تصل إليه نماذج البرمجة بالذكاء الاصطناعي عندما يُطلَب منها تنسيق التصميم البصري، والعرض ثلاثي الأبعاد، والتفاعل، وبنية التطبيق في مهمة واحدة.

مواجهة DeepSeek V4 Pro وGrok 4.6 في ثلاث مهام تطبيقية

بعد ذلك، قارنت المقالة الأصلية بين النموذجين باستخدام نفس المطالبات النصية أو مطالبات متشابهة إلى حد كبير.

أدار المبدع بالذكاء الاصطناعي شيانغ يانغ تشياو موه ثلاث مهام صغيرة على DeepSeek V4 Pro أولًا، ثم سلّم اثنتين من نفس المطالبات إلى Grok 4.6.

بناء ونشر موقع ويب باستخدام ثلاث مهارات

تطلّبت المهمة الأولى من النموذج استخدام ثلاث مهارات لتطوير ونشر موقع ويب.

وفقًا للتقارير، نجح DeepSeek V4 Pro في إكمال سير العمل بالكامل. وتذكر المقالة الأصلية أن تصميم الصفحة والاكتمال العام كانا مستقرّين.

هذا النوع من الاختبارات مهم بشكل خاص للبرمجة بالوكلاء الأذكياء، إذ يحتاج النموذج إلى تنسيق أدوات أو قدرات متعددة، وليس مجرد توليد جزء من الكود.

إعادة إنتاج 60 نمط تصميم في بطاقات Bento

تطلّبت المهمة الثانية من النموذج إعادة إنتاج 60 نمط تصميم مختلف وعرضها كمجموعة من بطاقات Bento.

وفقًا للتقارير، ميّز DeepSeek V4 Pro بين الخطوط الطباعية، وأنظمة الألوان، والتخطيطات عبر التصاميم المختلفة.

عندما أُعطيت نفس المطالبة إلى Grok 4.6، أخذ هذا الأخير زمام المبادرة. تقول المقالة الأصلية إن بعض صفحات Grok كانت أكثر نضجًا في التخطيط والألوان والتسلسل الهرمي البصري، مما أسفر عن نتيجة نهائية أكثر صقلًا.

بناء لعبة كسر الطوب ثلاثية الأبعاد

المهمة الثالثة كانت إنشاء لعبة كسر الطوب ثلاثية الأبعاد من الصفر.

أنشأ DeepSeek V4 Pro لعبة قابلة للعب تتضمن بيئة ثلاثية الأبعاد، وموسيقى خلفية، ومؤثرات صوتية ديناميكية، وردود فعل تفاعلية.

أدّى Grok 4.6 دورًا مماثلًا في هذه الجولة. تصف المقالة الأصلية النتيجتين بأنهما شبه متعادلتين في الجودة البصرية، واكتمال المشهد، وقابلية اللعب.

اختبار Flappy Bird يكشف عن مفاضلة من نوع آخر

جاء اختبار أكثر دقة من المطوّر جون سونغ، الذي أعطى DeepSeek V4 Pro وGrok 4.6 نفس المطالبة النصية تمامًا لبناء لعبة بأسلوب Flappy Bird من الصفر.

اتّبع النموذجان نهجين مختلفين تمامًا.

استخدم DeepSeek V4 Pro أكثر من 20,000 توكن، لكن التكلفة عبر واجهة برمجة التطبيقات كانت 0 دولار وفقًا للتقارير — لأن تسعير واجهة برمجة التطبيقات لهذا النموذج (خلال العرض محدود الوقت من DeepSeek) جعل توكينات الإدخال والإخراج مجانية بالكامل.

أما Grok 4.6 فقد استخدم حوالي 5,000 توكن، وبلغت التكلفة المُبلَغ عنها 0.03 دولار.

إذن، في هذه الجولة المحددة، كان Grok أكثر كفاءة في استهلاك التوكينات، لكن وفقًا للمقالة المصدر، أنتج DeepSeek نتيجة نهائية أقوى.

وفقًا للتقارير، تضمّن إصدار DeepSeek خلفية جبلية متعددة الطبقات، وغيومًا، وتدرّجات لونية، وأنابيب ذات عمق حرّة، بالإضافة إلى رسوم متحركة لعلامات "+1" تطفو عندما يعبر الشخصية الأنابيب.

استنتاج المقالة المصدر قيّم: استهلاك أقل للتوكينات لا يعني تلقائيًا نتائج تطبيقية أفضل، والاستهلاك الأعلى للتوكينات لا يعني بالضرورة تكلفة أعلى.

اختبار آخر للواجهات الأمامية يميل أيضًا لصالح DeepSeek

أجرى المطوّر حمزة اختبارًا آخر لتوليد الواجهات الأمامية، وتذكر المقالة المصدر أن DeepSeek V4 Pro فاز مرة أخرى.

وصُفت الصفحة المُولَّدة بأنها تتفوق في الاكتمال العام والجودة البصرية.

نتائج Grok 4.6.

هذا يعزز النمط الذي لوحظ في المهام السابقة: النموذجان متقاربان للغاية، لكن نقاط القوة لكل منهما تختلف حسب التطبيق المحدد وصيغة التوجيه.

لا تزال هناك نقاط ضعف في V4 Pro

لم يفز DeepSeek V4 Pro في كل اختبار من اختبارات التوليد البصري.

في مقارنة واحدة تضمنت طيور البجع، كان إصدار V4 Pro أقوى في الاكتمال البصري العام وفقًا للتقارير، وأنتج رسومًا توضيحية أكثر جاذبية للفيلة، لكن اتجاه حركة البجع كان خاطئًا.

هذا مثال صغير، لكنه يسلط الضوء على قيد شائع في الأنظمة التوليدية والأنظمة البصرية: قد تبدو النتائج مصقولة، ومع ذلك تحتوي على أخطاء دلالية أو حركية أساسية.

شجرة أزهار الكرز Three.js: الفجوة أكثر وضوحًا

زاد المقال المصدر من صعوبة التحدي بعد ذلك، حيث طلب من DeepSeek V4 Pro وGPT-5.6 Sol وClaude Opus 5 توليد نفس شجرة أزهار الكرز باستخدام Three.js.

هذه المرة، كانت الاختلافات أكثر وضوحًا.

ذكر المقال أن DeepSeek V4 Pro تخلف عن النموذجين الآخرين في تفاصيل الجذع والفروع والأوراق والإضاءة وعمق المجال والجو العام.

هذه النتيجة مهمة لأنها تمنع المقارنة من التحول إلى سردية انتصار بسيطة. قد يكون DeepSeek V4 Pro قويًا جدًا في مهام الترميز الشاملة، لكن لا تزال هناك بعض السيناريوهات المتخصصة للتوليد البصري حيث تنتج نماذج رائدة أخرى نتائج أكثر دقة.

بشكل عام: DeepSeek V4 Pro قريب من مستوى Grok 4.6

بعد جولات متعددة من الاختبارات، كان الحكم العام في المقال المصدر أن DeepSeek V4 Pro وGrok 4.6 قد وصلا إلى مستوى تنافسي مماثل.

لا يمكن لأي من النموذجين الفوز في كل مهمة.

يبدو DeepSeek V4 Pro قويًا بشكل خاص في بعض مهام الترميز الشامل وبناء التطبيقات، بينما قد يكون Grok 4.6 أكثر كفاءة في استخدام الرموز، ويظهر تفوقًا في بعض مقارنات التصميم البصري والعمل المعرفي.

هذا يجعل هذه المقارنة أكثر فائدة من مجرد نتيجة قياس واحدة. بالنسبة للمطورين، قد يعتمد النموذج الأفضل على ما إذا كانت الأولوية لجودة الترميز، أو موثوقية الوكيل، أو الدقة البصرية، أو كفاءة الرموز، أو تكلفة API.

نموذجا الذكاء الاصطناعي يضيقان الفجوة مع النماذج الرائدة

وصف المقال المصدر الإصدار المتزامن لـ DeepSeek V4 Pro وGrok 4.6 بأنه لحظة غير معتادة في سوق الذكاء الاصطناعي.

رد فعل ريك دي أوليفيرا، كما ورد في الاقتباس،

الفكرة الأساسية في المقال الأصلي هي أن كلا النموذجين قوي وبأسعار معقولة في نفس الوقت.

هذا المزيج بالتحديد هو ما جعل إطلاقهما محل اهتمام كبير.

أكدت الوثائق الرسمية لـ DeepSeek أن V4 Pro مصمم لاستدعاء الأدوات، وأحمال العمل الطويلة السياق، ووضعي التفكير وعدم التفكير.

وبالمثل، تضع المواد الرسمية لـ xAI حول Grok أحدث جيل من Grok في مجالات الترميز والمهام الوكيلة والعمل المعرفي. على سبيل المثال، يصف الإعلان الرسمي عن Grok 4.5 النموذج بأنه مبني خصيصًا للترميز والمهام الوكيلة والعمل المعرفي، ويتضمن نتائج تقييمات هندسية فعلية.

حتى لو تغيرت بيانات المقاييس الفردية، فإن الاتجاه الأوسع يظل واضحًا: الذكاء الاصطناعي على مستوى النماذج الرائدة أصبح متاحًا بشكل متزايد للمطورين، وأصبحت القيمة مقابل السعر جزءًا متزايد الأهمية من المنافسة بين النماذج.

ماذا سيحدث بعد ذلك؟

اختتم المقال المصدر بالإشارة إلى اتجاه الجولة القادمة من المنافسة.

ذكر أن xAI قد ألمحت بالفعل إلى Grok 4.7، ومن المتوقع أن تواصل OpenAI وAnthropic الرد من خلال تحديثات نموذجية خاصة بهما.

هذا يعني أن متصدر المقاييس اليوم قد لا يحتفظ بالصدارة لفترة طويلة.

بالنسبة للمطورين، الدرس الأكثر ديمومة هو: قيّم النماذج بناءً على المهام التي تؤثر فعليًا على سير عملك. النموذج الذي يسجل درجات عالية في المقاييس، لكنه لا يقدم أداءً جيدًا على قاعدة الأكواد الخاصة بك أو عملية النشر أو متطلبات واجهة المستخدم أو سلسلة الأدوات الخاصة بك، قد لا يزال ليس الخيار الصحيح.

الأسئلة الشائعة

ما هو DeepSeek V4 Pro؟

DeepSeek V4 Pro هو النموذج الرئيسي من الجيل V4 من DeepSeek، مصمم للاستدلال والترميز واستخدام الأدوات وأحمال العمل الطويلة السياق. تسرد الوثائق الرسمية لـ DeepSeek نافذة سياق تبلغ مليون رمز، وتدعم استدعاء الأدوات، وتوفر الوصول عبر واجهات برمجة تطبيقات بتنسيق OpenAI وتنسيق Anthropic.

كيف يقارن DeepSeek V4 Pro بـ Grok 4.6؟

ذكر المقال المصدر أن النموذجين متقاربان في الأداء في العديد من اختبارات الوكيل والترميز، مع فوز كل منهما في بعض الاختبارات. برز DeepSeek V4 Pro بشكل خاص في اختبارات بناء التطبيقات الشاملة المتعددة، بينما أظهر Grok 4.6 نتائج قوية في الترميز والعمل المعرفي وبعض مهام التصميم البصري.

هل DeepSeek V4 Pro أرخص من Grok؟

وفقًا للمقارنة في المقال المصدر بتاريخ 14 أغسطس 2026، بلغ سعر الإخراج المعلن لـ DeepSeek V4 Pro 0.87 دولارًا لكل مليون رمز، بينما كان 6 دولارات لـ Grok 4.6. تؤكد صفحة التسعير الرسمية لـ DeepSeek حاليًا أن V4 Pro بسعر 0.87 دولارًا لكل مليون رمز إخراج، على الرغم من أن أسعار API قد تتغير.

هل يمكن لـ DeepSeek V4 Pro بناء مواقع ويب وألعاب؟

ذكر المقال المصدر حالات اختبار ناجحة حيث أنشأ DeepSeek V4 Pro تجربة كرة أرضية ثلاثية الأبعاد، ومواقع ويب، ومجموعة تصاميم بأسلوب Bento، ولعبة تكسير الطوب ثلاثية الأبعاد، ولعبة بأسلوب Flappy Bird. هذه نتائج اختبار فعلية تم الإبلاغ عنها، وليست وعدًا بأن كل توجيه سينتج جودة مكافئة.

هل DeepSeek V4 Pro مناسب لوكلاء الترميز بالذكاء الاصطناعي؟

إنه مصمم لاستدعاء الأدوات وأحمال العمل الوكيلة، وذكر المقال المصدر أنه أظهر أداءً قويًا في العديد من تقييمات الهندسة والوكلاء. تسرد الوثائق الرسمية لـ DeepSeek أيضًا دعم V4 Pro لاستدعاء الأدوات.

هل يتفوق DeepSeek V4 Pro دائمًا على النماذج الرائدة الأخرى؟

لا. يتضمن المقال المصدر بعض الاختبارات التي أنتج فيها GPT-5.6 Sol وClaude Opus 5 نتائج أفضل، خاصة في مقارنة توليد شجرة أزهار الكرز بـ Three.js. تختلف النتائج بشكل كبير بين المهام المختلفة.

ما الذي يجب على المطورين مقارنته إلى جانب درجات المقاييس؟

يجب على المطورين أيضًا مقارنة تكلفة API وزمن الاستجابة وطول السياق واستدعاء الأدوات وموثوقية الترميز وجودة الإخراج ومدى توافق النموذج مع سير عمل الوكلاء الحالي لديهم. بالنسبة للأنظمة الإنتاجية، قد يكون الاتساق والتكلفة الإجمالية أكثر أهمية من الاختلافات الطفيفة في المقاييس.

الأدوات ذات الصلة

  • DeepSeek API: نقطة النهاية الرسمية للوصول إلى نماذج DeepSeek.
  • وثائق DeepSeek API: الوثائق الرسمية حول النماذج والتسعير واستدعاء الأدوات والتكامل مع API.
  • xAI API: الموارد الرسمية للمطورين للبناء باستخدام نماذج Grok.
  • Grok: خدمة xAI الموجهة للمستخدمين للتفاعل مع نماذجها.
  • Three.js: مكتبة JavaScript ثلاثية الأبعاد ذات الصلة باختبارات توليد Three.js الموصوفة في المقال.

الروابط ذات الصلة

  • نماذج DeepSeek والتسعير: مواصفات نماذج DeepSeek API الرسمية وأسعار الرموز الحالية.
  • وثائق DeepSeek V4: وثائق DeepSeek API الرسمية وأدلة التكامل.
  • إعلان xAI Grok 4.5: الإعلان الرسمي من xAI حول قدرات الترميز والوكيل للجيل الحالي من Grok.
  • وثائق xAI API: الوثائق الرسمية لاستخدام Grok من خلال منصة مطوري xAI.
  • Three.js: الموقع الرسمي لمشروع Three.js ووثائقه.
  • [DeepSeek API

GitHub: منظمة DeepSeek الرسمية على GitHub.

ملخص

يعمل كل من DeepSeek V4 Pro و Grok 4.6 في الوقت نفسه على دفع الذكاء الاصطناعي المتقدم من اتجاهين: وكلاء ذكاء اصطناعي أكثر قوة في العالم الحقيقي وأداء ترميز أفضل، بالإضافة إلى قيمة سعرية أكثر تنافسية وهجومية.

لم تسفر الاختبارات المبكرة عن فائز واحد شامل. أظهر DeepSeek V4 Pro أداءً قويًا في مهام بناء التطبيقات الشاملة المتعددة، بينما أظهر Grok 4.6 قدرات تنافسية في الترميز والأعمال المعرفية والتصميم البصري.

التحول الأكبر هو أن المطورين لديهم الآن خيارات أكثر من نماذج أقوى دون الحاجة إلى دفع أسعار متقدمة تلقائيًا.