Gemini 3.6 Flash يركز على الكفاءة، لكن الاختبارات المستقلة تظهر تحسنًا متواضعًا في الذكاء

أطلقت جوجل ثلاثة نماذج جديدة من جيميني، تستهدف مجالات مختلفة من سوق الوكلاء الذكيين:

发布于 2026年7月22日generalGEO 评分: 06 次阅读
صورة غلاف مقال «Gemini 3.6 Flash يركز على الكفاءة، لكن الاختبارات المستقلة تظهر تحسنًا متواضعًا في الذكاء»

Gemini 3.6 Flash يركز على الكفاءة، لكن الاختبارات المستقلة تظهر تحسنًا متواضعًا في الذكاء

مقدمة

أطلقت جوجل ثلاثة نماذج جديدة من جيميني، تستهدف مجالات مختلفة من سوق الوكلاء الذكيين:

  • جيميني 3.6 فلاش، وهو نموذج رئيسي مُصمم للبرمجة والعمل متعدد الوسائط والمهام متعددة الخطوات للوكلاء
  • جيميني 3.5 فلاش-لايت، مُحسَّن لأحمال العمل عالية الإنتاجية والحساسة لزمن الاستجابة
  • جيميني 3.5 فلاش سيبر، وهو نموذج مقيد للأمن السيبراني، مصمم لاكتشاف الثغرات البرمجية والتحقق منها وإصلاحها

تركز معلومات جوجل الإعلانية على الكفاءة. تقول الشركة إن نموذج فلاش الجديد يمكنه إكمال المهام باستخدام رموز إخراج أقل واستدعاءات أدوات أقل وتكاليف تشغيل دورية أقل. كما أن سعره أقل من جيميني 3.5 فلاش.

هذا الجزء مدعوم بمعايير جوجل الداخلية والاختبارات المستقلة المبكرة.

المسألة الأكثر تعقيدًا هي ما إذا كان جيميني 3.6 فلاش قد حقق تحسنًا جوهريًا في الذكاء مقارنة بالنموذج الذي حل محله.

قيّمت شركة "آرتيفيشيال أناليسس" في مؤشر الذكاء الشامل الخاص بها النموذج الجديد بنفس درجة جيميني 3.5 فلاش. كما أبلغ المستخدمون الأوائل عن تجارب متباينة، لا سيما في مجالات التصميم البصري، وتوليد النصوص بالصينية، واختيار الأدوات، واتباع التعليمات.

النتائج ليست فشلاً مطلقًا. يبدو أن جيميني 3.6 فلاش أسرع، ومخرجاته أكثر إيجازًا، وتكلفته لكل مهمة أقل في العديد من أعباء العمل. كما أنه يحسن العديد من معايير البرمجة واستخدام الكمبيوتر والتعلم الآلي والعمل المعرفي.

لكن هذا الإصدار يسلط الضوء على فارق مهم:

يمكن للنموذج أن يصبح أكثر كفاءة دون أن يحدث تحسن مماثل في الذكاء العام أو جودة المخرجات الذاتية.

هذه الصورة هي محتوى تغريدة نشرتها جوجل ديب مايند، وتتوافق مع المعلومات المتعلقة بالنماذج الثلاثة الجديدة من جيميني المذكورة في المستند، وتظهر بوضوح التوصيف الرسمي لهذه النماذج الثلاثة الجديدة. تشرح التغريدة بوضوح النماذج الأساسية الثلاثة: جيميني 3.6 فلاش الذي يحسن الكفاءة ويوفر جودة عمل أعلى بنفس التكلفة، وجيميني 3.5 فلاش-لايت الذي يركز على القيمة العالية مقابل السعر وزمن الاستجابة المنخفض للمهام اليومية، ونموذج الأمن السيبراني جيميني 3.5 فلاش سيبر لاكتشاف الثغرات البرمجية الحرجة وإصلاحها. تؤكد هذه الصورة المحتوى المتعلق بإطلاق جوجل لنماذج جيميني الثلاثة الموجهة لأسواق الوكلاء المختلفة، وتعرض بشكل مباشر وصف الوظائف والتحديد الرسمي لكل نموذج.

نظرة عامة على نماذج جيميني الثلاثة الجديدة

النموذج الدور الرئيسي سعر API لكل مليون رمز مستوى التفكير الافتراضي التوفر
جيميني 3.6 فلاش البرمجة والعمل متعدد الوسائط وسير عمل الوكلاء المعقد الإدخال 1.50 دولار / الإخراج 7.50 دولار متوسط متاح بالكامل
جيميني 3.5 فلاش-لايت استخراج البيانات عالي السعة، البحث، الترجمة، التوجيه، والوكلاء الفرعيين الإدخال 0.30 دولار / الإخراج 2.50 دولار أدنى متاح بالكامل
جيميني 3.5 فلاش سيبر اكتشاف الثغرات والتحقق منها وإصلاحها لم يُنشر علنًا متخصص تجربة محدودة للحكومات والشركاء الموثوقين

يدعم كل من جيميني 3.6 فلاش وجيميني 3.5 فلاش-لايت ما يلي:

  • سياق يصل إلى مليون رمز
  • يصل إلى 64,000 رمز إخراج
  • إدخال النصوص والصور والصوت والفيديو
  • إخراج نصي
  • مستويات تفكير قابلة للتكوين
  • أدوات مدمجة، بما في ذلك استخدام الكمبيوتر
  • الوصول عبر Gemini API وGoogle AI Studio

تحدد بطاقة نموذج جوجل تاريخ انتهاء صلاحية المعرفة لكلا النموذجين المتاحين بشكل عام بـ مارس 2026.

جيميني 3.6 فلاش: رموز أقل وتكاليف مهمة أقل

يعتمد جيميني 3.6 فلاش على
جيميني 3.5 فلاش، ويهدف إلى استبداله في العديد من أعباء عمل البرمجة والعمل المعرفي والمتعدد الوسائط والوكيل الذكي.

أكثر التحسينات اتساقًا هي الكفاءة.

ذكرت جوجل أنه في مؤشر تحليل الذكاء الاصطناعي، يستخدم جيميني 3.6 فلاش رموز إخراج أقل بنسبة 17% مقارنة بجيميني 3.5 فلاش. في بعض تقييمات البرمجة للوكلاء (بما في ذلك DeepSWE)، لاحظت جوجل انخفاضًا في رموز الإخراج بنسبة تصل إلى 65%.

يميل النموذج أيضًا إلى استخدام:

  • خطوات استدلال أقل
  • استدعاءات أدوات أقل
  • حلقات تنفيذ أقصر
  • تغييرات غير ضرورية في الكود أقل
  • مخرجات نهائية أكثر إيجازًا

هذه التغييرات مهمة لأن تكلفة الوكيل لا تعتمد فقط على السعر المعلن لكل رمز.

قد يقوم وكيل يعمل لفترة طويلة باستدعاء النموذج بشكل متكرر، وإرسال تعريفات أدوات كبيرة، وفحص الملفات، وتنفيذ التعليمات البرمجية، والتعافي من الأعطال، وتوليد كمية كبيرة من مخرجات الاستدلال. حتى لو لم يتغير السعر لكل رمز كثيرًا، فإن تقليل عدد جولات الاستدعاء وعدد الرموز يخفض التكلفة الإجمالية.

تسعير جيميني 3.6 فلاش

تسرد جوجل أسعار API التالية:

نوع الرمز جيميني 3.6 فلاش جيميني 3.5 فلاش
الإدخال 1.50 دولار لكل مليون رمز 1.50 دولار لكل مليون رمز
الإخراج 7.50 دولار لكل مليون رمز 9.00 دولار لكل مليون رمز

بقي تسعير الإدخال دون تغيير، بينما انخفض تسعير الإخراج بنسبة 16.7% تقريبًا.

في إعدادات التقييم الخاصة بها، قاست "آرتيفيشيال أناليسس" متوسط تكلفة كل مهمة لجيميني 3.6 فلاش بحوالي 0.50 دولار، مقارنة بـ 0.59 دولار لجيميني 3.5 فلاش. ويمثل هذا انخفاضًا بنسبة 18% تقريبًا بسبب انخفاض سعر الإخراج وعدد الرموز المولدة.

يجب اعتبار هذه الأرقام خاصة بأعباء عمل معينة، وليست قابلة للتطبيق عالميًا. تعتمد التكلفة الفعلية على:

  • حجم المطالبة
  • مستوى التفكير
  • طول الإخراج
  • عدد جولات الاستدعاء
  • استخدام الأداة
  • التخزين المؤقت للسياق
  • سلوك إعادة المحاولة
  • نوع إطار عمل الوكيل
  • ما إذا كان التطبيق يرسل المحادثة الكاملة في كل جولة

أوقات إنجاز أسرع، وليس فقط توليد أسرع للرموز

ذكرت "آرتيفيشيال أناليسس" أن متوسط وقت المهمة لجيميني 3.6 فلاش يبلغ حوالي 1.3 دقيقة، مقارنة بـ 2.7 دقيقة تقريبًا لجيميني 3.5 فلاش.

يأتي هذا التحسن من سرعة إخراج أعلى وعملية استدلال أكثر اقتصاداً.

النموذج الذي يولد الرموز بسرعة قد يستغرق وقتًا طويلاً إذا وقع في حلقات متكررة من استدعاء الأدوات. على العكس من ذلك، قد ينتهي نموذج أبطأ قليلاً في وقت أبكر إذا وجد الحل الصحيح باستدعاءات أقل.

لمطوري الوكلاء، غالبًا ما يكون الوقت المستغرق لإنجاز المهمة أكثر فائدة من عدد الرموز المولدة في الثانية.

البرمجة، التعلم الآلي، استخدام الكمبيوتر والعمل المعرفي

ذكرت جوجل تحسنات في عدة فئات من المعايير.

البرمجة وهندسة البرمجيات

على DeepSWE، ارتفعت نتائج جيميني 3.6 فلاش من 37% إلى 49% مقارنة بجيميني 3.5 فلاش.

تقول جوجل إن النموذج:

  • ينتج تعديلات غير مرغوب فيها أقل
  • يستخدم حلقات تصحيح أخطاء أقصر
  • يلتزم بشكل أكثر صرامة بنطاق المتطلبات
  • يولد كودًا أقرب إلى مستوى الإنتاج
  • يميل إلى فحص المشروع برمجيًا قبل إجراء التغييرات

هناك مفاضلة في النقطة الأخيرة.

تشير إرشادات مطوري جوجل إلى أن جيميني 3.6 فلاش قد يقوم بتشغيل نصوص تشخيصية قبل التحرير، مما قد يحسن الدقة في المهام المعقدة. ولكن في الأعمال الأمامية البسيطة، قد تزيد خطوات الاستكشاف الإضافية هذه
من زمن الاستجابة دون أن تحسن النتيجة بالضرورة.

ذكرت Google أيضًا أن المُقيّمين البشريين قد يُفضّلون أحيانًا التصميم المرئي والنمط للنماذج المبكرة، حتى لو أنتج Gemini 3.6 Flash كودًا أكثر فاعلية. لذلك، قد يحتاج المطورون الذين يبنون واجهات المستخدم إلى تقديم قيود تصميم مرئية أكثر وضوحًا.

أبحاث التعلم الآلي

على منصة MLE-Bench، أبلغت Google عن تحسن النتائج من %49.7 إلى %63.9.

يركز هذا التقييم على مهام التعلم الآلي والبحث الهندسي الفعلية، وليس على مشكلات البرمجة المنعزلة. يشير هذا التحسن إلى أن النموذج يعمل بشكل أفضل في سير العمل الذي يتطلب التجربة، ومعالجة البيانات، والتنفيذ، والتحسين التكراري.

القدرة على استخدام الحاسوب

على منصة OSWorld-Verified، ووفقًا للمقارنة التي نشرتها Google، تحسنت نسبة Gemini 3.6 Flash من %78.4 إلى %83.0.

أصبحت القدرة على استخدام الحاسوب متاحة الآن كأداة عميل مدمجة عبر واجهة Gemini API و Gemini Enterprise. وهي تتيح للأنظمة الوكيلة التفاعل مع واجهات المستخدم الرسومية، بدلاً من الاعتماد فقط على واجهات API المباشرة.

لا تزال نتائج اختبارات القدرة على استخدام الحاسوب تتأثر بإطار العمل الوكيل، وبيئة الشاشة، وتصميم المهام، واستراتيجيات التعافي من الأخطاء. الدرجات الأعلى مفيدة، لكن الأنظمة الإنتاجية لا تزال بحاجة إلى صلاحيات صارمة وخطوات تأكيد للعمليات الهامة.

العمل المعرفي

على منصة GDPval-AA v2، ارتفعت نتيجة Gemini 3.6 Flash من 1349 إلى 1421.

تسلط Google الضوء على حالات الاستخدام التالية:

  • تحليل المستندات
  • تفسير الرسوم البيانية
  • تحليل البيانات المالية
  • صياغة التقارير
  • تحليل التسجيلات
  • ترحيل الأكواد البرمجية
  • سير عمل بحثي متعدد الوسائط

قدم عملاء بما في ذلك Figma و Harvey و Hebbia و JetBrains تقييمات إيجابية لإعلان Google. تعكس هذه الشهادات تجارب العملاء ولا ينبغي اعتبارها معايير مستقلة.

تاريخ قطع المعرفة ونافذة السياق

يدعم Gemini 3.6 Flash نافذة سياق تصل إلى مليون رمز (token) وإخراجًا يصل إلى 64000 رمز.

يُدرج تاريخ قطع المعرفة في بطاقة النموذج على أنه مارس 2026، وهو تحسن مقارنة بإصدارات Gemini المبكرة (التي كان تاريخ قطع المعرفة لديها أقدم بشكل ملحوظ).

يُقلل تاريخ قطع المعرفة الأحدث من حجم المعلومات الأساسية الحديثة التي يجب على المطورين توفيرها يدويًا. لكن هذا لا يجعل النموذج قادرًا بشكل موثوق على معالجة الأخبار الجارية، أو الأسعار في الوقت الفعلي، أو القوانين المتغيرة، أو إصدارات البرامج، أو غيرها من المعلومات الزمنية الحساسة.

يجب أن تستخدم التطبيقات التي تتعامل مع المعلومات الجديدة الاسترجاع (Retrieval)، والبحث، وقواعد البيانات المُتحقق منها، أو استدعاء الأدوات (Tool Calling).

كما أن نافذة السياق الكبيرة لا تضمن أن النموذج يمكنه استخدام كل جزء من المستندات الطويلة بشكل فعال. يجب على المطورين اختبار:

  • دقة الاسترجاع عبر الأجزاء البعيدة
  • الاتساق في المحادثات الطويلة
  • ما إذا كانت القواعد الرئيسية تظل فعالة
  • الأداء عند تضمين مواد غير ذات صلة
  • التكلفة والكمون (زمن الاستجابة) في أطوال السياق الحقيقية

الترقيات الأمنية في Gemini 3.6 Flash

تقول Google إن Gemini 3.6 Flash يتضمن إجراءات أمنية حدودية أقوى ضد:

  • إساءة استخدام المواد الكيميائية والبيولوجية والإشعاعية والنووية
  • إساءة استخدام الهجمات الإلكترونية
  • مقاومة اختراق الحماية (Jailbreak)

أفادت بطاقة النموذج بتحسن نتائج الأمان متعدد اللغات والمحتوى مقارنةً بـ Gemini 3.5 Flash، مع الحفاظ على معدل رفض غير مبرر منخفض نسبيًا.

أشارت Google أيضًا إلى

عدة قيود:

  • قد يُنتج النموذج هلوسات.
  • يحدث أحيانًا بطء في الاستجابة أو انتهاء المهلة.
  • أظهرت بعض الاختبارات الداخلية تراجعًا طفيفًا في النبرة.
  • لا تزال حماية اختراق الحماية مجالاً للتحسين المستمر.

خلص تقييم الأمن الحدودي لـ Google إلى أن Gemini 3.6 Flash لا يزال دون مستويات القدرات الحرجة التي حددتها الشركة، بما في ذلك عتبات الأمن السيبراني.

يستند هذا الاستنتاج إلى إطار تقييم Google، ويجب تفسيره إلى جانب نتائج اختبارات الأمان المستقلة التي يمكن الحصول عليها لاحقًا.

Gemini 3.5 Flash-Lite: خيار الإنتاجية العالية

صُمم Gemini 3.5 Flash-Lite للمهام التي تركز أكثر على السرعة والإنتاجية والتكلفة بدلاً من عمق الاستدلال الأعلى.

تشمل حالات الاستخدام النموذجية:

  • استخراج البيانات من المستندات
  • التصنيف
  • البحث
  • الترجمة
  • توجيه البيانات
  • توليد JSON المهيكل
  • معالجة الإيصالات
  • تحليل بيانات التجارة الإلكترونية
  • تنفيذ المهام الفرعية عالية الحجم

تصفه Google بأنه أسرع وأقل نماذج سلسلة Gemini 3.5 تكلفة.

تسعير Gemini 3.5 Flash-Lite

نوع الرمز السعر لكل مليون رمز
الإدخال 0.30 دولار أمريكي
الإخراج 2.50 دولار أمريكي

مستوى التفكير الافتراضي فيه هو الأدنى، مما يعطي الأولوية للإنتاجية وزمن الاستجابة المنخفض.

بالنسبة للمهام الفرعية المستقلة، وتنفيذ الأكواد، واستدعاء الأدوات، أو التخطيط متعدد الخطوات، توصي Google برفع مستوى التفكير إلى المستوى المتوسط أو العالي عند الحاجة. الإعدادات الأعلى تحسن معدل إنجاز المهام، لكنها عادةً ما تزيد من استخدام الرموز والكمون.

السرعة

استشهد إعلان Google ببيانات من Artificial Analysis في اختبارات ما قبل الإصدار بلغت حوالي 350 رمز إخراج في الثانية.

سجلت Artificial Analysis لاحقًا سرعات خاصة بمزود خدمة معين قد تتغير بمرور الوقت. تعتمد الإنتاجية على:

  • سعة المزود
  • حجم الطلب
  • إعدادات الاستدلال
  • طول المخرجات
  • التوجيه الإقليمي
  • الطلب الحالي
  • ما إذا كان القياس يقيس المخرجات المرئية أم الاستدلال المخفي

الاستنتاج الثابت هو أن Flash-Lite مصمم ليكون أسرع بشكل ملحوظ من نموذج Flash الأكبر.

تحسينات المعايير

أبلغت Google عن التحسينات التالية مقارنةً بـ Gemini 3.1 Flash-Lite:

المعيار Gemini 3.1 Flash-Lite Gemini 3.5 Flash-Lite
Terminal-Bench 2.1 31% 54%
GDM-MRCR v2 %60.1 %72.2
GDPval-AA v2 642 1140

أبلغت Google أيضًا أن Gemini 3.5 Flash-Lite تفوق على Gemini 3 Flash في العديد من معايير الوكلاء والبرمجة:

  • SWE-Bench Pro: %54.2 مقابل %49.6
  • OSWorld-Verified: %74.0 مقابل %65.1

هذا يجعل Flash-Lite ليس مجرد نموذج اقتصادي منخفض الجودة. بالنسبة لبعض مهام الوكيل عالية الإنتاجية المحدودة، قد يوفر توازنًا أفضل من Gemini 3 Flash الأقدم.

تحسن ذكي مستقل

صنفت Artificial Analysis درجة Gemini 3.5 Flash-Lite في مؤشر الذكاء الخاص بها بـ 36، مرتفعة من درجة 25 لـ Gemini 3.1 Flash-Lite.

هذه الزيادة البالغة 11 نقطة هي من بين أبرز التحسينات الذكية في هذا الإصدار.

لا يزال Flash-Lite أقل من النماذج الحدودية الأقوى، لكن هدفه ليس منافستها في كل مهمة استدلال معقدة. دوره هو معالجة كميات كبيرة من العمل بسرعة وبتكلفة منخفضة.

Gemini 3.5 Flash Cyber: نموذج أمني مقيد

الإصدار الثالث، Gemini 3.5 Flash

Cyber، له غرض مختلف.

إنه نموذج متخصص مبني على Gemini 3.5 Flash، تم ضبطه بدقة (Fine-tuned) لـ:

  • العثور على الثغرات الأمنية في البرامج
  • التحقق من وجود الثغرات فعليًا
  • تتبع مسارات الأكواد ذات الصلة
  • اقتراح التصحيحات
  • دعم المسح المتكرر
  • تحليل قواعد الأكواد الكبيرة بتكلفة أقل من نماذج الشبكات الكبيرة

يعمل هذا النموذج مع وكيل أمن الأكواد من Google DeepMind، CodeMender.

في CodeMender، يمكن لعدة وكلاء Flash Cyber البحث في أجزاء مختلفة من قاعدة الأكواد وتجميع نتائجهم في تقرير واحد.

ترى Google أن استخدام نماذج أصغر وأقل تكلفة أمر قيم في مجال الأمن السيبراني، لأن أبحاث الثغرات غالبًا ما تتطلب استكشاف عدد كبير من مسارات التنفيذ المحتملة. الاستدعاء المتكرر لنماذج كبيرة ومكلفة قد يصبح عنق زجاجة.

أداء CyberGym

تقول Google إنه عند استخدامه من خلال نظام CodeMender، حقق Gemini 3.5 Flash Cyber أداءً تنافسيًا على مستوى النماذج الحدودية على منصة CyberGym.

تعتمد هذه النتيجة على البنية التحتية الكاملة للوكيل، وليس فقط على النموذج الأساسي. يساهم كل من التنظيم والأدوات والتحقق وتجميع التقارير في النتيجة النهائية.

التوفر المحدود

لن يتم توفير Gemini 3.5 Flash Cybe

واجهة برمجة تطبيقات Gemini متاحة على نطاق واسع.

تخطط Google لتوفيرها عبر مشروع CodeMender التجريبي المحدود للجهات التالية:

  • الوكالات الحكومية
  • الشركاء الموثوقون
  • فرق الأمن الدفاعية في الخطوط الأمامية

يعكس هذا الإصدار المحدود الطبيعة مزدوجة الاستخدام للنموذج. فالنظام القادر على العثور على الثغرات الأمنية والتحقق منها يمكن أن يساعد المدافعين في تصحيح البرامج، لكن قدرات مماثلة قد تدعم أيضًا الأنشطة الهجومية.

توضح الصورة واجهة Gemini 3.6 Flash. يوجد في أعلى الواجهة مربع إدخال بعنوان "اسأل Gemini"، وإلى اليمين علامة "Flash" وأيقونة ميكروفون. تعرض القائمة المنبثقة السفلية ثلاثة خيارات: 3.6 Flash (مساعدة شاملة)، 3.6 Thinking (حل المشكلات المعقدة)، 3.1 Pro (الرياضيات والبرمجة المتقدمة). ترتبط هذه الصورة بمحتوى المستند الذي يقدم Gemini 3.6 Flash، وتعرض بشكل مرئي واجهته وإصدارات النموذج القابلة للاختيار، مما يساعد المستخدمين على فهم وظائفه.

أين هو Gemini 3.5 Pro؟

تقول Google إن Gemini 3.5 Pro قيد الاختبار مع الشركاء وسيتم إصداره على نطاق أوسع عندما يصبح جاهزًا.

تربط مقالة AIBase المصدر هذا التأخير بتقارير خارجية وإشاعات عبر الإنترنت حول أداء الترميز واحتمالية إعادة التدريب.

لم تؤكد Google علنًا الادعاءات المتعلقة بالتخلي عن خطة التدريب الأصلية للنموذج أو إعادة تشغيل النظام من الصفر.

المعلومات المؤكدة محدودة نسبيًا:

  • لا يزال Gemini 3.5 Pro في مرحلة اختبار الشركاء.
  • لم تعلن Google عن موعد إصدار عام بعد.
  • بدأت الشركة فيما تسميه أكثر عمليات التدريب المسبق طموحًا لـ Gemini 4.
  • تقول Google إنها تشعر بالتشجيع إزاء التقدم المحرز في الجيل التالي من النماذج.

غياب النموذج الرئيسي من فئة Pro يجعل إصدار Flash أكثر أهمية من الناحية الاستراتيجية. في ظل عدم توفر النموذج عالي المستوى بعد، يجب أن يغطي كل من Gemini 3.6 Flash و Flash-Lite حصة أكبر من احتياجات الإنتاج.

هذا لا يعني بالضرورة أن Google قد تخلت عن Gemini 3.5 Pro، أو أن Gemini 4 على وشك القدوم.

قد تتغير الجداول الزمنية لتطوير النماذج، والتدريب المسبق ليس سوى مرحلة واحدة. قد يستغرق ما بعد التدريب، واختبار الأمان، وتكامل الأدوات، وتحسين زمن الوصول، والتحضير للنشر وقتًا إضافيًا كبيرًا.

اختبار مستقل:

تحسين في الكفاءة أكثر من قفزة في الذكاء

الاستنتاجات المستخلصة من التحليل البشري أكثر تحفظًا من إعلانات منتجات Google.

مؤشر الذكاء

حصل Gemini 3.6 Flash على 50 نقطة في مؤشر الذكاء للتحليل البشري.

حصل Gemini 3.5 Flash أيضًا على 50 نقطة.

لذا، على الرغم من أن التقييمات أظهرت تحسنًا في بعض الفئات، إلا أن النموذج الجديد لم يحسن درجات الذكاء الإجمالية في هذا الاختبار.

يشير تقرير التحليل البشري إلى:

  • درجات أعلى في GDPval-AA v2
  • تراجع طفيف في الامتحان النهائي البشري
  • مستوى ذكاء إجمالي متشابه
  • استخدام أقل لعدد tokens المخرجة
  • سرعة أعلى في إنجاز المهام
  • تكلفة أقل لكل مهمة

هذه ترقية كفاءة موثوقة، لكنها ليست قفزة ذكاء واسعة النطاق.

الوقت المستغرق لكل مهمة

قياس التحليل البشري:

  • Gemini 3.5 Flash: حوالي 2.7 دقيقة
  • Gemini 3.6 Flash: حوالي 1.3 دقيقة

أنجز النموذج عبء عمل التقييم في أقل من نصف الوقت.

التكلفة لكل مهمة

تقدير التحليل البشري:

  • Gemini 3.5 Flash: حوالي 0.59 دولار لكل مهمة
  • Gemini 3.6 Flash: حوالي 0.50 دولار لكل مهمة

بالنسبة للوكلاء الذكاء الاصطناعي على نطاق واسع، يعتبر هذا التخفيض في التكلفة ذا أهمية كبيرة، خاصة عندما ينفذ النظام آلاف المهام.

لا ينبغي اعتبار الاختبارات المعيارية تصنيفًا عامًا

يدمج التحليل البشري تقييمات متعددة في مؤشر واحد. يمكن استخدام الدرجة الإجمالية للمقارنة التقريبية، لكنها قد تخفي اختلافات كبيرة بين أعباء العمل المختلفة.

قد تتفوق النماذج ذات الدرجة الإجمالية نفسها في بعض الجوانب، مثل:

  • البرمجة
  • معالجة المستندات متعددة الوسائط
  • تشغيل الكمبيوتر
  • الوكيل الحساس للسرعة
  • استخراج السياق الطويل

لكنها قد تكون أضعف في الجوانب التالية:

  • الاستدلال المجرد الصعب
  • تصميم الأنماط المرئية
  • معالجة لغات محددة
  • التوليد الإبداعي
  • المهام التي تتطلب تخطيطًا عميقًا

يعتمد اختيار النموذج الصحيح على سيناريو التطبيق المحدد.

لماذا تعليقات المستخدمين المبكرة أكثر سلبية

جمع النص الأصلي العديد من ردود الفعل النقدية من وسائل التواصل الاجتماعي.

تشمل المشكلات التي اشتكى منها المستخدمون:

  • اختيارات مفردات صينية غير طبيعية
  • ضعف اتساق الذاكرة
  • أخطاء في اختيار الأداة
  • ضعف في تصميم الأنماط المرئية
  • انخفاض جودة نسيج اللعبة المُنشأ
  • عدم تطابق التعليمات مع المخرجات المرئية
  • قيود الاستخدام
  • عدم وجود تحسن واضح في الذكاء العام

هذه التعليقات مهمة لأن الاختبارات المعيارية لا يمكنها تغطية جميع جوانب جودة المنتج.

قد يكون النموذج ممتازًا في مهام قاعدة البيانات البرمجية، لكن أداءه ضعيف في توليد التخطيطات؛ قد يستخدام عددًا أقل من الـ tokens ولكنه يصبح مقتضبًا جدًا؛ قد يكون أكثر دقة في معيار برمجي معين ولكنه أقل موثوقية في لغة معينة.

في الوقت نفسه، تعاني اختبارات وسائل التواصل الاجتماعي من قيود خطيرة:

  • ليست الاستفسارات (prompts) متاحة دائمًا للجمهور
  • قد تختلف إعدادات النموذج
  • قد يقارن المستخدمون واجهات منتجات مختلفة
  • قد تستخدم النسخة التجريبية وواجهة API تكوينات مختلفة
  • قد يؤثر توفر الأداة على النتائج
  • حالة فشل واحدة لا تثبت تراجعًا عامًا
  • غالبًا ما تضخم الانتقادات الفيروسية أسوأ حالات الفشل

لذلك، ينبغي النظر إلى تعليقات المستخدمين المبكرة كإشارات لاختبارات موجهة، وليس كحكم نهائي.

إطار تقييم عملي

الفرق التي تفكر في اعتماد Gemini 3.6 Flash لا ينبغي لها أن تتبناه فقط لأن Google أبلغت عن معايير أعلى، ولا ينبغي لها رفضه فقط لأن بعض العروض التوضيحية عبر الإنترنت كانت مخيبة للآمال.

يجب أن يقارن اختبار النقل المفيد بين النموذج القديم والجديد على نفس التطبيق.

1. استخدم مهام تمثيلية

قم ببناء مجموعة تقييم من العمل الفعلي:

  • مستودعات أكواد فعلية
  • مستندات حقيقية
  • استدعاءات أدوات نموذجية
  • طلبات مستخدم شائعة
  • حالات فشل معروفة
  • استفسارات متعددة اللغات
  • أمثلة سياق طويل

2. قياس إنجاز المهمة، وليس فقط جودة المخرجات

تتبع:

  • معدل نجاح المهمة
  • عدد مرات استدعاء الأداة
  • عدد مرات إعادة المحاولة
  • تغييرات الملفات غير المرغوب فيها
  • وقت التصحيح اليدوي
  • زمن الوصول
  • عدد tokens المخرجة
  • التكلفة الإجمالية
  • شدة الفشل

3. اختبر مستويات تفكير مختلفة

يأتي Gemini 3.6 Flash افتراضيًا بمستوى تفكير متوسط.

يأتي Gemini 3.5 Flash-Lite افتراضيًا بمستوى تفكير أدنى.

قد يبدو النموذج ضعيفًا فقط لأن إعداد الاستدلال منخفض جدًا بالنسبة للمهمة الحالية. على العكس من ذلك، فإن استخدام مستوى تفكير عالٍ لمهمة استخراج معلومات بسيطة قد يؤدي إلى إضاعة الوقت والمال.

4. قيّم الجودة البصرية واللغوية بشكل منفصل

لا تقيس الاختبارات المعيارية للبرمجة مدى جمال مظهر الموقع الإلكتروني، أو مدى طبيعة الصياغة باللغة الصينية.

يجب استخدام مراجعة بشرية متخصصة لتقييم:

  • التسلسل الهرمي البصري
  • اتساق العلامة التجارية
  • أسلوب النبرة
  • جودة الترجمة
  • الملاءمة الثقافية
  • مدى اتباع التعليمات

5. اختبر مجموعة الوكيل الكاملة

لا تعتمد نتائج تشغيل الوكيل على النموذج وحده.

يجب مقارنة:

  • تعريفات الأداة
  • بنية الاستفسار (prompt)
  • استراتيجيات الذاكرة
  • التخزين المؤقت للسياق
  • قواعد إعادة المحاولة
  • حدود الموافقة
  • بيئة المتصفح أو الكمبيوتر
  • إطار التنسيق

قد يتطلب نقل النموذج تعديل بيئة النظام بأكملها وفقًا لذلك.

أي نموذج يجب على المطورين اختياره؟

اختر Gemini 3.6 Flash في الحالات التالية:

  • تتطلب المهمة استدلالًا متعدد الخطوات.
  • جودة البرمجة بالغة الأهمية.
  • يستخدم الوكيل أدوات متعددة.
  • يحتوي عبء العمل على صور أو رسوم بيانية أو فيديوهات أو مستندات كبيرة.
  • تحتاج إلى استخدام وظيفة التحكم بالكمبيوتر (Computer Use).
  • عدد الجولات الأقل وزمن الوصول المنخفض للمهام ذو قيمة.
  • Gemini 3.5 Flash متاح حاليًا ولكنه مطول جدًا أو مكلف جدًا.

اختر Gemini 3.5 Flash-Lite في الحالات التالية:

  • الإنتاجية هي الاعتبار الأساسي.
  • يتعلق العمل باستخراج المعلومات أو التصنيف أو الترجمة أو التوجيه والتوزيع.
  • تعمل العديد من الـ sub-agents بالتوازي.

يتطلب التطبيق معالجة كميات كبيرة من المستندات.

  • السعي للحصول على سعر أقل لكل رمز مميز.
  • يمكن إحالة المهام المعقدة إلى النموذج الرئيسي الأقوى للمعالجة.

حالات استخدام Gemini 3.5 Flash Cyber عند الموافقة على الوصول فقط:

  • المؤسسة جزء من البرنامج التجريبي المحدود من Google.
  • عبء العمل هو الأمن السيبراني الدفاعي.
  • تم التحقق من نتائج اكتشاف الثغرات قبل اتخاذ الإجراء.
  • يتم التعامل مع المستودعات الحساسة تحت صلاحيات صارمة.
  • المؤسسة قادرة على إدارة المخاطر ذات الاستخدام المزدوج.

الدروس الأوسع من إصدار Flash

يسهل فهم Gemini 3.6 Flash على أنه ترقية في تجربة التشغيل، وليس طفرة دراماتيكية في الذكاء.
إنه مصمم لتقليل الهدر الذي يجعل العوامل باهظة الثمن:

  • الإفراط في التفكير
  • استدعاءات الأدوات المتكررة
  • المخرجات الطويلة
  • حلقات التصحيح
  • تعديلات الكود غير الضرورية
  • إنجاز المهام البطيء

قد تكون قيمة هذه التحسينات في بيئة الإنتاج أعلى من التحسينات الطفيفة في معايير التفكير المجردة.
ومع ذلك، فإن الكفاءة لا تحل محل الجودة في كل تطبيق.
النموذج القادر على إنجاز المهام بتكلفة زهيدة لا فائدة منه إذا كانت النتائج تتطلب إصلاحًا يدويًا كبيرًا. قد يخيب النموذج ذو الدرجات العالية في البرمجة آملاً في التصميم. النموذج الجيد في اللغة الإنجليزية قد يحتاج إلى تحقق إضافي في الصينية أو غيرها من اللغات.

أنشأت سلسلة Flash الجديدة من Google خيارات أكثر تخصصًا:

  • 3.6 Flash: للعمل العاملي الأقوى
  • 3.5 Flash-Lite: للتوسع على نطاق واسع
  • Flash Cyber: للاستخدام الأمني الخاضع للرقابة

لذا، فإن هذا الإصدار لا يتعلق بنموذج واحد يحل محل جميع النماذج الأخرى، بل بتخصيص المستوى المناسب من الذكاء والتكلفة لكل جزء من نظام العوامل.

الأسئلة الشائعة

ما هو Gemini 3.6 Flash؟

Gemini 3.6 Flash هو النموذج العام الرئيسي من Google للبرمجة والمهام متعددة الوسائط والعمل المعرفي وسير عمل العوامل. يعتمد على Gemini 3.5 Flash ولكنه مصمم لاستخدام عدد أقل من الرموز وعدد أقل من جولات التفاعل وعدد أقل من استدعاءات الأدوات.

هل Gemini 3.6 Flash أذكى من Gemini 3.5 Flash؟

تقر Google بتحسينات في العديد من معايير البرمجة واستخدام الكمبيوتر والتعلم الآلي والعمل المعرفي. يعطي Artificial Analysis كلا النموذجين نفس مؤشر الذكاء الإجمالي البالغ 50، لذا يبدو أن التحسن الأكثر وضوحًا هو في الكفاءة وسرعة إنجاز المهام، وليس في الذكاء الكلي.

كم تبلغ تكلفة Gemini 3.6 Flash؟

تسعر Google النموذج بمبلغ 1.50 دولار لكل مليون رمز إدخال، و 7.50 دولار لكل مليون رمز إخراج. الأسعار قابلة للتغيير، وتعتمد التكلفة الإجمالية للعامل أيضًا على التفكير وحجم السياق واستدعاءات الأدوات وإعادة المحاولة وطول المخرجات.

ما فائدة Gemini 3.5 Flash-Lite؟

Flash-Lite مناسب لأعباء العمل عالية الإنتاجية والحساسة لزمن الوصول، مثل الاستخراج والتصنيف والبحث والترجمة والتوجيه ومعالجة البيانات المنظمة وتنفيذ العوامل الفرعية. إنه أرخص وأسرع من Gemini 3.6 Flash، لكنه ليس مصممًا ليحل محل النماذج الأقوى في جميع المهام الصعبة.

هل يدعم Gemini 3.6 Flash الصور والفيديو؟

نعم. تتضمن بطاقة النموذج الخاصة به ميزات تدعم إدخال النصوص والصور والصوت والفيديو، مع إخراج نصي. نافذة السياق للنموذج تصل إلى مليون رمز مميز.

ما هو Gemini 3.5 Flash Cyber؟

إنه إصدار متخصص من Gemini 3.5 Flash تم تدريبه خصيصًا لاكتشاف الثغرات والتحقق منها وإصلاحها. تخطط Google لتوفير هذا النموذج للحكومات وشركاء الدفاع الموثوق بهم من خلال برنامج تجريبي مقيد يسمى CodeMender.

هل تم إلغاء Gemini 3.5 Pro؟

لم تشر Google إلى إلغائه. قالت الشركة إن Gemini 3.5 Pro قيد الاختبار مع الشركاء، وسيكون متاحًا على نطاق واسع عندما يصبح جاهزًا.

هل يجب عليّ الترحيل فورًا من Gemini 3.5 Flash؟

ليس بالضرورة فورًا. قبل التبديل، يجب تشغيل كلا النموذجين على مهام إنتاجية تمثيلية ومقارنة معدلات النجاح ووقت التصحيح اليدوي وموثوقية الأدوات وزمن الوصول واستخدام الرموز والتكلفة الإجمالية.

الأدوات ذات الصلة

  • Google AI Studio: بيئة Google المستندة إلى المتصفح لاختبار نماذج Gemini والمطالبات والأدوات وتكوين API.
  • Gemini API: واجهة API الرسمية لدمج نماذج Gemini في التطبيقات وسير عمل العوامل.
  • تطبيق Gemini: واجهة Google الموجهة للمستهلكين للاستخدام المباشر لنماذج Gemini.

مضاد الجاذبية (الرابط: https://antigravity.google/): بيئة تطوير العوامل من Google مدمجة مع Gemini 3.6 Flash لسير عمل البرمجة.

  • CodeMender (الرابط: https://deepmind.google/models/codemender/): عامل Google DeepMind لاكتشاف وإصلاح الثغرات البرمجية.
  • Artificial Analysis (الرابط: https://artificialanalysis.ai/): منصة مستقلة لمقارنة النماذج، تغطي مستوى الذكاء والسرعة وزمن الوصول واستخدام الرموز ومعلومات التسعير.

الروابط ذات الصلة

  • الإعلان الرسمي عن إصدار Gemini Flash: المواصفات ونتائج المعايير والتسعير وحالات العملاء ومعلومات التوفر من Google.
  • بطاقة نموذج Gemini 3.6 Flash: التفاصيل الرسمية حول الإدخال وطول السياق والقيود واختبارات الأمان وتاريخ انتهاء المعرفة.
  • بطاقة نموذج Gemini 3.5 Flash-Lite: المعلومات الرسمية حول الاستخدام المقصود وقيود النموذج وتقييم الأمان والتوزيع.
  • Gemini 3.5 Flash Cyber: شرح Google DeepMind للنموذج المتخصص في الأمن السيبراني والبرنامج التجريبي المقيد.
  • دليل أحدث نماذج Gemini API: معرفات النماذج الرسمية ودليل الترحيل وتغييرات API والتسعير وحالات الاستخدام الموصى بها.
  • تسعير Gemini API: صفحة التسعير الرسمية الحالية لنماذج وخدمات Gemini API.
  • تقييم Artificial Analysis: تحليل مستقل حول مستوى الذكاء وتكلفة المهمة الواحدة وسرعة الإخراج وكفاءة الرموز ومدة المهمة.

الخلاصة

تحتوي أحدث إصدارات Flash من Google على ثلاثة منتجات منفصلة. يستهدف Gemini 3.6 Flash العوامل المعقدة وسيناريوهات البرمجة، بينما يركز Gemini 3.5 Flash-Lite على التنفيذ عالي الإنتاجية،

يركز إصدار Gemini 3.5 Flash Cyber، ضمن نطاق الوصول المقيد، على أبحاث الثغرات الدفاعية.

أما Gemini 3.6 Flash فقد حسّن أداءه في العديد من اختبارات قياس المهام، مما أدى إلى تقليل استخدام الرموز المخرَجة، وتسريع إنجاز مهام العامل الذكي، وخفض تسعير المخرجات. ومع ذلك، أظهرت الاختبارات المستقلة أن درجاته في الذكاء الشامل لم ترتفع مقارنة بـ Gemini 3.5 Flash.

لذا، فإن ردود فعل السوق المعقدة مفهومة. فهذا الإصدار يقدم دليلاً قوياً على الكفاءة بدلاً من تحقيق قفزة في القدرات العامة.

أفضل وصف يمكن إطلاقه على Gemini 3.6 Flash هو: إنه نموذج إنتاج أسرع وأكثر انسيابية - وليس دليلاً على تحسن جميع أشكال الذكاء أو جودة المخرجات بشكل متزامن.