Grok Voice Think Fast 2.0: نموذج الوكيل الصوتي الأسرع والأكثر دقة من xAI

Grok Voice Think Fast 2.0: نموذج الوكيل الصوتي الأسرع والأكثر دقة من xAI دليل Grok Voice Think Fast 2.0: المعايير، التسعير، الدقة والترحيل يعمل إصدار xAI Grok Voice Think Fast 2.0 على تحسين الاستدلال الصوتي، ودقة النسخ، وأداء الوكيل، وزمن الاستجابة. اطّلع على المعايير، والتسعير، ونتائج Starlink، وتفاصيل الترحيل في 5 أغسطس. Grok Voice Think Fast 2.0، وكيل xAI الصوتي، واجهة برمجة تطبيقات Grok Voice، الذكاء الاصطناعي الصوتي، نموذج الوكيل الصوتي، تسعير Grok Voice، معايير الذكاء الاصطناعي الصوتي، النسخ

发布于 2026年7月30日generalGEO 评分: 04 次阅读
Grok Voice Think Fast 2.0: نموذج الوكيل الصوتي الأسرع والأكثر دقة من xAI

Grok Voice Think Fast 2.0: نموذج العامل الصوتي الأسرع والأكثر دقة من xAI

مقدمة

أصدرت xAI نموذج Grok Voice Think Fast 2.0، وهو الجيل التالي من نموذج تحويل الصوت إلى صوت لتطوير العوامل الصوتية الفورية.

يركز الإصدار الجديد على أهم أربعة جوانب في أنظمة الصوت الإنتاجية: مستوى الذكاء، دقة النسخ، السلوك الحواري، واستدعاء الأدوات الموثوق. تقول xAI إنه في معظم الحالات، يمكن ترحيل التطبيقات الحالية إلى النموذج الجديد دون الحاجة إلى إعادة كتابة التعليمات.

يبلغ تسعير Think Fast 2.0 0.08 دولار أمريكي لكل دقيقة صوتية. يمكن للمطورين استخدام اسم النموذج المُرقّم grok-voice-think-fast-2.0، بينما من المقرر أن يتحول الاسم المستعار grok-voice-latest من الإصدار 1.0 إلى الإصدار 2.0 في 5 أغسطس 2026.

صُمم هذا النموذج خصيصاً لأعباء العمل الفعلية للعوامل الصوتية، مثل دعم العملاء والمبيعات وأتمتة الهواتف وسير العمل التجاري متعدد الخطوات - حيث يجب على العامل فهم الصوت والاستدلال واستدعاء الأدوات والاستجابة بسرعة للحفاظ على سير المحادثة الطبيعية بسلاسة.

تحسن شامل لـ Grok Voice Think Fast 2.0 في معايير الصوت الرئيسية

نشرت xAI نتائج المعايير من Artificial Analysis، وقارنت Think Fast 2.0 مع سابقه ومع GPT-Realtime-2.1 من OpenAI و Gemini 3.1 Flash من Google.

لقطة شاشة لتغريدة من SpaceX AI حول Grok Voice Think Fast 2.0. يُظهر المحتوى أن النموذج هو الجيل التالي من النماذج الصوتية مع تحسينات في الذكاء ودقة النسخ والقدرات الحوارية. يقارن الجدول أداء Grok Voice Think Fast 2.0 و Think Fast 1.0 و GPT-Realtime-2.1 (عالٍ) و Gemini 3.1 Flash (عالٍ) في عدة جوانب، مثل مؤشر جودة الصوت الصوتي AA والاستدلال الصوتي والديناميكيات الحوارية وأداء العامل والسرعة، حيث يتفوق Grok Voice Think Fast 2.0 في العديد من المؤشرات، مثل مؤشر جودة الصوت الصوتي AA بنسبة 82.9% وسرعة 0.70 ثانية وغيرها. تتناسب الصورة مع محتوى مقارنة أداء Grok Voice Think Fast 2.0 في المستند.

النتائج المبلغ عنها كالتالي:

المعيار Grok Voice Think Fast 2.0 Think Fast 1.0 GPT-Realtime-2.1 عالٍ Gemini 3.1 Flash عالٍ
مؤشر جودة الصوت إلى الصوت من AA 82.9% 75.7% 79.1% 69.5%
Big Bench الصوتي 97.2% 97.1% 96.0%
96.6%
اختبار الازدواج الكامل 95.1% 77.8% 95.7% 74.3%
اختبار τ-الصوتي 56.5% 52.1% 45.7% 37.7%
زمن استجابة الصوت الأول 0.70 ثانية 1.25 ثانية 2.98 ثانية

مقارنة بـ Think Fast 1.0، ارتفع مؤشر جودة الصوت إلى الصوت الإجمالي من 75.7% إلى 82.9%.

أكثر التغييرات العملية وضوحاً هي في الديناميكيات الحوارية وأداء العامل وزمن الاستجابة.

الاستدلال الصوتي

في اختبار Big Bench الصوتي، سجل Think Fast 2.0 97.2%، وهو أعلى قليلاً فقط من 97.1% للجيل السابق.

يشير هذا إلى أن هذا الإصدار لا يركز بشكل أساسي على قفزة هائلة في قدرة الاستدلال الصوتي الخام. بدلاً من ذلك، تتركز معظم التحسينات في سلوك النموذج أثناء المحادثة الفورية.

الديناميكيات الحوارية

وصل Think Fast 2.0 إلى 95.1% في اختبار الازدواج الكامل، بينما كان Think Fast 1.0 عند 77.8%.

يقيم اختبار الازدواج الكامل سلوكيات مثل: توقيت التحدث، التعامل مع التوقفات، التعامل مع المقاطعات، التعرف على إشارات التغذية الراجعة، والحفاظ على تبادل الأدوار الطبيعي.

سجل GPT-Realtime-2.1 العالي أعلى قليلاً في هذا الاختبار الفردي عند 95.7%، لذا فإن نموذج xAI ليس متقدماً في جميع الفئات.

أداء العامل

في اختبار τ-الصوتي الذي يركز أكثر على تقييم قدرة العامل الصوتي على إنجاز المهام الفعلية، سجل Think Fast 2.0 56.5%.

هذه النتيجة أعلى من 52.1% لـ Think Fast 1.0 و 45.7% لـ GPT-Realtime-2.1 العالي و 37.7% لـ Gemini 3.1 Flash العالي.

يعتبر هذا المؤشر مهماً بشكل خاص لوكلاء خدمة العملاء والمبيعات، لأن مجرد امتلاك صوت محادثة جيد النوعية لا يكفي. يحتاج النظام أيضاً إلى اتباع التعليمات بشكل صحيح، استدعاء الأدوات، جمع المعلومات، وإكمال سير العمل.

زمن استجابة الصوت الأول الأسرع

أبلغت xAI أن زمن استجابة الصوت الأول هو 0.70 ثانية، وهو أقل من 1.25 ثانية لـ Think Fast 1.0.

يقلل زمن الاستجابة المنخفض من الصمت المحرج بين انتهاء المستخدم من الكلام وبدء رد الذكاء الاصطناعي.

يصنف التحليل الذكي حالياً Think Fast 2.0 كأحد أنظمة الصوت إلى الصوت الأسرع استجابةً التي تم قياسها، على الرغم من أنه ليس أسرع نموذج في القائمة بأكملها.

تحسن دقة النسخ عبر 24 لغة

اختبرت xAI أيضاً Think Fast 2.0 باستخدام آلاف عينات الصوت القصيرة المغطية لـ 24 لغة.

وفقاً للشركة، في تقييماتها، كانت دقة النسخ للنموذج الجديد أعلى بحوالي 1.5 إلى 2.0 مرة من Deepgram Nova 3 و ElevenLabs Scribe v2، وأعلى بحوالي 1.4 مرة من Grok Voice Think Fast 1.0.

وأشار أيضًا إلى أن الفجوة قد تصل إلى حوالي 10 أضعاف في بيئات الضوضاء وضغط المكالمات الهاتفية.

تعتمد هذه البيانات على تقييمات النسخ الخاصة بـ xAI، وليس على جداول معايير تحليل الذكاء الاصطناعي. وهذا التمييز مهم لأن مقارنات المعايير والتجارب الصوتية تقيس مؤشرات مختلفة وتأتي من إعدادات تقييم مختلفة.

التركيز على الصوت المزعج له أهمية كبيرة لوكلاء الصوت في بيئات الإنتاج. فالمكالمات الحقيقية غالباً ما تتضمن ضغط شبكات الجوال، وميكروفونات رديئة الجودة، وضوضاء الطريق أو المكتب، واللهجات، والسرعة في الكلام، والمقاطعات، والجمل غير المكتملة، وأسماء الأشخاص والعناوين وتفاصيل الحسابات.

النموذج يفكر أثناء التحدث

أحد خيارات التصميم الفريدة نسبياً في Grok Voice Think Fast هو الاستدلال المتوازي.

xAI

يمكن للنموذج مواصلة الاستدلال أثناء التحدث، بدلاً من إكمال كل الاستدلال قبل توليد الصوت. يهدف هذا التصميم إلى تقليل المفاضلة بين الذكاء وزمن الاستجابة.

يستخدم Think Fast 2.0 عدداً أقل من رموز الاستدلال مقارنة بالجيل السابق. فيما يلي الاستخدام النسبي الوسيط لرموز الاستدلال كما أبلغت عنه xAI:

النموذج عدد رموز الاستدلال النسبي لكل استجابة
Grok Voice Think Fast 2.0 0.4×
Grok Voice Think Fast 1.0 1.0×

تقول الشركة إن هذا يسرّع استدعاء الأدوات، مما يسمح عادةً بتنفيذ الأداة قبل أن ينهي المساعد الذكي جملته الأولى.

على سبيل المثال، قد يبدأ وكيل خدمة العملاء بقوله "دعني أتحقق من ذلك..."، وفي الوقت نفسه يستدعي أداة الاستعلام عن الحساب في الخلفية. وعندما ينتهي التعليق الصوتي التمهيدي، قد تكون نتيجة الأداة جاهزة للاستخدام في الجزء التالي من الرد.

التعلم التعزيزي يجعل الحوار أكثر إيجازاً

تقول xAI إن Think Fast 2.0 تم تدريبه من خلال قدر كبير من التعلم التعزيزي ليجعله في الحوارات الحقيقية أشبه بوكيل بشري عملي.

يتم تشجيع النموذج على استخدام جمل أقصر، وطرح سؤال واحد فقط في كل مرة، وتجنب كلمات الحشو غير الضرورية، والحفاظ على تركيز الحوار، وعدم الكشف عن التعقيدات غير الضرورية عند توجيه المستخدم عبر العمليات المعقدة.

قد يبدو هذا مجرد تغيير بسيط، لكن واجهات الصوت تقلّص تحملها للردود الطويلة بكثير مقارنة بالدردشة النصية. فالردود الطويلة قد تكون مقبولة على الشاشة، لكن الاستماع إليها في مكالمة هاتفية يكون محبطاً.

استخدام الأدوات هو جزء أساسي من واجهة برمجة التطبيقات الصوتية

تدعم واجهة برمجة التطبيقات من الصوت إلى الصوت الحالية من xAI أنواعاً متعددة من الأدوات مباشرة ضمن جلسة الصوت:

  • file_search
  • web_search
  • x_search
  • أدوات MCP عن بعد
  • دوال مخصصة

وهذا يمكّن المساعدين الصوتيين الذكيين من تجاوز مجرد الأسئلة والأجوبة البسيطة.

وفقاً للأذونات التي يوفرها التطبيق، يمكن للمساعد الذكي فهم طلب المتصل، والبحث في المستندات المعتمدة، والاستعلام عن معلومات الحساب، واستدعاء واجهات برمجة تطبيقات الأعمال، وتنفيذ العمليات المسموح بها، وشرح النتائج صوتياً.

بالنسبة لبيئات الإنتاج، لا يزال يتعين على التطبيقات وضع حدود صارمة للأذونات. فحتى لو كان النموذج قادراً على استدعاء أدوات حساسة، لا ينبغي منحه حق الوصول إليها مباشرة.

Starlink تختبر Think Fast 2.0 بتقسيم A/B

يُستخدم Grok Voice بالفعل في سير عمل المبيعات وخدمة العملاء عبر الهاتف في Starlink.

تقول xAI إنها أجرت اختبار A/B لـ Think Fast 2.0 على خطوط هاتف Starlink عبر الرقم +1 888 GO STARLINK.

أفادت الشركة بوجود تحسن ملحوظ في معدلات تحويل المبيعات وحل مشكلات خدمة العملاء.

لم تعلن xAI عن النسبة المئوية المحددة للتحسن من اختبار A/B لـ Think Fast 2.0 في بيانها الصحفي.

لا ينبغي الخلط بين هذا وبين البيانات المنشورة سابقاً حول نشر Think Fast 1.0 الأصلي. حيث أبلغت xAI آنذاك عن معدل تحويل مبيعات بنسبة 20% ومعدل حل مستقل لمشكلات خدمة العملاء بنسبة 70%. أما إعلان الإصدار 2.0 فيقول فقط إن الإصدار الجديد حسّن النتائج الحالية لـ Starlink.

التسعير: 0.08 دولار للدقيقة

تدرج صفحة التسعير الرسمية لـ xAI:

النموذج الصوتي سعر الصوت
grok-voice-think-fast-1.0 0.05 دولار/الدقيقة
grok-voice-think-fast-2.0 0.08 دولار/الدقيقة

وبالتالي، فإن تكلفة الصوت لـ Think Fast 2.0 تبلغ 4.80 دولاراً للساعة، وفقاً لأسعار واجهة برمجة التطبيقات المنشورة.

المدخلات النصية لواجهة برمجة التطبيقات من الصوت إلى الصوت تُسعّر بشكل منفصل بسعر 0.004 دولار.

قد تؤدي أدوات الخادم الإضافية أيضاً إلى فرض رسوم مستقلة. على سبيل المثال، تسعّر xAI حالياً البحث على الويب والبحث على X وتنفيذ الكود بمبلغ 5 دولارات لكل 1000 استدعاء أداة.

لذلك، يجب على المطورين حساب التكلفة الإجمالية بناءً على سير العمل الكامل، وليس فقط ضرب سعر الصوت.

grok-voice-latest سيتحول إلى الإصدار 2.0 في 5 أغسطس 2026

يحتاج المطورون الذين يستخدمون بالفعل واجهة برمجة تطبيقات Grok الصوتية إلى الانتباه إلى اسم النموذج المستعار.

يشير التوثيق الحالي إلى أن:

grok-voice-latest

يشير إلى:

grok-voice-think-fast-1.0

حتى 5 أغسطس 2026.

في 5 أغسطس 2026، سيتحول هذا الاسم المستعار تلقائياً إلى:

grok-voice-think-fast-2.0

التطبيقات التي تستخدم grok-voice-latest ستحصل على الترقية دون أي تغييرات.

ومع ذلك، يجب على الفرق التي تحتاج إلى سلوك مستقر أن تحدّد الإصدار بشكل صريح.

للبقاء على الإصدار 1.0:

grok-voice-think-fast-1.0

لتبني النموذج الجديد فوراً:

grok-voice-think-fast-2.0

تحديد الإصدار مهم بشكل خاص للأنظمة الإنتاجية التي لديها سير عمل تنظيمي، أو خطوط أساس تقييم ثابتة، أو احتياجات إدارة التغيير.

النصوص التوجيهية الحالية لا تحتاج عادةً إلى تغيير

تقول xAI إن Think Fast 2.0 مصمم لتحسين معظم التطبيقات الحالية دون الحاجة إلى تعديل النصوص التوجيهية.

وهذا يجعل عملية الترحيل بسيطة نسبياً، لكن فرق الإنتاج لا تزال بحاجة إلى تشغيل اختبارات الانحدار.

قد يؤثر ترقية النموذج الصوتي على طول الردود، والتوقيت، وتبادل الأدوار، وتكرار استدعاء الأدوات، وأسئلة التوضيح، وآليات التصعيد، والنسخ، والنطق، وجمع البيانات المنظمة.

سير العمل المعقول للترحيل هو:

  1. تثبيت النموذج الحالي 1.0.
  2. تشغيل نفس حوارات الاختبار على الإصدار 2.0.
  3. مقارنة معدل نجاح المهام مع استخدام الأداة.
  4. اختبار الصوت المزعج وجودة الصوت الهاتفي.
  5. التحقق من معالجة المقاطعات.
  6. مراجعة زمن الاستجابة.
  7. قياس التكلفة لكل مهمة مكتملة.
  8. ترحيل حركة المرور الإنتاجية تدريجياً.

الحد الأدنى من اتصال Grok الصوتي

لم يتضمن تقرير AIBase الأصلي أي كود، لكن وثائق xAI الرسمية تقدم مثالاً بسيطاً لاتصال WebSocket بواجهة برمجة التطبيقات من الصوت إلى الصوت.

اختيار النموذج عبر عنوان URL لـ WebSocket:

MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"

بعد ذلك، يمكن للجلسة تعريف الصوت والتعليمات واكتشاف تبادل الأدوار:

session_config = {
    "type": "session.update",
    "session": {
        "voice": "eve",
        "instructions": "أنت مساعد دعم عملاء مقتضب.",
        "turn_detection": {
            "type": "server_vad"
        }
    }
}

بالنسبة لعملاء المتصفح أو الجوال، توصي xAI باستخدام رموز مميزة مؤقتة بدلاً من كشف مفاتيح API طويلة الأجل للعميل. يمكن لتطبيقات الخادم المصادقة عبر مفتاح API في رأس التفويض.

تنسيقات الصوت المدعومة

تدعم واجهة برمجة التطبيقات من الصوت إلى الصوت حالياً:

التنسيق الاستخدام النموذجي
PCM صوت عالي الجودة للأغراض العامة
G.711 μ-law / audio/pcmu صوت الهاتف
G.711 A-law / audio/pcma أنظمة الهاتف
Opus صوت حي مضغوط

يدعم PCM بدءاً من 8

معدلات أخذ عينات متعددة تتراوح من كيلوهرتز إلى 48 كيلوهرتز.

للتطبيقات الصوتية العامة، توصي الوثائق الرسمية افتراضيًا باستخدام PCM بتردد 24 كيلوهرتز. يُعد الدعم الأصلي لـ G.711 مفيدًا لأنظمة الهاتف، حيث يمكن أن يقلل من الحاجة إلى إعادة الترميز الإضافية في بعض أنظمة الهاتف.

السيناريوهات الأنسب لتطبيق Think Fast 2.0

يستهدف هذا الإصدار بشكل أساسي سير عمل الوكلاء الصوتيين في الوقت الفعلي، وليس مجرد النسخ الصوتي البسيط دون اتصال.

دعم العملاء

يمكن للنموذج الاستماع إلى أسئلة العملاء، والبحث في المعلومات المعتمدة، واستخدام أدوات الحساب، وإتمام عمليات استكشاف الأخطاء وإصلاحها متعددة الخطوات.

المبيعات الهاتفية

يمكن للوكلاء الصوتيين الإجابة على الأسئلة، وتحديد العملاء المحتملين، واستخدام أدوات المبيعات، وتوجيه المتصلين خلال عملية الشراء.

وكلاء الحجز والمواعيد

يمكن للنظام جمع معلومات التاريخ والوقت والاسم والتفضيلات أثناء استدعاء واجهات برمجة تطبيقات الجدولة.

المساعد الداخلي للمؤسسات

يمكن للموظفين التفاعل مع أنظمة المؤسسة عبر الصوت، بينما يقوم النموذج باستدعاء الأدوات الداخلية أو البحث في قاعدة المعرفة المعتمدة.

خدمات الصوت متعددة اللغات

يدعم منصة Grok Voice من xAI أكثر من 25 لغة، مما يجعل هذا النموذج مناسبًا لأعمال الدعم العالمية.

ما لا يزال يتعين على المطورين اختباره بأنفسهم

بيانات الاختبارات المعيارية مفيدة، لكنها لا تحدد ما إذا كان النموذج مناسبًا لتطبيق معين.

قبل النشر في بيئة الإنتاج، يرجى اختبار لهجات المتصلين الحقيقيين، وبرامج ترميز الصوت الهاتفي، وضوضاء الخلفية، وأسماء المنتجات، وأسماء العملاء، والعناوين، وأرقام الحسابات الطويلة، والمقاطعات، والصمت، وتغيير رأي المستخدم، وأعطال الأدوات، ونتائج الأدوات الخاطئة، وشروط التحويل اليدوي، وقواعد الأمان أو الامتثال.

قيمة زمن الاستجابة الأولى للصوت البالغة 0.70 ثانية تكون ذات قيمة فقط إذا كان الرد صحيحًا. وبالمثل، لا يضمن الحصول على درجات عالية في الاختبارات المعيارية أن الوكيل سيتبع سياسة استرداد الأموال الخاصة بالشركة أو سيدخل اسم عميل غير شائع بدقة.

الأسئلة الشائعة

ما هو Grok Voice Think Fast 2.0؟

Grok Voice Think Fast 2.0 هو الجيل الجديد من نماذج الصوت إلى الصوت من xAI، المصمم خصيصًا للوكلاء الصوتيين في الوقت الفعلي. فهو يجمع بين التفاعل الصوتي الأصلي والاستدلال وتناوب المحادثة والنسخ واستخدام الأدوات.

كم تبلغ تكلفة Grok Voice Think Fast 2.0؟

تسعّر xAI هذا النموذج بسعر 0.08 دولار أمريكي للدقيقة من الصوت، أي ما يعادل 4.80 دولارًا أمريكيًا للساعة. قد تؤدي استدعاءات الأدوات وبعض وظائف واجهة برمجة التطبيقات الأخرى إلى رسوم إضافية.

هل Think Fast 2.0 أسرع من Think Fast 1.0؟

نعم. تشير تقارير xAI و Artificial Analysis إلى انخفاض زمن الاستجابة الأولى للصوت من 1.25 ثانية إلى 0.70 ثانية.

هل هو أفضل من GPT-Realtime-2.1؟

في المؤشر الإجمالي لجودة الصوت إلى الصوت لـ Artificial Analysis واختبار معيار τ-voice agent، سجل Think Fast 2.0 درجات أعلى في المقارنات المنشورة. لا يزال GPT-Realtime-2.1 High متفوقًا قليلاً في اختبار الاتصال ثنائي الاتجاه الكامل، لذا فإن Think Fast 2.0 ليس الأفضل في جميع المؤشرات الفردية.

هل أحتاج إلى إعادة كتابة التعليمات النصية للإصدار 2.0؟

تشير xAI إلى أن معظم التطبيقات لا تحتاج إلى تغيير التعليمات النصية للحصول على تحسن في الأداء. لا يزال على فرق الإنتاج إجراء اختبارات الانحدار، لأن التوقيت واستخدام الأدوات وأساليب تناوب المحادثة وأسلوب الرد قد تختلف بين إصدارات النموذج.

متى سيتحول grok-voice-latest إلى Think Fast 2.0؟

تشير xAI إلى أن هذا الاسم المستعار سيتحول تلقائيًا في 5 أغسطس 2026.

يجب على المطورين الذين يحتاجون إلى الاستمرار في استخدام الإصدار 1.0 تثبيت grok-voice-think-fast-1.0.

هل يمكن لـ Grok Voice Think Fast 2.0 استدعاء الأدوات؟

نعم. تدعم واجهة برمجة تطبيقات الصوت إلى الصوت الحالية الوظائف المخصصة، والبحث في الملفات، والبحث على الويب، والبحث على X، وأدوات MCP عن بُعد.

هل Think Fast 2.0 مخصص فقط لدعم العملاء؟

لا. دعم العملاء والمبيعات هما سيناريوهان نموذجيان، ولكن يمكن استخدام النموذج أيضًا في سير عمل وكلاء الصوت في الوقت الفعلي الأخرى، مثل خدمات الحجز والمساعدين المؤسسيين والتطبيقات التفاعلية.

الأدوات ذات الصلة

  • Grok Voice Think Fast 2.0: الإعلان الرسمي لـ xAI عن نموذج الصوت الرئيسي الجديد.
  • Grok Voice API: الوثائق الرسمية لواجهة برمجة تطبيقات الصوت إلى الصوت، تغطي اختيار النموذج، وتنسيقات الصوت، والأدوات، وإعدادات الجلسة.
  • Grok Voice Agent Builder: بيئة بدون كود من xAI لبناء وكلاء صوتيين للإنتاج.
  • Artificial Analysis Speech-to-Speech Leaderboard: مقارنة معيارية مستقلة تغطي الاستدلال الصوتي، وديناميكيات المحادثة، وأداء الوكيل، والسرعة، والتسعير.
  • Deepgram Nova: منصة التعرف على الصوت التي تم الرجوع إليها في مقارنة النسخ من xAI.
  • ElevenLabs: منصة الذكاء الاصطناعي الصوتي، تم تضمين نموذجها Scribe في تقييمات النسخ من xAI.

الروابط ذات الصلة

  • Introducing Grok Voice Think Fast 2.0: إعلان الإصدار الرسمي، يتضمن الاختبارات المعيارية، ونتائج النسخ، وكفاءة الاستدلال، واختبارات Starlink، والترحيل، والتسعير.
  • Speech-to-Speech API Docs: دليل التنفيذ الرسمي لتطبيقات Grok Voice في الوقت الفعلي.
  • xAI API Pricing: التسعير الحالي للصوت، والصوت إلى نص، والنص إلى صوت، والأدوات.
  • Artificial Analysis Speech-to-Speech Models: بيانات المعايير المستقلة المستخدمة في مقارنة إصدار xAI.
  • Grok Voice Think Fast 1.0: نموذج الجيل السابق ونتائج إنتاجه على Starlink.
  • Grok Voice Agent Builder: معلومات رسمية حول الهاتف، والأدوات، والحواجز، والمراقبة، ودعم SIP، وتكوين الوكيل.
  • Grok Speech-to-Text and Text-to-Speech APIs: تفاصيل رسمية حول واجهات برمجة تطبيقات الصوت المستقلة من xAI.

الملخص

يعمل Grok Voice Think Fast 2.0 على تحسين مجموعة تقنيات الصوت في الوقت الفعلي من xAI في المجالات الأكثر أهمية للوكلاء الإنتاجيين: إنجاز مهام الوكيل، وديناميكيات المحادثة، ودقة النسخ، وزمن الوصول.

يسجل هذا النموذج 82.9% في مؤشر جودة الصوت إلى الصوت لـ Artificial Analysis، ودرجة 56.5% في اختبار τ-voice، وزمن استجابة أول للصوت يبلغ 0.70 ثانية. أفادت xAI أيضًا بتحسن أداء النموذج في نسخ 24 لغة، وكفاءة استدلال أعلى، مما يسمح بتنفيذ استدعاءات الأدوات في وقت مبكر أثناء الردود الصوتية.

يمكن للمطورين الآن استخدام النموذج بسعر 0.08 دولار أمريكي للدقيقة من الصوت. يجب على المستخدمين

الحاليين أيضًا ملاحظة أن grok-voice-latest من المقرر أن يتحول تلقائيًا من Think Fast 1.0 إلى Think Fast 2.0 في 5 أغسطس 2026.

هذه الترقية ليست مجرد نموذج صوتي أكثر ذكاءً، بل هي وكيل أكثر توجهاً نحو الإنتاج قادر على الاستماع والاستدلال والمحادثة واستدعاء الأدوات بزمن وصول أقل.