معاينة Tencent Hunyuan Hy ASR 3.0: التعرف على الكلام المدرك للسياق للغة الماندرين والإنجليزية و20 لهجة

أصدرت Tencent Hunyuan معاينة Hy ASR 3.0، وهو نموذج جديد للتعرف على الكلام في الوقت الفعلي مبني على قدرات الفهم اللغوي لـ Hy3. يهدف هذا النموذج إلى تحسين دقة التعرف، خاصة في السيناريوهات متعددة اللغات واللهجات، مع الاستفادة الكاملة من معلومات السياق لتعزيز أداء التعرف على الكلام.

发布于 2026年8月5日generalGEO 评分: 015 次阅读
هذه صورة توضيحية مصاحبة لدليل معاينة Tencent Hunyuan Hy ASR 3.0، بتصميم تقني بألوان زرقاء داكنة. تتضمن العناصر البصرية عنوانًا بارزًا في المنتصف بعبارة 'Hy ASR 3.0 Preview Guide'، وتحته وحدات أساسية مثل WER والتعرف السياقي واللهجات وAPI والحدود. على الجانب الأيسر توجد أيقونات موجات صوتية وميكروفون، وعلى الجانب الأيمن توجد واجهة API بأيقونات أكواد برمجية وأيقونات عقد مرتبطة بلغات متعددة، مما يعكس الخصائص الأساسية المذكورة في العنوان بأن النموذج يدعم الماندرين والإنجليزية و20 لهجة ويتميز بقدرة التعرف على الكلام المدرك للسياق.

معاينة Tencent Hunyuan Hy ASR 3.0: تعرّف على الكلام، لكنها تفهم السياق أيضًا

مقدمة

أصدرت Tencent Hunyuan معاينة Hy ASR 3.0، وهو نموذج جديد للتعرف على الكلام في الوقت الفعلي مبني على قدرات الفهم اللغوي Hy3.

يهدف هذا النموذج إلى دفع التعرف التلقائي على الكلام إلى ما هو أبعد من فك الترميز الصوتي المعزول.

تتسم أنظمة التعرف التلقائي على الكلام التقليدية بالإجابة على سؤال واحد:

ما السلسلة الأكثر تطابقًا مع هذا المقطع الصوتي؟

يضيف Hy ASR 3.0 سؤالًا ثانيًا:

في السياق، ما النسخة الأكثر منطقية من التفريغ النصي؟

هذا الفرق بالغ الأهمية عندما يحتوي الصوت على:

  • الكلمات المتجانسة لفظًا.
  • اللهجات الإقليمية.
  • اللغات المحلية.
  • خلط اللغة الصينية والإنجليزية.
  • أسماء المنتجات والأشخاص.
  • الضوضاء الخلفية.
  • الهمس أو الكلام منخفض الصوت.
  • الجمل الطويلة أو العبارات التي تعتمد بشكل كبير على السياق الدلالي.

صرّحت Tencent أن النموذج يجمع بين نظام صوتي عالي الدقة وقدرات النمذجة السياقية والاستدلال الدلالي من Hy3. الهدف ليس إعادة صياغة ما قاله المستخدم بشكل إبداعي، بل اختيار النتيجة الأكثر منطقية للتفريغ النصي عندما يكون الصوت نفسه غامضًا، باستخدام السياق اللغوي.

أفادت Tencent بمعدل خطأ الكلمات بالصينية الماندرين بنسبة 3.34٪، وباللغة الإنجليزية 2.62٪، وباللغة الكانتونية 3.12٪ على مجموعات التقييم العامة المجمّعة.

تتوفر معاينة Hy ASR 3.0 حاليًا كموتور WebSocket في الوقت الفعلي من Tencent Cloud مع توثيق رسمي، وقد تم دمجها في مساعد Tencent Yuanbao. ويتم حاليًا دمج WorkBuddy ومنتجات Tencent الأخرى تدريجيًا.

المعاينة العامة متاحة بالفعل، لكنها لم تصل بعد إلى الشكل النهائي للمنتج كما هو موصوف في الإعلانات الأوسع. وقيود واجهة برمجة التطبيقات الحالية تستحق الاهتمام من الفرق التي تخطط لدمجها في بيئات الإنتاج.

النتائج المنشورة لمعايير التقييم العامة

قامت Tencent بتقييم معاينة Hy ASR 3.0 على مجموعات بيانات صوتية عامة متعددة وقارنتها مع أنظمة التعرف التلقائي على الكلام الأخرى.

معدل أخطاء الكلمات المجمع الذي أبلغت عنه الشركة هو كما يلي:

اللغة أو اللهجة معدل خطأ الكلمات في معاينة Hy ASR 3.0
الماندرين 3.34٪
الإنجليزية 2.62٪
الكانتونية 3.12٪

كلما انخفض معدل خطأ الكلمات، كان ذلك أفضل.

صورة توضح مقارنة معدل أخطاء الكلمات (WER٪) لمعاينة Hy ASR 3.0 بالصينية والإنجليزية والكانتونية، حيث بلغ 3.34٪ للصينية و2.62٪ للإنجليزية و3.12٪ للكانتونية. كما تعرض معدلات أخطاء أنظمة أخرى مثل Doubao-Seed-ASR 2.0 وQwen 3 ASR وQwen-audio-3.0-ASR Flash. مع ملاحظة أسفل الصورة أن القيم الأقل تعني دقة أعلى، وأن البيانات من مجموعات تقييم مفتوحة المصدر مع أسماء مجموعات البيانات لكل لغة.

تشير الملاحظات على الرسم البياني إلى أن التقييم المجمع استخدم مجموعات البيانات التالية:

  • WenetSpeechMeeting.
  • WenetSpeechNet.
  • FLEURS الصينية.
  • LibriSpeech clean.
  • LibriSpeech other.
  • FLEURS الإنجليزية.
  • MLS الإنجليزية.
  • FLEURS الكانتونية.
  • Common Voice الكانتونية.

البيانات المجمّعة مفيدة للمقارنات الواسعة، لكنها قد تخفي فروقًا مهمة.

قد يختلف أداء النموذج عبر السيناريوهات المختلفة:

  • الكلام المقروء مقابل المحادثة العفوية.
  • الميكروفونات القريبة مقابل الميكروفونات البعيدة.
  • صوت الاستوديو النظيف مقابل ضوضاء الشارع.
  • الأوامر القصيرة مقابل النقاشات المستمرة.
  • المتحدثون الأصليون مقابل الكلام باللهجات.
  • الماندرين الرسمي مقابل تبديل اللغات.

لذلك، يجب على فرق الإنتاج اختبار النماذج باستخدام ملفاتها الصوتية الخاصة.

بدلاً من الاعتماد فقط على رقم معدل خطأ الكلمات الوارد في عنوان واحد لاختيار نموذج التعرف التلقائي على الكلام.

ماذا يقيس معدل خطأ الكلمات

يُعرَّف معدل خطأ الكلمات عادةً على النحو التالي:

WER = (الاستبدال + الحذف + الإدراج) / عدد الكلمات المرجعية

الأنواع الثلاثة للأخطاء هي:

  • الاستبدال: أخرج النموذج كلمة خاطئة.
  • الحذف: تم حذف كلمة منطوقة من النص المفرّغ.
  • الإدراج: يحتوي النص المفرّغ على كلمة لم تُنطق.

يشير انخفاض معدل خطأ الكلمات عادةً إلى دقة أفضل في التفريغ النصي.

ومع ذلك، لا يغطي معدل خطأ الكلمات جميع حالات الفشل في السيناريوهات العملية.

لنأخذ مثالين لخطأ في كلمة واحدة:

"Ship the order tomorrow"
← "Ship the order today"

وأيضًا:

"The color is navy blue"
← "The colour is navy blue"

قد يولّد المثالان عددًا مشابهًا من الأخطاء، لكن الأول قد يغيّر إجراءً تجاريًا، بينما قد لا يكون للثاني أي تأثير على العمل.

بالنسبة للمجالات مثل خدمة العملاء والرعاية الصحية والتمويل والتصنيع وواجهات الأوامر، يجب على الفرق تقييم التأثير الدلالي جنبًا إلى جنب مع معدل خطأ الكلمات.

تقييم السيناريوهات الداخلية في Tencent

نشرت Tencent أيضًا نتائج مجموعات التقييم الداخلية التي تغطي أربع فئات عملية:

  1. التعرف العام على الكلام.
  2. التعرف على اللهجات.
  3. الفهم السياقي.
  4. الظروف الصوتية المعقدة مثل الضوضاء العالية والهمس.

النتائج المبلغ عنها هي كما يلي:

فئة التقييم الداخلي معدل خطأ الكلمات في معاينة Hy ASR 3.0
التعرف العام 4.95٪
التعرف على اللهجات 9.31٪
التقييم السياقي 4.76٪
الظروف الصوتية المعقدة 6.36٪

هذا الرسم البياني الشريطي يعرض معدل أخطاء الكلمات (WER) لأنظمة التعرف على الكلام الأربعة ومنها Tencent Hunyuan Hy ASR 3.0 على أربع فئات من مجموعات التقييم (كلما انخفضت القيمة زادت الدقة): مجموعة التقييم العامة، مجموعة تقييم اللهجات، مجموعة تقييم السياق، مجموعة تقييم السيناريوهات الصوتية المعقدة (الضوضاء العالية/الهمس). في مجموعة التقييم العامة، بلغ معدل WER لهذا النظام 4.35٪ متفوقًا على الأنظمة الثلاثة الأخرى؛ وفي باقي المجموعات كان معدل WER لهذا النظام الأدنى أيضًا بين الفئات الأربع، حيث بلغ 9.31٪ لمجموعة اللهجات، و4.25٪ لمجموعة السياق، و6.36٪ لمجموعة السيناريوهات الصوتية المعقدة. نتائج التقييم الداخلي المعروضة في هذا الشكل تتوافق مع المهام الأربع المذكورة في وثيقة تقييم معاينة Hy ASR 3.0 الداخلي من Tencent.

صرّحت Tencent أن معاينة Hy ASR 3.0 حققت أقل معدل خطأ كلمات بين الأنظمة المقارنة في جميع الفئات الداخلية الأربع.

هذه النتائج مفيدة كدليل على أداء المنتج كما تقدمه الشركة، لكن مجموعات الاختبار الداخلية ليست معايير عامة محايدة.

قبل التبني، يجب على المؤسسات أن تسأل:

  • ما اللهجات والمناطق التي غطاها الاختبار؟
  • ما مستوى الضوضاء في الصوت؟
  • كيف تمت معايرة علامات الترقيم؟
  • هل تم توحيد الأرقام والمصطلحات الإنجليزية قبل التقييم؟
  • هل تم تكوين الأنظمة المقارنة بكلمات ساخنة أو سياق؟
  • كم عدد العينات الصوتية المستخدمة؟
  • هل شمل الاختبار الميكروفونات وقنوات الصوت التي تستخدمها المؤسسة فعليًا؟

أربعة تحسينات موجهة للمستخدم

تلخّص Tencent التحسينات العملية في أربعة مجالات.

1. تعرف عام أكثر دقة

يهدف النموذج إلى تحسين التعرف في السيناريوهات التالية:

  • الماندرين القياسي.
  • الإنجليزية.
  • الكانتونية.
  • اللهجات الإقليمية.
  • خلط الصينية والإنجليزية.
  • مختلف المتحدثين واللهجات.

كما ذكرت Tencent أن النموذج يقلل من الأخطاء التراكمية في العبارات الطويلة.

هذا الادعاء يصف القدرة الأساسية للنموذج. ومع ذلك، فإن معاينة Tencent Cloud الحالية لا تزال تحدّ من مدخلات واجهة برمجة التطبيقات العامة الواحدة بـ 60 ثانية، لذا يجب على التطبيقات التي تتعامل مع الاجتماعات أو التسجيلات الصوتية حاليًا تقسيم الصوت.

وإدارة السياق عبر المقاطع الصوتية بنفسها.

قد يؤدي التقسيم السيئ إلى إعادة إدخال المشاكل التي صُمم النموذج لحلها.

على سبيل المثال، قد يؤدي قطع الصوت عند حدود الستين ثانية إلى اقتطاع:

  • الاسم الكامل لشخص ما.
  • رمز منتج.
  • جملة يتأخر اكتمال معناها الدلالي.
  • عبارة مختلطة بين الصينية والإنجليزية.
  • تصحيح المتحدث الذاتي.

لذلك، يجب أن يحافظ منطق التقسيم قدر الإمكان على حدود الجمل وحدود نشاط الكلام.

2. تحسين السياق والتعرف على النوايا

يحتوي الكلام على العديد من الأصوات الغامضة.

تحتوي اللغة الصينية القياسية على عدد كبير من الكلمات المتجانسة. تحتوي اللغة الإنجليزية على كلمات وأسماء متشابهة في النطق. قد تجعل اللهجات المحلية المرشحين المتعددين للنسخ الصوتي جميعًا معقولين صوتيًا.

قد يختار مفكك التشفير التقليدي الكلمة ذات الاحتمال الأقصى المحلي.

يمكن للأنظمة المدركة للسياق تقييم الكلام الكامل.

على سبيل المثال، قد ينطق المستخدم عبارة يمكن نسخها إلى كلمتين متجانستين مختلفتين. يمكن للكلمات ذات الصلة بالموضوع في الجوار والتي تتعلق بالتمويل أو الألعاب أو الرعاية الطبية أو السفر أن تشير إلى المعنى الأكثر احتمالًا.

يمكن تبسيط خط المعالجة المتوقع على النحو التالي:

ميزات الصوت
← الكلمات المرشحة
← سياق الجملة
← فحص الاتساق الدلالي
← النص النهائي المنسوخ

هذا لا يعني أن النموذج يمكنه فهم الكلام حقًا بنفس الطريقة التي يفهمها البشر.

بل يعني أن مكونات اللغة تستخدم نافذة سياق أوسع والاحتمالات الدلالية لتحسين قرارات النسخ.

تقدم أنظمة ASR المدركة للسياق أيضًا مخاطر جديدة: التصحيح الدلالي المفرط.

قد يستبدل النموذج أحيانًا عبارة نادرة لكن صحيحة النطق بعبارة شائعة تبدو أكثر سلاسة.

لذلك، يجب أن يتضمن التقييم في بيئات الإنتاج ما يلي:

  • أسماء أشخاص نادرة.
  • تعبيرات متعمدة غير مألوفة.
  • مصطلحات منتجات جديدة.
  • اختصارات المجال.
  • جمل متناقضة أو مفاجئة.

الهدف هو استخدام السياق دون اختلاق محتوى كلامي لم يظهر أبدًا.

3. تكيف أسهل مع المفردات المتخصصة

تم إبراز تعزيز الكلمات الساخنة في مواد الإصدار، وينطبق على:

  • أسماء العلامات التجارية.
  • أسماء المنتجات.
  • أسماء الأشخاص.
  • المصطلحات الصناعية.
  • الاختصارات.
  • المفردات الداخلية.

عندما لا يكون تكرار ظهور كلمة نادرة كافيًا في النموذج العام، يمكن للكلمات الساخنة أن تقدم قيمة مهمة.

تتضمن الأمثلة:

أسماء الأدوية المتخصصة
طرازات آلات المصانع
رموز حسابات العملاء
علامات تجارية جديدة
اختصارات تقنية

تتوفر بالفعل واجهة برمجة تطبيقات قائمة الكلمات الساخنة ومعامل hotword_id في منتج ASR العام في تينسنت كلاود.

ومع ذلك، توضح مستندات معاينة Hy ASR 3.0 الحالية بوضوح أن تعزيز الكلمات الساخنة غير متاح حاليًا لمحرك المعاينة هذا.

لذلك، يجب التمييز بين الترويج العام للمنتج وحالة واجهة برمجة التطبيقات التي يمكن الوصول إليها فعليًا:

القدرة ملاحظات إصدار النموذج حالة واجهة برمجة التطبيقات الحالية للمعاينة
تعزيز الكلمات الساخنة موصوفة كقدرة مدعومة مذكورة كقادمة قريبًا
إدخال السياق موصوفة كقدرة رئيسية مذكورة كقادمة قريبًا
النمذجة اللغوية الداخلية للسياق ميزة أساسية للنموذج متاحة من خلال سلوك النموذج

إلى أن تؤكد تينسنت كلاود الدعم في وثائق واجهة برمجة التطبيقات الرسمية، لا ينبغي للمؤسسات وضع خطط إصدار تعتمد على حقن السياق الخارجي أو قوائم الكلمات الساخنة.

4. التعرف الأكثر استقرارًا في ظل الظروف الصوتية الصعبة

صرحت تينسنت بأن النموذج تم تحسينه للظروف التالية:

  • الضوضاء الخلفية العالية.
  • الهمس.
  • الكلام المنخفض.
  • بيئات التسجيل المختلفة.
  • لهجات متعددة.
  • الظروف الصوتية لذيول الصدى الطويلة.

تعتبر المتانة ضد الضوضاء مهمة لأن الكلام الحقيقي نادرًا ما يظهر مثل تسجيلات الاستوديو النظيفة.

قد تلتقط ميكروفونات خدمة العملاء أصوات لوحات المفاتيح وأصوات الزملاء المجاورين.

قد تسمع المساعدات المحمولة ضوضاء المرور أو الرياح أو الموسيقى أو كلام الآخرين.

قد تستقبل تطبيقات المؤتمرات صوتًا مضغوطًا من ميكروفونات أجهزة الكمبيوتر المحمولة البعيدة.

يمكن للنموذج تحسين المتانة، لكنه لا يمكنه استعادة المعلومات التي لم يتم التقاطها أبدًا.

يجب أن تستمر الفرق في استخدام:

  • الميكروفونات المناسبة.
  • إلغاء الصدى.
  • التحكم في الكسب.
  • كشف نشاط الكلام حيثما كان مدعومًا.
  • ضغط صوتي معقول.
  • مراقبة القنوات.
  • عمليات إعادة المحاولة أو التوضيح.

جودة ASR هي خاصية نظامية وليست مجرد خاصية نموذجية.

البنية: Hy3 بالإضافة إلى مشفر صوتي

صرحت تينسنت بأن معاينة Hy ASR 3.0 تجمع بين ثلاثة مكونات رئيسية:

  1. قاعدة نموذج لغوي MoE استنادًا إلى Hy3.
  2. مشفر صوتي غير خاضع للإشراف تم تطويره داخليًا.
  3. التدريب المشترك المسبق والتدريب اللاحق متعدد المراحل.

تعرض هذه الصورة البنية الأساسية وقدرات الترقية لمحرك Hy ASR 3.0 Preview من تينسنت، وتحتوي على ثلاثة أجزاء رئيسية. الجزء الأول هو ترقية البنية، باستخدام Hy3 كقاعدة مع دمج مشفر صوتي مطور ذاتيًا، لتحقيق دفع مزدوج وتعزيز قدرات فهم الكلام. الجزء الثاني هو توسيع نطاق التدريب المسبق، من خلال النمذجة المشتركة لمصادر بيانات متعددة، مع تدريب مشترك للصوت والنموذج اللغوي، وحقن قدرات متعددة المراحل، ودعم التعرف متعدد اللغات والسياقي. الجزء الثالث هو تعزيز التدريب اللاحق، مع التحسين للصوت المعقد وأي سياق، ومن خلال التعلم المعزز متعدد المراحل لتحسين قدرات النموذج، وتحقيق ترقية شاملة للقدرات في النهاية.

Hy3 كقاعدة لغوية

يوفر Hy3 مكون فهم اللغة.

تشمل وظائفه:

  • نمذجة سياق الجملة.
  • تحليل المرشحين الغامضين.
  • فهم الهياكل اللغوية المختلطة.
  • استخدام العلاقات الدلالية.
  • تحسين تماسك المخرجات.

تصف تينسنت هذه البنية بأنها تصميم خليط من الخبراء (MoE) يوازن بين القدرة والكفاءة.

لا تكشف وثائق ASR العامة عن العدد الإجمالي للمعلمات أو عدد المعلمات النشطة أو ملف زمن الاستجابة أو البنية الكاملة للاستدلال في Hy ASR 3.0 Preview.

المشفر الصوتي غير الخاضع للإشراف

يحول المشفر الصوتي الصوت الخام إلى تمثيلات صوتية يمكن للنموذج اللغوي معالجتها.

صرحت تينسنت بأن المشفر تم تدريبه باستخدام عشرات الملايين من الساعات من الكلام غير المصنف.

يعد التدريب الصوتي غير الخاضع للإشراف أو ذاتي الإشراف ذا قيمة لأن النسخ اليدوي لبيانات صوتية بهذا الحجم مكلف للغاية.

يمكن للمشفر تعلم الهياكل المتكررة من الصوت الخام، مثل:

  • أنماط الكلام.
  • الاختلافات بين المتحدثين.
  • اختلافات اللهجات.
  • الظروف الخلفية.
  • التوقيت والعروض.

تؤثر جودة هذا التمثيل على جميع المراحل اللاحقة.

إذا تم الخلط بين صوتين في مرحلة المشفر، يجب على النموذج اللغوي الاعتماد بشكل أكبر على السياق لاستعادة الكلمات الصحيحة.

التدريب المشترك المسبق للصوت واللغة

صرحت تينسنت بأن المشفر الصوتي والنموذج اللغوي تم تدريبهما بشكل مشترك باستخدام مجموعة بيانات صوتية متعددة المصادر واسعة النطاق تغطي:

  • اللهجات.
  • النطقات.
  • البيئات الصوتية.
  • مجموعات مختلفة من المتحدثين.
  • أنماط اللغة السياقية.
  • التدريب المشترك

يهدف التدريب إلى تقليص الفجوة بين التعرف الصوتي والفهم اللغوي.

بدلاً من التعامل مع التعرف على الكلام كالتالي:

اكتمال النموذج الصوتي
← النموذج اللغوي ينظف النص المنسوخ لاحقًا

يتم تقديم Hy ASR 3.0 كعملية أكثر تكاملاً:

التمثيل الصوتي والنمذجة اللغوية
← التدريب يعملان معًا
← إخراج نتيجة نسخ سياقية

الحدود الداخلية الدقيقة بين المشفر وفك التشفير والنموذج اللغوي ومراحل التعلم المعزز لم يتم الكشف عنها بالكامل بعد.

## SFT والتعلم المعزز متعدد المراحل

تصف تينسنت مخطط ضبطًا خاضعًا للإشراف يغطي:

- النسخ العام.
- مهام السياق التعسفي.
- المصطلحات المتخصصة.
- البيئات الصوتية المختلفة.
- مجموعات متنوعة من المتحدثين.
- مناطق اللهجات العشر الكبرى.
- أكثر من 20 منطقة لهجات أصغر.

كما أبلغت الشركة عن استخدام التعلم المعزز متعدد المراحل من أجل:

- دقة النسخ العامة.
- السلوك السياقي.
- الحالات المعقدة طويلة الذيل.
- تقليل أخطاء الاستبدال والحذف.

لا توجد حاليًا ورقة تقنية عامة توفر التصميم الكامل لوظائف المكافأة أو نسب البيانات أو قدرة التدريب الحاسوبية أو نتائج تجارب الإزالة.

لذلك، يجب اعتبار البيانات المعمارية أوصافًا فنية على مستوى المنتج وليست مواصفات بحثية قابلة لإعادة الإنتاج.

## اللغات واللهجات التي يدعمها محرك تينسنت كلاود حاليًا

تصف وثائق تينسنت كلاود المحرك الحالي `Hy-ASR-3.0-preview` بأنه يدعم:

- الصينية القياسية (الماندرين).
- الإنجليزية.
- 20 لهجة صينية أو متغيرات إقليمية.

قائمة اللهجات الموثقة هي كما يلي:

| الرقم | اللهجة أو المتغير الإقليمي |
|-|-|
| 1 | الكانتونية |
| 2 | لهجة شمال شرق الصين |
| 3 | لهجة خنان |
| 4 | لهجة شنشي |
| 5 | لهجة تشنغدو |
| 6 | لهجة تشونغتشينغ |
| 7 | لهجة ووهان |
| 8 | لهجة قوييانغ |
| 9 | لهجة تشينغداو |
| 10 | لهجة جينان |
| 11 | لهجة تشانغشا |
| 12 | لهجة خفي |
| 13 | لهجة خبي |
| 14 | لهجة كونمينغ |
| 15 | لهجة لانتشو |
| 16 | لهجة ينشوان |
| 17 | لهجة نانتشانغ |
| 18 | لهجة بكين |
| 19 | لهجة سيتشوان |
| 20 | لهجة تيانجين |

تعتبر تسميات اللهجات في وثائق ASR التجارية فئات منتجات واسعة.

يختلف النطق الصوتي الحقيقي في كل فئة حسب المدينة والعمر والخلفية الاجتماعية وتبديل الأكواد والمفردات والمتحدث.

لا ينبغي فهم الادعاء بدعم لهجة معينة على أنه يعني نفس مستوى الدقة لكل متحدث في تلك المنطقة.

## التوفر الحالي للإصدار التجريبي

أضافت تينسنت كلاود محرك الإصدار التجريبي من Hy ASR 3.0 إلى منتج WebSocket في الوقت الفعلي في **4 أغسطس 2026**.

يُوصف هذا المنتج العام حاليًا بأنه نسخة اختبار داخلية أو إصدار تجريبي.

| العنصر | الحالة الموثقة حاليًا |
|-|-|
| نوع المنتج | التعرف على الكلام في الوقت الفعلي |
| طريقة الاتصال | واجهة برمجة تطبيقات WebSocket من تينسنت كلاود |
| اسم المحرك | `Hy-ASR-3.0-preview` |
| مدة الصوت | لا تتجاوز 60 ثانية لكل إدخال |
| تنسيق الصوت | PCM أحادي القناة بتردد 16 كيلوهرتز |
| التزامن المشمول | 20 قناة متزامنة |
| اللغة الصينية الماندرين | مدعومة |
| اللغة الإنجليزية | مدعومة |
| 20 لهجة | مدعومة |
| فصل المتحدثين | غير مدعوم في الإصدار التجريبي |
| دعم معلمات VAD | مدرج كغير مدعوم في الإصدار التجريبي |
| استبدال الكلمات | غير مدعوم في الإصدار التجريبي |
| معلمة عتبة الضوضاء | غير مدعومة في الإصدار التجريبي |
| إدخال السياق الخارجي | قريبًا |
| تحسين كلمة التنبيه | قريبًا |

تشير مراجع واجهة برمجة تطبيقات WebSocket العامة إلى معلمات تستخدمها محركات أخرى، بما في ذلك VAD ومعرف كلمة التنبيه.

يعتمد Hy ASR 3.0 على الوصف التجريبي الخاص بالمحرك.

لا يضمن ظهور المعلمات في وضع واجهة برمجة التطبيقات المشتركة أن المحرك التجريبي قد نفذ تلك المعلمة حاليًا.

## العملية الأساسية لتكامل تينسنت كلاود

ينقسم الإعداد الرسمي إلى ثلاث مراحل رئيسية.

## الخطوة 1: تفعيل خدمة التعرف على الكلام من تينسنت كلاود

افتح خدمة التعرف على الكلام من تينسنت كلاود وأكمل عملية تفعيل الحساب.

توجد وثائق البدء السريع الرسمية على:

```نص عادي
https://cloud.tencent.com/document/product/1093/54362

يرجى مراجعة تعليمات الفوترة قبل تفعيل الفوترة حسب الاستهلاك.

تشير تينسنت كلاود إلى أن الحسابات الجديدة معطلة افتراضيًا للفوترة حسب الاستهلاك وتتطلب التفعيل اليدوي.

الخطوة 2: إنشاء بيانات اعتماد API

قم بإنشاء أو الحصول على:

  • AppID
  • SecretID
  • SecretKey

تُستخدم هذه البيانات الاعتمادية لتوقيع طلبات اتصال WebSocket.

يرجى تخزينها في مدير مفاتيح أو متغيرات بيئة محمية.

لا تضع بيانات اعتماد طويلة الأمد في:

  • كود JavaScript في الواجهة الأمامية.
  • الكود المصدري لتطبيقات الهاتف المحمول.
  • مستودعات الأكواد العامة.
  • المستندات المشتركة.
  • عناوين URL المرئية للعميل.

بالنسبة للمنتجات القائمة على المتصفح أو الهاتف المحمول، يرجى إنشاء معلومات الاتصال الموقعة على خادم موثوق به.

الخطوة 3: الاتصال بنقطة نهاية WebSocket في الوقت الفعلي

صيغة نقطة النهاية الموثقة في وثائق تينسنت كلاود هي:

wss://asr.cloud.tencent.com/asr/v2/<appid>?{request_parameters}

استبدل <appid> بمعرف تطبيق تينسنت كلاود الخاص بك.

يحتوي الطلب على معلمات توقيع، مثل:

  • secretid
  • timestamp
  • expired
  • nonce
  • voice_id
  • engine_model_type

للإصدار التجريبي من Hy ASR 3.0، يرجى تعيين:

engine_model_type=Hy-ASR-3.0-preview

يتطلب كل اتصال WebSocket معرف voice_id فريدًا.

إذا انتهى الاتصال أو فشل، يصبح voice_id القديم غير صالح ويجب إنشاء معرف جديد.

الخطوة 4: تحضير صوت متوافق

يتطلب الإصدار التجريبي الحالي:

معدل العينة: 16 كيلوهرتز
القنوات: أحادية
الصيغة: PCM
الحد الأقصى لمدة الإدخال: 60 ثانية

يرجى اختبار سلسلة الصوت الكاملة، وليس فقط الملف الأصلي.

قد تقوم حزم تطوير الميكروفون وواجهات برمجة تطبيقات الوسائط في المتصفح وأنظمة الهاتف ومنصات المؤتمرات بإعادة العينة أو الضغط قبل وصول الصوت إلى الخادم.

الخطوة 5: بث الصوت وقراءة النتائج التزايدية

تدعم الخدمة النسخ في الوقت الفعلي، حيث يمكن إرجاع النص أثناء نقل الصوت.

يجب أن يتعامل التطبيق مع:

  • النتائج الجزئية.
  • النتائج النهائية.
  • أخطاء الاتصال.
  • فشل المصادقة.
  • انتهاء المهلة.
  • إعادة الاتصال.
  • حدود مدة الصوت.
  • النص المكرر أو المنقح.

لا تفترض أن كل نتيجة تعرف جزئية هي النتيجة النهائية.

قد تقوم واجهة التعرف في الوقت الفعلي بمراجعة الكلمات السابقة عند توفر مزيد من السياق.

يجب أن تميز واجهة المستخدم بين النص المؤقت والنص المؤكد.

الخطوة 6: الاختبار قبل الإطلاق

قم ببناء مجموعة تقييم تمثيلية تشمل:

  • صوت عملاء حقيقيين.
  • لهجات شائعة.
  • لغات محلية.
  • مزيج صيني-إنجليزي.
  • أسماء أشخاص ومصطلحات منتجات.
  • ضوضاء.
  • همس منخفض.
  • جودة ميكروفون ضعيفة.
  • أوامر قصيرة.
  • جمل كاملة.

قم أيضًا بقياس جودة التعرف وسلوك النظام.

تسعير المحرك التجريبي

تصنف تينسنت كلاود الإصدار التجريبي من Hy ASR 3.0 ضمن محرك التعرف على الكلام في الوقت الفعلي للنموذج الكبير 2.0.

تدرج صفحة الفوترة الحالية:

خيار الفوترة السعر المعلن حاليًا
باقة 60 ساعة مسبقة الدفع إجمالي 60 يوان، أي 1.00 يوان/ساعة
باقة 1,000 ساعة مسبقة الدفع إجمالي 950 يوان، أي 0.95 يوان/ساعة
باقة 10,000 ساعة مسبقة الدفع إجمالي 9,000 يوان، أي 0.90 يوان/ساعة
باقة 100,000 ساعة مسبقة الدفع إجمالي 88,000 يوان، أي 0.88 يوان/ساعة
باقة 300,000 ساعة مسبقة الدفع إجمالي 255,000 يوان، أي 0.85 يوان/ساعة
الفوترة حسب الاستهلاك 1.00 يوان/ساعة، تُسوى يوميًا

يُظهر جدول الفوترة الحالي لتينسنت أن التعرف بنموذج كبير 2.0 لا يتضمن حصة صوتية مجانية.

التزامن العشرون المشمول هو حصة التزامن، وليس مدة تعرف مجانية.

قد تتغير الأسعار. يرجى مراجعة صفحة الفوترة في الوقت الفعلي قبل إصدار عروض تجارية أو تقدير ميزانيات طويلة الأجل.

مثال على التكلفة

بناءً على السعر المعلن حاليًا للفوترة حسب الاستهلاك وهو 1.00 يوان/ساعة:

100 ساعة من التعرف الناجح
× 1.00 يوان/ساعة
= 100 يوان

يجب أن تشمل ميزانية الإنتاج أيضًا:

  • المعالجة المسبقة للصوت.
  • النقل عبر الشبكة.
  • الخوادم الخلفية.
  • التخزين.
  • المراقبة.
  • التصحيح اليدوي.
  • حركة إعادة المحاولة.
  • معالجة نماذج اللغة في المراحل النهائية.

رسوم ASR هي جزء فقط من نظام النسخ الكامل.

تكامل يوانباو مع المنتج

ذكرت تينسنت أن يوانباو شارك في تطوير النموذج، وهو أول منتج من تينسنت يدمج هذا النموذج.

يمكن للمستخدمين تجربة هذه الميزة من خلال الإدخال الصوتي في يوانباو، ويهدف النموذج إلى تحسين:

  • التعرف على اللهجات.
  • تصحيح الأخطاء حسب السياق.
  • التعرف في الظروف الصوتية الصعبة.

ذكرت تينسنت أن منتجات أخرى مثل WorkBuddy تعمل تدريجيًا على الانضمام.

قد يختلف أسلوب تكامل المنتجات الاستهلاكية عن واجهة برمجة التطبيقات العامة للإصدار التجريبي من تينسنت كلاود.

على سبيل المثال، قد يستخدم يوانباو خدمات داخلية أو سياقًا خاصًا بالمنتج أو إعدادات نشر غير متاحة بعد للمطورين الخارجيين.

لا ينبغي افتراض أن تجربة يوانباو تتطابق مع معلمات واجهة برمجة التطبيقات العامة واحدًا لواحد.

السيناريوهات المناسبة

يستهدف الإصدار التجريبي من Hy ASR 3.0 التفاعلات الصوتية القصيرة ومنخفضة زمن الاستجابة.

خدمة العملاء الذكية

تشمل الاستخدامات المحتملة:

  • النسخ الفوري لتفاعلات الوكلاء.
  • التعرف على أوامر الروبوتات الصوتية.
  • توليد ملخصات المكالمات.
  • استخراج النوايا.
  • المساعدة في ضمان الجودة.

يفتقر الإصدار التجريبي حاليًا إلى فصل المتحدثين، مما قد يحد من نسخ المكالمات متعددة الأطراف ما لم توجد مكونات أخرى لفصل القنوات أو المتحدثين.

الترجمة الفورية في الوقت الفعلي

يمكن للمحرك دعم الترجمة الفورية القصيرة في السيناريوهات التالية:

  • البث المباشر بالفيديو.
  • الغرف الصوتية.
  • الاجتماعات الداخلية.
  • الرسائل الصوتية.
  • الواجهات التي تساعد ذوي الإعاقة.

يجب أن يختبر التطبيق استقرار النتائج الجزئية وسلوك علامات الترقيم.

البحث الصوتي

يمكن للتعرف الحساس للسياق تحسين عمليات البحث التي تتضمن:

  • أسئلة اللغة الطبيعية بجمل طويلة.
  • أسماء المنتجات.
  • خلط الصينية والإنجليزية.
  • النطقات الإقليمية.

قبل فتح حقن الكلمات الساخنة في الإصدار التجريبي، قد تحتاج المصطلحات النادرة في الدليل إلى معالجة لاحقة أو طبقة تصحيح أخطاء منفصلة.

الأوامر الصوتية والمساعدون

يمكن للمحرك تحويل التعليمات المنطوقة إلى نص لاستخدامها في:

  • المساعدين الذكيين الاصطناعيين.
  • وكلاء المؤسسات الذكيين.

التحكم في الأجهزة الذكية.

  • أوامر سير العمل.

لا ينبغي أبدًا لنظام الأوامر تنفيذ عمليات عالية التأثير لمجرد أن نتيجة نسخ تبدو ذات ثقة عالية.

بالنسبة للعمليات التدميرية أو المالية، يجب تأكيد النية المُستخرجة وطلب موافقة صريحة من المستخدم.

فهم المحتوى

يمكن نسخ المقاطع الصوتية القصيرة قبل إرسالها إلى العمليات التالية:

  • توليد الملخصات.
  • التصنيف.
  • فهرس البحث.
  • مراجعة المحتوى.
  • استخراج المعرفة.

تعتمد جودة معالجة الذكاء الاصطناعي في كل خطوة لاحقة على نتيجة النسخ.

عندما تسمح السياسات بذلك، قم بتخزين الصوت الأصلي أو أدلة الثقة حتى يمكن مراجعة المخرجات غير المؤكدة.

القيود الحالية

حالة المعاينة

لا يزال هذا المنتج مُعلَّمًا كإصدار معاينة أو إصدار اختباري داخلي.

قد تتغير الواجهة والتسعير والقيود والميزات المدعومة.

حد الإدخال ستون ثانية

لا يمكن لواجهة برمجة التطبيقات العامة الحالية أن تحل مباشرة محل النسخ الجماعي للتسجيلات الطويلة.

يتطلب الصوت الطويل معالجة分段ة، وقد يحتاج إلى طبقة سياق على مستوى التطبيق.

دعم إدخال PCM فقط

تتطلب نسخة المعاينة حاليًا صوتًا أحاديًا بتردد 16 كيلو هرتز بصيغة PCM.

تستخدم العديد من بيئات الإنتاج صيغ MP3 أو AAC أو Opus أو برامج ترميز الهاتف، مما يتطلب التحويل.

عدم دعم فصل المتحدثين

توضح وثائق المحرك الحالية عدم دعم فصل المتحدثين.

قد يتطلب نسخ متحدثين متعددين قنوات صوتية منفصلة أو خدمات أخرى لفصل المتحدثين.

ميزات السياق والكلمات الساخنة غير متاحة علنًا بعد

وفقًا للوثائق الرسمية، لم يتم الكشف عن القدرات المُعلنة كواجهة برمجة تطبيقات معاينة متاحة.

بيانات المعايير التي أبلغت عنها الشركة

جداول المعايير مأخوذة من تينسنت.

سيعزز التقييم المستقل في ظل ظروف متطابقة مصداقية المقارنة.

لا توجد ورقة فنية كاملة

قدمت تينسنت وصفًا رفيع المستوى لبنية وعملية تدريب إصدار المعاينة من Hy ASR 3.0، لكنها لم تنشر تفاصيل كاملة قابلة لإعادة الإنتاج.

قد يؤدي السياق إلى تصحيح مفرط

قد يفضل وحدة فك التشفير الواعية باللغة اختيار الجمل الشائعة وتجاهل الكلمات غير الشائعة التي قيلت بالفعل بشكل صحيح.

يجب أن تتضمن الاختبارات عبارات نادرة وغير متوقعة.

قائمة التقييم العملية

1. بناء مجموعة اختبار خاصة بالمجال

يجب أن تتضمن مئات العينات التمثيلية على الأقل، وليس عددًا قليلاً من العينات النظيفة للعرض.

2. الاحتفاظ بالنص المرجعي الأصلي

إنشاء نسخ مرجعي مدقق يدويًا باستخدام استراتيجية تطبيع واضحة.

تحديد كيفية التعامل مع:

  • علامات الترقيم.
  • الأرقام.
  • الأحرف الكبيرة والصغيرة في الإنجليزية.
  • كلمات الحشو.
  • المحتوى المكرر.
  • الصينية التقليدية والمبسطة.

3. قياس مقاييس متعددة

استخدام:

  • معدل خطأ الكلمات أو معدل خطأ الأحرف.
  • دقة الأسماء.
  • دقة الأرقام.
  • معدل الخطأ الدلالي.
  • زمن الاستجابة.
  • معدل مراجعة النتائج الجزئية.
  • معدل الفشل.

4. اختبار اللهجات بشكل منفصل

لا تدمج جميع المتحدثين باللهجات في متوسط واحد.

قدم النتائج منفصلة حسب المنطقة وظروف التسجيل.

5. اختبار الغموض السياقي

إنشاء عينات مزدوجة حيث يكون المحتوى الصوتي متشابهًا ولكن السياق الجملة يغير نتيجة النسخ الصحيحة.

6. اختبار المصطلحات النادرة

تقييم أسماء المنتجات و

الآن تعامل مع المصطلحات أولاً، وأعد الاختبار بعد أن تفتح تينسنت دعم الكلمات الساخنة.

7. اختبار سيناريوهات الضوضاء والهمس

استخدم تسجيلات بيئية حقيقية، وليس فقط ضوضاء مضافة رقميًا.

8. اختبار حدود التجزئة

تأكد من أن تنفيذ تجزئة 60 ثانية لا يقطع الجمل المهمة ولا ينتج نصًا مكررًا.

9. قياس زمن الاستجابة الشامل

يشمل المراحل التالية:

الالتقاط
+ الرفع
+ التعرف
+ إنهاء النتيجة
+ المعالجة اللاحقة

10. مراجعة متطلبات الخصوصية والامتثال

قد تحتوي التسجيلات الصوتية على معلومات شخصية أو حساسة.

قبل النشر، يجب تحديد سياسات الاحتفاظ بالبيانات والوصول إليها والتشفير وموافقة المستخدم والحذف بوضوح.

مقارنة Hy ASR 3.0 مع معاينة وخطوط معالجة ASR التقليدية

المجال خط المعالجة التقليدي اتجاه Hy ASR 3.0
الاهتمام الرئيسي دقة الصوت إلى النص التعرف الصوتي مع النمذجة اللغوية السياقية
الكلمات المتجانسة المربكة عادةً تعتمد على الاحتمالات المحلية استخدام سياق جملة أوسع
اللهجات نماذج منفصلة أو تغطية محدودة محرك هجين موثق واحد يدعم 20 لهجة
المصطلحات المتخصصة كلمات ساخنة خارجية أو نماذج مخصصة قدرة كلمات ساخنة مُعلنة؛ دعم المعاينة قيد الإتاحة
الكلام المعقد نموذج صوتي مع معالجة لاحقة تدريب مشترك للكلام واللغة مع تدريب لاحق
المخرجات نص النسخ نص نسخ أكثر تماسكًا سياقيًا
المخاطر الرئيسية الاستبدال الصوتي وفقدان الأحرف أخطاء صوتية مع احتمال تصحيح دلالي مفرط

المنهج الجديد لا يلغي الحاجة إلى هندسة ASR التقليدية.

إنه يضيف طبقة لغوية أقوى على نفس النظام الشامل.

الأسئلة الشائعة

ما هو Hy ASR 3.0 معاينة؟

Hy ASR 3.0 معاينة هو نموذج للتعرف على الكلام في الوقت الفعلي من تينسنت هونيوان يعتمد على قاعدة لغة Hy3 ومشفّر صوتي مطور داخليًا. هدفه التصميمي هو الجمع بين التعرف الصوتي وفهم اللغة السياقي.

ما اللغات واللهجات التي يدعمها Hy ASR 3.0؟

توثق وثائق تينسنت السحابية دعم اللغة الصينية الماندرين والإنجليزية و20 لهجة أو تنوعًا إقليميًا صينيًا، بما في ذلك الكانتونية ولهجة دونغبي ولهجة خنان ولهجة شنشي ولهجة تشنغدو ولهجة تشونغتشينغ ولهجة ووهان وغيرها. قد تختلف الدقة بين المتحدثين والمناطق المختلفة.

ما هو معدل خطأ الكلمات (WER) المُعلن؟

أعلنت تينسنت عن نتائج WER المجمعة عبر المعايير العامة: 3.34% للماندرين، 2.62% للإنجليزية، و3.12% للكانتونية. هذه نتائج أبلغت عنها الشركة بناءً على مجموعات بيانات متعددة، وليست نتائج اختبار موحد مُعاد إنتاجه بشكل مستقل.

هل يمكن لـ Hy ASR 3.0 نسخ تسجيلات طويلة؟

تقبل المعاينة العامة الحالية حتى 60 ثانية من الصوت لكل إدخال. تتطلب التسجيلات الأطول معالجة分段ة، ويجب أن يحتفظ التطبيق بسياق فعال بين المقاطع.

هل تدعم واجهة برمجة التطبيقات الحالية الكلمات الساخنة والسياق المخصص؟

وفقًا لوثائق المعاينة الصادرة عن تينسنت السحابية بتاريخ 4 أغسطس 2026، لا تدعم ذلك حاليًا. تصف المواد المنشورة هذه القدرات، لكن صفحات واجهة برمجة التطبيقات الرسمية تشير إلى أن إدخال السياق وتحسين الكلمات الساخنة سيفتحان لاحقًا.

ما تنسيقات الصوت المدعومة؟

تحدد وثائق معاينة Hy ASR 3.0 الحالية دعم إدخال PCM أحادي بتردد 16 كيلو هرتز. يجب على التطبيقات التي تستخدم MP3 أو AAC أو Opus أو تنسيقات أخرى تحويل الصوت قبل الاستدعاء.

إرسال هذا إلى المحرك.

كيف يمكن للمطورين استدعاء Hy ASR 3.0؟

يستخدم المطورون واجهة برمجة تطبيقات WebSocket للتعرف على الكلام في الوقت الفعلي من تينسنت السحابية، مع تعيين engine_model_type إلى Hy-ASR-3.0-preview. يجب توقيع الاتصال باستخدام بيانات اعتماد تينسنت السحابية.

هل Hy ASR 3.0 مجاني؟

لا تسرد صفحة الفوترة الحالية لتينسنت السحابية حصة صوتية مجانية لنموذج التعرف الكبير 2.0. تعرض الصفحة حزمًا مدفوعة مسبقًا تبدأ من ساعة واحدة بسعر 1 يوان صيني للساعة، ودفعًا لاحقًا بسعر 1 يوان صيني للساعة، مع تضمين 20 قناة متزامنة.

الأدوات ذات الصلة

الروابط ذات الصلة

(https://cloud.tencent.com/document/product/1093/135476): الحالة الرسمية الحالية، واللهجات المدعومة، والقيود، والإعدادات الأساسية.

ملخص

يجمع الإصدار التجريبي Hy ASR 3.0 من تينسنت هونيوان بين مشفر الصوت وقدرات نموذج اللغة Hy3 لتحسين نتائج النسخ في الماندرين، والإنجليزية، واللهجات، واللغات المختلطة، والبيئات الصاخبة، والسياقات ذات الصلة.

أفادت تينسنت أنه على مجموعات البيانات العامة المجمعة، بلغ معدل خطأ الكلمات للغة الماندرين 3.34%، وللغة الإنجليزية 2.62%، وللكانتونية 3.12%، مع تحقيق نتائج رائدة في اختبارات السيناريوهات الداخلية الخاصة بها. هذه الأرقام واعدة، لكنها لا تزال بحاجة إلى التحقق على الصوتيات الخاصة بكل مؤسسة.

الإصدار التجريبي الحالي من تينسنت كلاود أضيق نطاقًا من رؤية الإصدار الكامل.

يدعم التعرف في الوقت الفعلي عبر WebSocket، وصوت PCM أحادي القناة بمعدل 16 كيلو هرتز، ومدخلات صوتية تصل إلى 60 ثانية. حقن السياق الخارجي، وتعزيز الكلمات الساخنة، وفصل المتحدثين، والعديد من الميزات الأخرى غير متاحة بعد على هذا المحرك.

التغيير الجوهري ليس أن التعرف على الكلام لم يعد يستمع إلى الصوت، بل أن نموذج اللغة أصبح الآن يساعد في تحديد المعنى الأكثر ترجيحًا للصوت.

腾讯混元 Hy ASR 3.0 预览版:面向普通话、英语及20种方言的上下文感知语音识别