NVIDIA NemotronLabs VoiceChat 11B: ذكاء اصطناعي صوتي مفتوح مزدوج الاتجاه مع استدعاء أدوات في الوقت الفعلي
أصدرت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج صوتي من طرف إلى طرف في الوقت الفعلي، مصمم للمحادثات الصوتية الطبيعية مزدوجة الاتجاه. على عكس الأساليب الشائعة القائمة على خطوط الأنابيب،

NVIDIA NemotronLabs VoiceChat 11B يجلب الصوت ثنائي الاتجاه واستدعاء الأدوات في الوقت الفعلي للذكاء الاصطناعي الصوتي المفتوح
مقدمة
أصدرت NVIDIA نموذج NemotronLabs VoiceChat 11B، وهو نموذج صوتي إلى صوتي يعمل في الوقت الفعلي من البداية إلى النهاية، مصمم لمحادثات صوتية طبيعية ثنائية الاتجاه بالكامل.
على عكس الخطوط النمطية الشائعة التي تربط التعرف التلقائي على الكلام ونماذج اللغة الكبيرة وتحويل النص إلى كلام، يعالج VoiceChat فهم الكلام المتدفق وتوليد الكلام داخل بنية موحدة. هدفه هو تقليل عمليات النقل التي تزيد عادةً من زمن الاستجابة وتجعل المساعدات الصوتية تبدو أقل طبيعية.
يمكن للنموذج الاستماع أثناء استمرار المحادثة، والتخلي عن الدور عندما يقاطع المستخدم، ثم الاستئناف بشكل طبيعي بعد أن ينتهي المستخدم من الكلام. أفادت NVIDIA بزمن استجابة سلس لتبادل الأدوار يبلغ 448 مللي ثانية في Full-Duplex-Bench 1.0، وزمن انقطاع يبلغ حوالي 480 مللي ثانية.
يقدم VoiceChat أيضًا ميزة ذات أهمية خاصة لوكلاء الصوت في بيئات الإنتاج: استدعاء الأدوات في الوقت الفعلي مع بقاء المحادثة الصوتية نشطة. يمكن لقناة إخراج منفصلة إصدار أوامر استدعاء الأدوات، بينما تساعد رسائل التأكيد المحددة مسبقًا الوكيل على تجنب فترات الصمت المحرجة أثناء طلبات واجهات برمجة التطبيقات الخارجية.
هذا الإصدار مهم، لكنه لا يزال في مراحله المبكرة. تصنف NVIDIA هذا النموذج على أنه لأغراض البحث فقط، وتوصي بذاكرة GPU كبيرة للنشر، وتوثق العديد من القيود في المحادثات الطويلة والبيئات الصاخبة والاستدلال واستخدام أدوات متعددة والكلام غير المنضبط.
بنية صوتي إلى صوتي موحدة
عادةً ما يبدو المساعد الصوتي التقليدي في الوقت الفعلي كما يلي:
صوت المستخدم
↓
ASR (التعرف التلقائي على الكلام)
↓
نص
↓
LLM (نموذج اللغة الكبير)
↓
رد نصي
↓
TTS (تحويل النص إلى كلام)
↓
صوت الوكيل
يدمج VoiceChat هذه الإمكانات في نموذج أكثر تكاملًا بشكل وثيق.
تصف NVIDIA هذا النظام بحجم 11B بأنه بنية هجينة Mamba/Transformer، تتكون من:
- مشفر صوت Fast Conformer
- العمود الفقري لنموذج اللغة Nemotron Nano v2 بحجم 9B
- مفكك تشفير TTS من NVIDIA وبرنامج ترميز صوتي
- قناة منفصلة لنصوص استدعاء الأدوات
يوفر المستخدم الصوت بتردد 16 كيلو هرتز. تشمل المخرجات نص الوكيل وصوت الوكيل والنص المنسوخ للمستخدم، حيث يتم توليد صوت الوكيل بتردد 22.05 كيلو هرتز.
الصوت ثنائي الاتجاه يعني أن المحادثات يمكن أن تتداخل
يعالج المساعد أحادي الاتجاه المحادثات عمليًا مثل جهاز اتصال لاسلكي: يتحدث طرف واحد، ثم يرد الطرف الآخر.
يمكن للنظام ثنائي الاتجاه نمذجة طرفي المحادثة بشكل مستمر. وهذا يتيح معالجة الانقطاعات والتوقفات والتبادل ذهابًا وإيابًا وتبادل أدوار أكثر طبيعية.
تشمل نتائج Full-Duplex-Bench 1.0 التي نشرتها NVIDIA:
| المؤشر | نتيجة VoiceChat 11B |
|---|---|
| معدل تبادل الأدوار السلس TOR | 0.82 |
| زمن استجابة تبادل الأدوار السلس | 448 مللي ثانية |
| TOR لانقطاع المستخدم | 1.0 |
| زمن استجابة انقطاع المستخدم | 480 مللي ثانية |
| تقييم GPT-4o لانقطاع المستخدم | 4.33 |
الرقم 448 مللي ثانية المذكور في المقال الإخباري الأصلي يأتي من اختبار تبادل الأدوار السلس. تلخص NVIDIA النموذج على أنه يوفر زمن استجابة يبلغ حوالي 450 مللي ثانية.
صُمم VoiceChat للتخلي عن الدور عند انقطاع المستخدم
معالجة الانقطاع هي أحد أكبر الفروق بين العرض الصوتي والوكيل الحواري القابل للاستخدام.
VoiceChat
تم تدريب النموذج مباشرة على تبادل الأدوار الحواري. عندما يبدأ المستخدم في التحدث في منتصف رد النموذج، يمكن للنظام إيقاف دوره الصوتي والاستماع.
توثق وثيقة القيود المعروفة من NVIDIA أيضًا أن هذا السلوك ليس مثاليًا في جميع الحالات. قد يقاطع النموذج المستخدم عند توقفات في جملته، أو يستمر في التحدث بعد أن يجب أن يتوقف، أو يبدأ جولة جديدة دون مدخلات جديدة، أو يقع في حلقات، أو يتعامل بشكل غير صحيح مع إشارات التغذية الراجعة.
استدعاء الأدوات في الوقت الفعلي هو الميزة الهندسية الأكثر إثارة للاهتمام
VoiceChat 11B هو أول نموذج مفتوح المصدر ثنائي الاتجاه بالكامل من NVIDIA يدعم استدعاء الأدوات، وهو مصمم للحفاظ على تفاعل صوتي طبيعي عند استخدام الأدوات.
غالبًا ما يحتاج الوكلاء الصوتيون إلى معلومات غير موجودة داخل النموذج. على سبيل المثال:
ما هي الحالة الحالية لطلبي؟
قد يحتاج النموذج إلى استدعاء واجهة برمجة تطبيقات لإدارة الطلبات قبل أن يتمكن من الإجابة.
يدعم VoiceChat رسائل التأكيد للأدوات. يمكن للمطورين تعريف عبارات قصيرة مثل:
حسنًا، دعني أتحقق من ذلك لك.
عندما يقرر النموذج استدعاء أداة، يمكن للنظام نطق إحدى هذه العبارات أثناء معالجة الطلب الخارجي.
يبدو التدفق المبسط كما يلي:
يتحدث المستخدم
↓
يستجيب VoiceChat
↓
يحدد النموذج الحاجة إلى أداة
↓
يتم إرسال حدث استدعاء الأداة إلى العميل
↓
ينفذ العميل الوظيفة الخارجية
↓
تُعاد نتيجة الأداة إلى VoiceChat
↓
يستأنف VoiceChat الرد الصوتي
قيود مهمة لاستدعاء الأدوات
توصي NVIDIA بما يصل إلى حوالي خمس أدوات لكل جلسة، لأن الأداء قد يتدهور مع توفر المزيد من الأدوات.
لا يمكن للنموذج حاليًا استدعاء أدوات متعددة بشكل موثوق في نفس الوقت.
تشمل القيود الأخرى أخطاء اختيار الأدوات، وتخطي استدعاء الأدوات، واختلاق الوسائط، ونطق نتائج الأدوات بشكل خاطئ، والاعتماد على المعرفة الداخلية عندما يجب استخدام أداة.
تفصيل مهم بشكل خاص: على الرغم من أن VoiceChat يدعم انقطاع المستخدم في المحادثة العادية، لا يمكن للمستخدم حاليًا مقاطعة الوكيل أثناء تنفيذ الأداة.
نتائج اختبار استدعاء الأدوات
نتائج AU Harness المبلغ عنها:
| فئة استدعاء الأدوات | الدرجة |
|---|---|
| بسيط | 58.5% |
| متعدد | 62.5% |
| متوازي | 42.5% |
| متوازي متعدد | 27.5% |
| عدم الصلة | 89.6% |
| المتوسط | 56.1% |
في Full-Duplex-Bench v3، أبلغت NVIDIA عن:
| المؤشر | الدرجة |
|---|---|
| اختيار الأداة | 82.5% |
| دقة الوسائط | 44.2% |
| Pass@1 | 33% |
تشير هذه الأرقام إلى أن استدعاء الأدوات في بيئات الإنتاج يجب أن يظل محميًا بمنطق التطبيق والتحقق من الوسائط.
VoiceChat يحتل مرتبة متقدمة بين النماذج المفتوحة المصدر ثنائية الاتجاه
أفادت NVIDIA أن VoiceChat يحتل المرتبة الثانية بين النماذج المفتوحة المصدر ثنائية الاتجاه في كل من VoiceBench وFull-Duplex-Bench 1.0.
تم تحسين هذا النموذج للمفاضلة بين الذكاء العام والتفاعل الصوتي الطبيعي في الوقت الفعلي. تحذر NVIDIA صراحةً من أن أداءه قد يكون أقل من نموذج اللغة الأساسي Nemotron Nano v2 في مهام المعرفة واتباع التعليمات والسلامة والاستدلال.
تم تدريب النموذج على حوالي 550 ألف ساعة من الصوت
تدرج بطاقة نموذج NVIDIA حوالي 550 ألف ساعة من بيانات التدريب الصوتي.
هذه البيانات المختلطة
تشمل الكلام الحقيقي والكلام المركب، بالإضافة إلى بيانات نصية لمكونات نموذج اللغة. تشمل مصادر البيانات المذكورة Fisher وLibriVox وLibriTTS وHiFi-TTS وVCTK وPromptTTS وUltraChat وبيانات الكلام الداخلية من NVIDIA والكلام المركب وبيانات استدعاء وظائف Nemotron وبيانات تدريب PersonaPlex.
يستخدم VoiceChat صوتًا ثابتًا
لا يدعم checkpoint الحالي لـ VoiceChat استنساخ الصوت.
توضح وثائق مستودع NVIDIA أن checkpoint المنشور يستخدم صوتًا ثابتًا. تركيز هذا الإصدار أضيق: تفاعل صوتي منخفض زمن الاستجابة، سلوك حواري ثنائي الاتجاه بالكامل، واستدعاء أدوات مدرك للسياق.
متطلبات الأجهزة مرتفعة جدًا
تشترط المتطلبات الأساسية الحالية للنشر في الوقت الفعلي من NVIDIA بوضوح:
GPU من NVIDIA بذاكرة لا تقل عن 80 جيجابايت
تشمل وحدات GPU المدعومة في الحاوية الموثقة NVIDIA A100 وH100 وRTX 6000 Pro وB200. كما تدرج بطاقة النموذج الأوسع التوافق مع H200 وB100.
بالنسبة للحاوية المحسّنة في الوقت الفعلي، تتطلب NVIDIA حاليًا x86_64 وLinux وDocker ومجموعة أدوات حاويات NVIDIA وبرامج تشغيل NVIDIA متوافقة.
يشير دليل استكشاف الأخطاء وإصلاحها إلى أن النموذج نفسه يستخدم حوالي 66 جيجابايت من ذاكرة GPU.
لا توجد بعد واجهة برمجة تطبيقات استدلال ناضجة مُدارة
حتى 11 أغسطس، لم تُدرج صفحة نموذج Hugging Face أي مزود استدلال نشط لنقطة التحقق هذه.
بدلاً من ذلك، تقدم NVIDIA مسارين رئيسيين:
- الاستدلال دون اتصال، من نقطة التحقق على Hugging Face
- البث التفاعلي، عبر حاويات NVIDIA المُحسَّنة
تقوم الحاوية الفورية بتغليف CUDA وTriton وvLLM وحزمة VoiceChat الكاملة للاستدلال، وتُعرّض خدمة WebSocket ثنائية الاتجاه.
كيفية تشغيل الاستدلال دون اتصال
استنسخ فرع VoiceChat التجريبي من NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
أنشئ البيئة:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
نزّل نقطة التحقق:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
شغّل المثال:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
تنصح NVIDIA بإضافة صمت كافٍ في نهاية الصوت المُدخل المخصص لمنح النموذج وقتًا للاستجابة.
كيفية نشر الحاوية الفورية
نزّل مستودع النموذج:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
شغّل الخدمة:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
تحقق من حالة الجاهزية:
curl 'http://localhost:9000/v1/realtime/health'
بعد ذلك، يُعرّض الخادم نقطة WebSocket ثنائية الاتجاه على العنوان التالي:
ws://localhost:9000/v1/realtime
تعريف أداة بسيط
مثال على تعريف أداة مُبسَّط:
[
{
"name": "get_weather",
"description": "الحصول على الطقس الحالي لمدينة معينة",
"ack_messages": [
"حسنًا، دعني أتحقق من ذلك لك."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
يوفر حقل ack_messages محتوى استجابة طبيعيًا للنظام أثناء تنفيذ الأداة.
للاستخدام البحثي فقط، وتوخي الحذر لفرق الإنتاج
تُصنّف NVIDIA نموذج VoiceChat 11B صراحةً على أنه للاستخدام البحثي فقط.
يبلغ الحد الأقصى لنافذة السياق الصوتي التي جرى تدريب النموذج عليها حوالي دقيقتين، لذلك قد لا يتم الاحتفاظ بسياقات المحادثات الأطول بشكل موثوق.
تشمل المشكلات المعروفة أخطاء الاستدلال، والهلوسة، وتدهور جودة الصوت بعد عدة جولات من المحادثة، والتكرار، والنصوص المشوشة، وانقطاع الكلام، والاسترسال غير المنضبط، والحوار الذاتي، وحلقات التوضيح، والكلمات المفقودة في النسخ، وعدم موثوقية تبديل اللغة، وضعف الأداء في البيئات الصاخبة أو عالية الصدى.
حالات الاستخدام المحتملة لنموذج VoiceChat 11B
تشمل السيناريوهات البحثية والنماذج الأولية المحتملة:
مراكز الاتصال
يمكن للوكيل الذكي الاستماع بشكل طبيعي، والتعامل مع المقاطعات، واستدعاء أدوات خدمة العملاء، واستخدام رسائل التأكيد أثناء انتظار استجابة الواجهة البرمجية.
المساعد داخل المركبة
يمكن للسائق مقاطعة المساعد دون انتظار انتهاء الرد الصوتي الكامل. الحساسية الحالية للضوضاء الخلفية تعني أن النشر داخل المركبات يتطلب عمل تحسين إضافي.
الطلب في البيع بالتجزئة والمطاعم
يمكن للوكيل الصوتي جمع الطلبات، والاستجابة للتصحيحات، واستدعاء أنظمة المنتجات أو المخزون.
المساعدة للأشخاص ذوي الإعاقة
تساعد تبادلات المحادثة الأكثر طبيعية في الواجهات بدون استخدام اليدين والتطبيقات الصوتية أولاً، لكن النشر في مجال الإعاقة يتطلب اختبار مستخدم دقيقًا.
الوكلاء الصوتيون في المؤسسات
يمكن للمؤسسات التجربة على الأدوات الداخلية والتفاعلات الصوتية ذاتية الاستضافة، مع إبقاء النموذج داخل بنيتها التحتية الخاصة.
نموذج مفتوح، لكن برخصتين مختلفتين
مصطلح "مفتوح المصدر" يحتاج إلى فهم أكثر دقة.
كود NeMo Speech المستخدم في VoiceChat مرخّص بموجب رخصة Apache 2.0.
مواد نموذج VoiceChat مرخّصة بموجب رخصة OpenMDW 1.1.
لذلك، من الأدق وصف VoiceChat 11B بأنه نموذج مفتوح أو نموذج بأوزان مفتوحة، بدلاً من افتراض أن رخصة النموذج مطابقة تمامًا للبرمجيات المحيطة به المرخّصة بموجب Apache.
يجب على الفرق التي تخطط لإعادة التوزيع أو الاستخدام التجاري مراجعة رخصة OpenMDW مباشرة.
ما الذي يجب على المطورين اختباره قبل الإنتاج
يجب أن تغطي خطة تقييم مفيدة ما يلي:
تبادلات المحادثة ومعالجة مقاطعات المستخدم
التوقفات في منتصف الجمل وإشارات التغذية الراجعة
الصوت الصاخب والمُصَدَّى والصوت متعدد المتحدثين
معاملات الأدوات الخاطئة أو المفقودة
انتهاء مهلة الأدوات وفشل استدعاءات الواجهة البرمجية
- المحادثات الطويلة
- الكلام غير المنضبط
- الهلوسة ومشاكل جودة الاستدلال
- العمليات الحساسة تتطلب موافقة
- تسجيل السجلات وتحديد المعدلات والتصعيد البشري
الوكلاء الصوتيون القادرون على استدعاء الأدوات يحتاجون إلى نفس ضوابط الصلاحيات التي يحتاجها الوكلاء المستقلون الآخرون.
الأسئلة الشائعة
ما هو NVIDIA NemotronLabs VoiceChat 11B؟
NemotronLabs VoiceChat 11B هو نموذج صوت-إلى-صوت في الوقت الفعلي من طرف إلى طرف تقدمه NVIDIA للذكاء الاصطناعي التحاوري ثنائي الاتجاه. يجمع بين فهم الكلام المتدفق ونواة نموذج اللغة Nemotron وتوليد الكلام وقناة استدعاء أدوات مستقلة.
ما مدى سرعة VoiceChat 11B؟
أفادت NVIDIA أنه يحقق زمن استجابة سلس لتناوب الأدوار يبلغ 448 مللي ثانية وزمن استجابة للمقاطعة يبلغ حوالي 480 مللي ثانية على معيار Full-Duplex-Bench 1.0.
هل يمكن للمستخدم مقاطعة VoiceChat أثناء حديثه؟
نعم، تدعم المحادثة العادية الإدراج والمقاطعة. ومع ذلك، ذكرت NVIDIA أنه أثناء تنفيذ الأدوات لا يمكن للمستخدم حالياً مقاطعة الوكيل.
هل يدعم VoiceChat 11B استدعاء الدوال؟
نعم. يمكن للنموذج إصدار استدعاءات أدوات عبر قناة إخراج مستقلة، ويمكن للمطورين تعريف رسائل تأكيد تُذاع أثناء تشغيل الأدوات الخارجية.
كم يحتاج VoiceChat 11B من ذاكرة وحدة معالجة الرسومات؟
تتطلب حاوية الوقت الفعلي من NVIDIA وحدة معالجة رسومات بذاكرة لا تقل عن 80 جيجابايت. تشير وثائق استكشاف الأخطاء إلى أن النموذج بعد التحميل يستخدم حوالي 66 جيجابايت.
هل توجد واجهة برمجية مُدارة لـ VoiceChat 11B؟
توفر NVIDIA حالياً توثيقاً للاستدلال الذاتي دون اتصال وحاوية الوقت الفعلي المحسّنة. لا تدرج صفحة نموذج Hugging Face حالياً أي مزود استدلال مُدار.
هل يمكن لـ VoiceChat استنساخ الأصوات؟
لا. نقاط التحقق المنشورة تستخدم صوتاً ثابتاً ولا تدعم استنساخ الأصوات.
هل يمكن استخدام VoiceChat 11B في بيئات الإنتاج؟
تصنف NVIDIA هذا النموذج على أنه للاستخدام البحثي فقط. يجب على المطورين تقييم قيوده في طول السياق والاستدلال واستخدام الأدوات والصوت المشوش والتكرار والنسخ والكلام غير المنضبط قبل النشر في الإنتاج.
الأدوات ذات الصلة
- NVIDIA NemotronLabs VoiceChat 11B: بطاقة النموذج الرسمية والأوزان والمعايير والبنية والترخيص وتعليمات الاستدلال.
- NVIDIA NeMo Speech: المستودع الصوتي الرسمي الذي يحتوي على تنفيذ VoiceChat وفروع النشر.
- دليل حاوية VoiceChat في الوقت الفعلي من NVIDIA: توثيق النشر الرسمي لـ Docker وWebSocket واستدعاء الدوال.
- NVIDIA Container Toolkit: يسمح لحاويات Docker بالوصول إلى وحدات معالجة الرسومات من NVIDIA.
- vLLM: محرك الاستدلال المدرج في بطاقة نموذج VoiceChat من NVIDIA.
- VoiceBench: معيار مفتوح لتقييم المساعدين الصوتيين القائمين على نماذج اللغة.
الروابط ذات الصلة
- بطاقة نموذج VoiceChat 11B:
المصدر الرئيسي الذي يغطي تاريخ الإصدار والمعايير وبيانات التدريب والبنية وحالة الاستخدام البحثي فقط. - فرع VoiceChat على GitHub: الكود المصدري الرسمي وتعليمات التثبيت ومتطلبات الأجهزة والقيود ووصف النموذج.
- المتطلبات المسبقة للنشر في الوقت الفعلي: متطلبات الأجهزة وLinux وDocker وبرامج التشغيل وحزمة أدوات الحاويات.
- دليل النشر في الوقت الفعلي: توثيق NVIDIA لتشغيل الحاوية وفحوصات الصحة وWebSocket والعميل واستدعاء الأدوات.
- ترخيص OpenMDW 1.1: الترخيص الذي يحكم مواد نموذج VoiceChat.
- Full-Duplex-Bench: معيار لتقييم معالجة التوقفات وتناوب الأدوار وسلوك المقاطعة.
- Full-Duplex-Bench v3: معيار يركز على التفاعلات الصوتية ثنائية الاتجاه مع استدعاء الأدوات.
الملخص
يدمج NVIDIA NemotronLabs VoiceChat 11B في بنية واحدة ثنائية الاتجاه قدرات فهم الكلام والنمذجة اللغوية وتوليد الكلام ومعالجة المقاطعة واستدعاء الأدوات. أفادت NVIDIA أن زمن استجابة تناوب الأدوار لديه يبلغ 448 مللي ثانية فقط، وتضع النموذج في موقع متقدم ضمن معايير الصوت ثنائي الاتجاه المفتوحة الحالية.
أبرز الميزات الهندسية الجديرة بالاهتمام هي استدعاء الأدوات. يمكن لقناة الإخراج المستقلة تشغيل الوظائف الخارجية بينما تمنع رسائل التأكيد المحادثة من الوقوع في صمت أثناء استدعاءات الواجهة البرمجية.
هذا الإصدار ليس بعد خدمة كاملة جاهزة للإنتاج. يتطلب النشر في الوقت الفعلي ما لا يقل عن 80 جيجابايت من ذاكرة وحدة معالجة الرسومات، ويستخدم نقطة التحقق الحالية صوتاً ثابتاً، والاستدلال المُدار غير متاح على نطاق واسع بعد، وقد وثقت NVIDIA بوضوح قيوداً كبيرة في الجلسات الأطول والاستدلال والصوت المشوش وتنفيذ الأدوات.
يُنظر إلى VoiceChat 11B بشكل أفضل على أنه منصة بحثية مفتوحة لبناء ودراسة الوكلاء الصوتيين منخفضي زمن الاستجابة، وليس كحل ناضج ليحل محل مراكز خدمة العملاء أو واجهات برمجية صوتية استهلاكية في بيئات الإنتاج.