NVIDIA NemotronLabs VoiceChat 11B: Открытый полно дуплексный голосовой ИИ с вызовом инструментов в реальном времени
NVIDIA выпустила NemotronLabs VoiceChat 11B — сквозную модель преобразования речи в речь в реальном времени, разработанную для естественного полно дуплексного голосового диалога. В отличие от распространенных конвейерных методов,

NVIDIA NemotronLabs VoiceChat 11B приносит полнодуплексную речь и вызов инструментов в реальном времени в открытый ИИ для голоса
Введение
NVIDIA представила NemotronLabs VoiceChat 11B — сквозную модель «речь-в-речь» в реальном времени, разработанную для естественных полнодуплексных голосовых диалогов.
В отличие от распространённых конвейеров, где последовательно соединяются автоматическое распознавание речи, большая языковая модель и синтез речи, VoiceChat обрабатывает потоковое понимание речи и генерацию речи в рамках единой архитектуры. Цель — сократить количество промежуточных этапов, которые обычно увеличивают задержку и делают голосовых ассистентов менее естественными.
Модель может слушать, пока идёт разговор, уступать инициативу, когда пользователь перебивает, и естественно возобновлять речь после того, как пользователь закончил. NVIDIA сообщает о задержке плавного перехода реплик 448 миллисекунд и задержке прерывания около 480 миллисекунд на бенчмарке Full-Duplex-Bench 1.0.
VoiceChat также вводит функцию, особенно актуальную для продакшн-голосовых агентов: вызов инструментов в реальном времени, пока голосовой диалог остаётся активным. Отдельный выходной канал может передавать команды вызова инструментов, а заранее заданные подтверждающие сообщения помогают агенту избегать неловких пауз во время внешних API-запросов.
Этот релиз значим, но всё ещё находится на ранней стадии. NVIDIA маркирует модель как только для исследовательских целей, предупреждает о необходимости большого объёма памяти GPU для развёртывания и документирует ряд ограничений в длинных диалогах, шумной обстановке, рассуждениях, множественных инструментах и неконтролируемой речи.
Единая архитектура «речь-в-речь»
Традиционные голосовые ассистенты в реальном времени обычно выглядят так:
Речь пользователя
↓
ASR (автоматическое распознавание речи)
↓
Текст
↓
LLM (большая языковая модель)
↓
Текстовый ответ
↓
TTS (синтез речи)
↓
Голос агента
VoiceChat объединяет эти возможности в гораздо более тесно интегрированную модель.
NVIDIA описывает эту систему на 11 млрд параметров как гибридную архитектуру Mamba/Transformer, состоящую из:
- аудиокодера Fast Conformer;
- языковой основы Nemotron Nano v2 9B;
- TTS-декодера и аудиокодека NVIDIA;
- отдельного канала для скриптов вызова инструментов.
Пользователь подаёт речь с частотой 16 кГц. На выходе — текст агента, голос агента и транскрипция пользователя; аудио агента генерируется с частотой 22,05 кГц.
Полнодуплексность означает, что диалог может накладываться
Полудуплексные ассистенты обрабатывают диалог фактически как рацию: один говорит — другой ждёт.
Полнодуплексные системы могут непрерывно моделировать обе стороны разговора. Это делает возможными обработку прерываний, паузы, обмен репликами и более естественный обмен ролями.
Опубликованные результаты Full-Duplex-Bench 1.0 от NVIDIA:
| Метрика | Результат VoiceChat 11B |
|---|---|
| Плавный обмен репликами TOR (коэффициент занятости) | 0,82 |
| Задержка плавного обмена репликами | 448 мс |
| Прерывание пользователя TOR | 1,0 |
| Задержка прерывания пользователя | 480 мс |
| Оценка прерывания пользователя GPT-4o | 4,33 |
Упомянутые в оригинальной статье 448 мс относятся к бенчмарку плавного обмена репликами. В целом NVIDIA характеризует модель как обеспечивающую задержку отклика около 450 мс.
VoiceChat спроектирован так, чтобы уступать инициативу при прерывании пользователем
Обработка прерываний — одно из главных отличий между голосовой демонстрацией и полноценным разговорным агентом.
VoiceChat
Модель напрямую обучена вести диалог с обменом репликами. Когда пользователь начинает говорить в середине ответа модели, система может остановить свою реплику и слушать.
Документация NVIDIA по известным ограничениям также отмечает, что поведение не идеально во всех ситуациях. Модель всё ещё может прерывать пользователя в паузах внутри его фразы, продолжать говорить после того, как следовало остановиться, начинать новую реплику без нового ввода, зацикливаться или неправильно обрабатывать сигналы обратной связи.
Вызов инструментов в реальном времени — самая интересная инженерная особенность
VoiceChat 11B — первая открытая полнодуплексная модель NVIDIA с поддержкой вызова инструментов, спроектированная для сохранения естественного голосового взаимодействия при использовании инструментов.
Голосовым агентам часто требуется информация, которой нет внутри модели. Например:
Какой текущий статус моего заказа?
Модели может потребоваться сначала обратиться к API управления заказами, прежде чем ответить.
VoiceChat поддерживает подтверждающие сообщения для инструментов. Разработчики могут задать короткие фразы, например:
Хорошо, сейчас проверю для вас.
Когда модель решает вызвать инструмент, система может произнести одну из таких фраз во время обработки внешнего запроса.
Упрощённый процесс выглядит так:
Пользователь говорит
↓
VoiceChat отвечает
↓
Модель определяет необходимость инструмента
↓
Событие вызова инструмента отправляется клиенту
↓
Клиент выполняет внешнюю функцию
↓
Результат инструмента возвращается в VoiceChat
↓
VoiceChat возобновляет голосовой ответ
Важные ограничения вызова инструментов
NVIDIA рекомендует максимум около пяти инструментов на сессию, поскольку при большем количестве доступных инструментов производительность может снижаться.
Модель в настоящее время также не может надёжно вызывать несколько инструментов одновременно.
Другие ограничения включают неправильный выбор инструмента, пропуск вызова, выдуманные параметры, ошибочное озвучивание результатов и обращение к внутренним знаниям, когда следовало использовать инструмент.
Особенно важная деталь: хотя VoiceChat поддерживает прерывание пользователем в обычном диалоге, сейчас пользователь не может прервать агента во время выполнения инструмента.
Результаты бенчмарков вызова инструментов
Заявленные результаты AU Harness:
| Категория вызова инструментов | Оценка |
|---|---|
| Простой | 58,5% |
| Множественный | 62,5% |
| Параллельный | 42,5% |
| Параллельный множественный | 27,5% |
| Неактуальность | 89,6% |
| Средний | 56,1% |
На Full-Duplex-Bench v3 NVIDIA сообщает:
| Метрика | Оценка |
|---|---|
| Выбор инструмента | 82,5% |
| Точность параметров | 44,2% |
| Pass@1 | 33% |
Эти цифры показывают, что в продакшене вызов инструментов всё ещё должен быть защищён прикладной логикой и валидацией параметров.
VoiceChat занимает высокие позиции среди открытых полнодуплексных моделей
NVIDIA сообщает, что VoiceChat занимает второе место среди открытых полнодуплексных моделей как в VoiceBench, так и в Full-Duplex-Bench 1.0.
Модель оптимизирована под компромисс между общим интеллектом и естественным живым диалогом. NVIDIA прямо предупреждает, что по знаниям, следованию инструкциям, безопасности и задачам рассуждения модель может уступать базовой языковой модели Nemotron Nano v2.
Модель обучена примерно на 550 тысячах часов аудио
В карточке модели NVIDIA указано около 550 тысяч часов аудиоданных для обучения.
Смешанные данные
включают реальную и синтезированную речь, а также текстовые данные для языкового компонента. Среди названных источников — Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, внутренние речевые данные NVIDIA, синтезированная речь, данные функций вызова Nemotron и обучающие данные PersonaPlex.
VoiceChat использует фиксированный голос
Текущий чекпойнт VoiceChat не поддерживает клонирование голоса.
В репозитории NVIDIA указано, что опубликованный чекпойнт использует фиксированный голос. Цель релиза более сфокусирована: низкая задержка, полнодуплексное разговорное поведение и голосовое взаимодействие с поддержкой инструментов.
Аппаратные требования довольно высоки
Текущие предпосылки NVIDIA для развёртывания в реальном времени прямо требуют:
GPU NVIDIA с объёмом видеопамяти не менее 80 ГБ
В документации к контейнеру перечислены поддерживаемые GPU: NVIDIA A100, H100, RTX 6000 Pro и B200. Более широкая карточка модели также указывает совместимость с H200 и B100.
Для оптимизированного контейнера реального времени NVIDIA в настоящее время требует x86_64, Linux, Docker, контейнерный тулкит NVIDIA и совместимые драйверы NVIDIA.
В руководстве по устранению неполадок указано, что сама модель использует около 66 ГБ памяти GPU.
Пока нет готового управляемого API для инференса
По состоянию на 11 августа на странице модели Hugging Face не указан активный провайдер инференса для этой контрольной точки.
Вместо этого NVIDIA предлагает два основных пути:
- Автономный инференс — на основе контрольной точки Hugging Face
- Интерактивная потоковая передача — через оптимизированный контейнер NVIDIA
Контейнер реального времени включает CUDA, Triton, vLLM и полный стек инференса VoiceChat, а также предоставляет двунаправленный WebSocket-сервис.
Как запустить автономный инференс
Клонируйте экспериментальную ветку VoiceChat от NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
Создайте окружение:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
Скачайте контрольную точку:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
Запустите пример:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
NVIDIA рекомендует добавлять достаточно тишины в конец пользовательского входного аудио, чтобы у модели было время ответить.
Как развернуть контейнер реального времени
Скачайте репозиторий модели:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
Запустите сервис:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
Проверьте готовность:
curl 'http://localhost:9000/v1/realtime/health'
После этого сервер предоставляет двунаправленную WebSocket-точку по адресу:
ws://localhost:9000/v1/realtime
Простое определение инструмента
Пример упрощённого определения инструмента:
[
{
"name": "get_weather",
"description": "Получить текущую погоду в указанном городе",
"ack_messages": [
"Хорошо, сейчас проверю."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
Поле ack_messages предоставляет системе естественные ответы во время выполнения инструмента.
Только для исследований; производственным командам следует проявлять осторожность
NVIDIA явно помечает VoiceChat 11B как только для исследовательских целей.
Модель обучалась с аудиоконтекстом не более примерно двух минут, поэтому более длинные контексты диалога могут надёжно не сохраняться.
Известные проблемы включают ошибки инференса, галлюцинации, ухудшение качества речи после нескольких раундов диалога, повторы, искажённый текст, обрывы речи, неконтролируемое продолжение, самодиалог, циклы уточнений, пропущенные слова в транскрипции, ненадёжное переключение языков, а также низкую производительность в шумной или сильно реверберирующей среде.
Потенциальные сценарии использования VoiceChat 11B
Потенциальные исследовательские и прототипные сценарии включают:
Контакт-центры
Агент может естественно слушать, обрабатывать перебивания, вызывать инструменты поддержки клиентов и использовать подтверждающие сообщения в ожидании ответа API.
Автомобильные помощники
Водитель может прервать ассистента, не дожидаясь завершения полного голосового ответа. Текущая чувствительность к фоновому шуму означает, что автомобильное развёртывание потребует дополнительной оптимизации.
Розничные и ресторанные заказы
Голосовой агент может принимать заказы, реагировать на исправления и обращаться к системам товаров или инвентаря.
Средства доступности
Более естественная смена реплик способствует использованию интерфейсов без рук и голосовых приложений, но развёртывание для доступности требует тщательного пользовательского тестирования.
Корпоративные голосовые агенты
Организации могут экспериментировать с внутренними инструментами и самостоятельным голосовым взаимодействием, сохраняя модель в рамках собственной инфраструктуры.
Открытая модель, но две разные лицензии
Термин «открытый исходный код» требует более точного понимания.
Код NeMo Speech, используемый VoiceChat, распространяется под лицензией Apache License 2.0.
Материалы модели VoiceChat распространяются под лицензией OpenMDW 1.1.
Поэтому более корректно описывать VoiceChat 11B как открытую модель или модель с открытыми весами, а не предполагать, что лицензия модели идентична лицензии окружающего программного обеспечения на Apache.
Командам, планирующим распространение или коммерческое использование, следует напрямую ознакомиться с лицензией OpenMDW.
Что разработчикам следует протестировать перед производством
Полезный план оценки должен охватывать:
Смену реплик в диалоге и обработку перебиваний пользователем
Паузы в середине предложения и сигналы обратной связи
Шумное, эховое и многоголосое аудио
Ошибочные или отсутствующие параметры инструментов
Таймаут инструментов и сбои вызовов API
- Длинные диалоги
- Неконтролируемая речь
- Проблемы с галлюцинациями и качеством рассуждений
- Требуется одобрение для чувствительных операций
- Журналирование, ограничение скорости и эскалация на человека
Голосовые агенты, способные вызывать инструменты, требуют тех же механизмов контроля разрешений, что и другие автономные агенты.
Часто задаваемые вопросы
Что такое NVIDIA NemotronLabs VoiceChat 11B?
NemotronLabs VoiceChat 11B — это сквозная модель «речь-в-речь» от NVIDIA для диалогового ИИ в режиме реального времени с полнодуплексной связью. Она объединяет потоковое распознавание речи, языковую модель Nemotron в качестве основы, синтез речи и отдельный канал для вызова инструментов.
Насколько быстр VoiceChat 11B?
NVIDIA сообщает о задержке плавного обмена репликами в 448 миллисекунд и задержке прерывания около 480 миллисекунд по результатам теста Full-Duplex-Bench 1.0.
Может ли пользователь прервать VoiceChat во время речи?
Да, в обычном диалоге поддерживаются вставки и прерывания. Однако NVIDIA отмечает, что во время выполнения инструментов пользователь в настоящее время не может прервать агента.
Поддерживает ли VoiceChat 11B вызов функций?
Да. Модель может发出 вызовы инструментов через отдельный выходной канал, а разработчики могут задавать подтверждающие сообщения, которые воспроизводятся во время выполнения внешних инструментов.
Сколько видеопамяти GPU требуется VoiceChat 11B?
Контейнер реального времени от NVIDIA требует GPU с объёмом видеопамяти не менее 80 ГБ. В документации по устранению неполадок указано, что загруженная модель занимает около 66 ГБ.
Существует ли управляемый API для VoiceChat 11B?
NVIDIA в настоящее время предлагает документацию для автономного инференса с самостоятельным размещением и оптимизированного контейнера реального времени. На странице модели на Hugging Face управляемые инференс-провайдеры пока не указаны.
Может ли VoiceChat клонировать голоса?
Нет. Выпущенные контрольные точки используют фиксированный голос и не поддерживают клонирование голоса.
Можно ли использовать VoiceChat 11B в производственной среде?
NVIDIA помечает эту модель как предназначенную только для исследований. Разработчики должны оценить её ограничения — длину контекста, рассуждения, использование инструментов, шумный аудиосигнал, повторы, транскрипцию и неконтролируемую речь — перед развёртыванием в производстве.
Связанные инструменты
- NVIDIA NemotronLabs VoiceChat 11B: официальная карточка модели, веса, бенчмарки, архитектура, лицензия и инструкции по инференсу.
- NVIDIA NeMo Speech: официальный репозиторий, содержащий реализацию VoiceChat и ветку для развёртывания.
- Руководство по контейнеру реального времени VoiceChat от NVIDIA: официальная документация по Docker, WebSocket и развёртыванию вызова функций.
- Набор инструментов контейнеров NVIDIA: обеспечивает доступ контейнеров Docker к GPU NVIDIA.
- vLLM: движок инференса, указанный в карточке модели NVIDIA VoiceChat.
- VoiceBench: открытый бенчмарк для оценки голосовых ассистентов на основе LLM.
Связанные ссылки
Основной источник с информацией о дате выпуска, бенчмарках, обучающих данных, архитектуре и статусе «только для исследований».
- Ветка GitHub для VoiceChat: официальный исходный код, инструкции по установке, требования к оборудованию, ограничения и описание модели.
- Предварительные требования для развёртывания в реальном времени: требования к оборудованию, Linux, Docker, драйверам и набору инструментов контейнеров.
- Руководство по развёртыванию в реальном времени: документация NVIDIA по запуску контейнера, проверке работоспособности, WebSocket, клиентам и вызову инструментов.
- Лицензия OpenMDW 1.1: лицензия, регулирующая использование материалов модели VoiceChat.
- Full-Duplex-Bench: бенчмарк для оценки обработки пауз, очередности речи и поведения при прерываниях.
- Full-Duplex-Bench v3: бенчмарк, посвящённый полнодуплексному устному взаимодействию с вызовом инструментов.
Резюме
NVIDIA NemotronLabs VoiceChat 11B объединяет распознавание речи, языковое моделирование, синтез речи, обработку прерываний и вызов инструментов в единой полнодуплексной архитектуре. NVIDIA сообщает о задержке смены реплик всего в 448 миллисекунд и позиционирует модель как лидирующую в текущих открытых бенчмарках полнодуплексной речи.
Наиболее примечательной инженерной особенностью является вызов инструментов. Отдельный выходной канал может запускать внешние функции, а подтверждающие сообщения предотвращают тишину в диалоге во время вызовов API.
Данный релиз пока не является готовым к производству полноценным сервисом. Для развёртывания в реальном времени требуется не менее 80 ГБ видеопамяти GPU, текущие контрольные точки используют фиксированный голос, управляемый инференс пока широко не доступен, и NVIDIA явно документирует существенные ограничения в длинных сессиях, рассуждениях, шумном аудио и выполнении инструментов.
VoiceChat 11B лучше рассматривать как открытую исследовательскую платформу для создания и изучения низколатентных голосовых агентов, а не как готовое решение для замены контакт-центров или коммерческих голосовых API в производственной среде.