NVIDIA NemotronLabs VoiceChat 11B:リアルタイムツール呼び出しを備えたオープンな全二重音声AI

NVIDIAは、自然な全二重音声対話向けに設計されたエンドツーエンドのリアルタイム音声間モデルであるNemotronLabs VoiceChat 11Bを発表しました。一般的なパイプライン方式とは異なり、

发布于 2026年8月11日generalGEO 评分: 05 次阅读
NVIDIA NemotronLabs VoiceChat 11B:リアルタイムツール呼び出しを備えたオープンな全二重音声AI

NVIDIA NemotronLabs VoiceChat 11B、オープン音声AIに全二重音声とリアルタイムツール呼び出しをもたらす

はじめに

NVIDIAは、NemotronLabs VoiceChat 11Bをリリースしました。これは、自然な全二重音声対話のために設計された、エンドツーエンドのリアルタイム音声-to-音声モデルです。

自動音声認識、大規模言語モデル、テキスト読み上げを直列に接続する一般的なパイプラインとは異なり、VoiceChatは統合アーキテクチャ内でストリーミング音声理解と音声生成を処理します。その目標は、通常レイテンシを増加させ、音声アシスタントを不自然に感じさせる受け渡しを削減することです。

このモデルは、会話が進行している間に聞き取り、ユーザーが割り込んだ際には発言権を譲り、ユーザーが話し終えた後に自然に再開することができます。NVIDIAはFull-Duplex-Bench 1.0において、スムーズなターンテイキング遅延448ミリ秒、割り込み遅延約480ミリ秒を報告しています。

VoiceChatはまた、本番環境の音声エージェントに特に関連する機能を導入しています。音声対話をアクティブに保ちながらのリアルタイムツール呼び出しです。専用の出力チャネルがツール呼び出し命令を発行でき、定義済みの確認メッセージにより、エージェントは外部APIリクエスト中に厄介な沈黙を避けることができます。

このリリースは重要ですが、まだ初期段階にあります。NVIDIAはこのモデルを研究用途限定と位置付け、デプロイには大量のGPUメモリが必要であるとし、長時間の会話、騒がしい環境、推論、複数ツール使用、制御不能な音声に関するいくつかの制限を文書化しています。

統合された音声-to-音声アーキテクチャ

従来のリアルタイム音声アシスタントは通常、次のようになっています:

ユーザーの音声
   ↓
ASR(自動音声認識)
   ↓
テキスト
   ↓
LLM(大規模言語モデル)
   ↓
テキスト応答
   ↓
TTS(テキスト読み上げ)
   ↓
エージェントの音声

VoiceChatはこれらの機能を、より緊密に統合された単一のモデルに統合します。

NVIDIAはこの11Bシステムを、ハイブリッドMamba/Transformerアーキテクチャとして説明しています。構成要素は以下の通りです:

  • Fast Conformer音声エンコーダ
  • Nemotron Nano v2 9B言語モデルバックボーン
  • NVIDIA TTSデコーダおよびオーディオコーデック
  • ツール呼び出しスクリプト用の独立チャネル

ユーザーは16 kHzで音声を入力します。出力にはエージェントのテキスト、エージェントの音声、ユーザーの書き起こしテキストが含まれ、エージェントのオーディオは22.05 kHzで生成されます。

全二重は対話の重なりを意味する

半二重アシスタントは、実際にはトランシーバーのように会話を処理します。一方が話し終えてから、他方が応答します。

全二重システムは、対話の両側を継続的にモデル化できます。これにより、割り込み処理、ポーズ、行き来するやり取り、より自然なターンテイキングが可能になります。

NVIDIAが公開したFull-Duplex-Bench 1.0の結果は以下の通りです:

指標 VoiceChat 11Bの結果
スムーズなターンテイキングTOR(ターン占有率) 0.82
スムーズなターンテイキング遅延 448ミリ秒
ユーザー割り込みTOR 1.0
ユーザー割り込み遅延 480ミリ秒
ユーザー割り込みGPT-4oスコア 4.33

元のニュース記事で言及された448ミリ秒という数値は、スムーズなターンテイキングベンチマークに基づいています。NVIDIAはこのモデルを、約450ミリ秒の応答遅延を提供するものと概括しています。

VoiceChatはユーザーが割り込んだ際に発言権を譲る設計

割り込み処理は、音声デモと実用的な会話エージェントの間の最大の違いの一つです。

VoiceChat

このモデルは、対話的なターンテイキングに直接的にトレーニングされています。ユーザーがモデルの応答の途中で話し始めると、システムは音声ターンを停止して聞き取ることができます。

NVIDIAの既知の制限に関するドキュメントは、この動作がすべての状況で完璧ではないことも示しています。モデルは依然として、ユーザーの文の区切りでユーザーを遮ったり、停止すべき後に話し続けたり、新しい入力がないのに新しいターンを開始したり、ループに陥ったり、フィードバック信号を誤って処理したりする可能性があります。

リアルタイムツール呼び出しは最も興味深いエンジニアリング機能

VoiceChat 11Bは、ツール呼び出しをサポートするNVIDIA初のオープンソース全二重モデルであり、ツールを使用しながら自然な音声対話を維持するように設計されています。

音声エージェントは、モデル内部に含まれていない情報を必要とすることがよくあります。例えば:

私の注文の現在のステータスは?

モデルは、回答する前に注文管理APIを呼び出す必要があるかもしれません。

VoiceChatはツールの確認メッセージをサポートしています。開発者は以下のような短いフレーズを定義できます:

かしこまりました。確認いたします。

モデルがツールを呼び出すと判断した場合、システムは外部リクエストの処理中にこれらのフレーズのいずれかを発話できます。

簡略化されたフローは以下の通りです:

ユーザーが話す
   ↓
VoiceChatが応答
   ↓
モデルがツールの必要性を判断
   ↓
ツール呼び出しイベントがクライアントに送信
   ↓
クライアントが外部機能を実行
   ↓
ツール結果がVoiceChatに返される
   ↓
VoiceChatが音声回答を再開

重要なツール呼び出しの制限

NVIDIAは、利用可能なツールが多すぎるとパフォーマンスが低下する可能性があるため、セッションごとに最大約5つのツールを推奨しています。

このモデルは現在、複数のツールを同時に確実に呼び出すことはできません。

その他の制限には、ツール選択の誤り、ツール呼び出しのスキップ、パラメータの捏造、ツール結果の誤った口述、ツールを使用すべき場面で内部知識に頼ることなどが含まれます。

特に重要な詳細:VoiceChatは通常の会話ではユーザーによる割り込みをサポートしていますが、現在ユーザーはツール実行中にエージェントを割り込むことはできません

ツール呼び出しベンチマーク結果

報告されているAU Harnessの結果は以下の通りです:

ツール呼び出しカテゴリ スコア
単純 58.5%
複数 62.5%
並列 42.5%
並列複数 27.5%
無関係 89.6%
平均 56.1%

Full-Duplex-Bench v3では、NVIDIAは以下を報告しています:

指標 スコア
ツール選択 82.5%
パラメータ精度 44.2%
Pass@1 33%

これらの数値は、本番環境でのツール呼び出しは、依然としてアプリケーションロジックとパラメータ検証によって保護されるべきであることを示しています。

VoiceChatはオープンソース全二重モデルの中で上位にランクイン

NVIDIAは、VoiceChatがVoiceBenchとFull-Duplex-Bench 1.0の両方でオープンソース全二重モデルとして2位にランクインしたと報告しています。

このモデルは、汎用インテリジェンスと自然なリアルタイム対話の間のトレードオフに最適化されています。NVIDIAは、知識、指示追従、安全性、推論タスクにおいては、基盤となるNemotron Nano v2言語モデルほどの性能を発揮しない可能性があると明確に警告しています。

このモデルは約55万時間の音声でトレーニング

NVIDIAのモデルカードは、約55万時間の音声トレーニングデータを記載しています。

この混合データ

には、実音声と合成音声、および言語モデルコンポーネント用のテキストデータが含まれます。名前付きのデータソースには、Fisher、LibriVox、LibriTTS、HiFi-TTS、VCTK、PromptTTS、UltraChat、NVIDIA内部音声データ、合成音声、Nemotron関数呼び出しデータ、PersonaPlexトレーニングデータが含まれます。

VoiceChatは固定音声を使用

現在のVoiceChatチェックポイントは、音声クローニングをサポートしていません

NVIDIAのリポジトリは、公開されたチェックポイントが固定音声を使用していることを示しています。今回のリリースの目的はより焦点を絞っています:低遅延、全二重会話動作、ツールを認識した音声対話です。

ハードウェア要件はかなり高い

NVIDIAの現在のリアルタイムデプロイ前提条件は明確に次のことを要求しています:

少なくとも80 GBのVRAMを備えたNVIDIA GPU

ドキュメントに記録されたコンテナがサポートするGPUには、NVIDIA A100、H100、RTX 6000 Pro、B200が含まれます。より広範なモデルカードには、H200およびB100の互換性も記載されています。

最適化されたリアルタイムコンテナの場合、NVIDIAは現在、x86_64、Linux、Docker、NVIDIAコンテナツールキット、互換性のあるNVIDIAドライバを要求しています。

トラブルシューティングガイドは、モデル自体が約66 GBのGPUメモリを使用することを示しています。

まだ成熟したマネージド推論APIは存在しない

8月11日時点で、Hugging Faceのモデルページには、このチェックポイントのアクティブな推論プロバイダーは掲載されていない。

その代わりに、NVIDIAは2つの主要なパスを提供している:

  1. オフライン推論 — Hugging Faceのチェックポイントから実行
  2. 対話型ストリーミング — 最適化されたNVIDIAコンテナ経由

リアルタイムコンテナにはCUDA、Triton、vLLM、および完全なVoiceChat推論スタックがパッケージ化されており、双方向WebSocketサービスを公開している。

オフライン推論の実行方法

NVIDIAの実験的なVoiceChatブランチをクローンする:

git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"

環境を作成する:

conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2             huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0             torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps             causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1

チェックポイントをダウンロードする:

hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B   --local-dir /path/to/checkpoint

サンプルを実行する:

conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py"   --checkpoint /path/to/checkpoint   --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav"   --output-dir /path/to/output

NVIDIAは、モデルが応答する時間を確保するために、カスタム入力音声の末尾に十分な無音を追加することを推奨している。

リアルタイムコンテナのデプロイ方法

モデルリポジトリをダウンロードする:

ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0

サービスを起動する:

docker run -it --rm
--name=nemotron-labs-voicechat   --runtime=nvidia   --gpus '"device=0"'   --shm-size=8GB   -e NIM_HTTP_API_PORT=9000   -p 9000:9000   -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models   --entrypoint /s2s/run_s2s_server.sh   nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest

readinessを確認する:

curl 'http://localhost:9000/v1/realtime/health'

その後、サーバーは以下のアドレスで双方向WebSocketエンドポイントを公開する:

ws://localhost:9000/v1/realtime

シンプルなツール定義の例

簡略化されたツール定義の例は以下のとおり:

[
  {
    "name": "get_weather",
    "description": "指定された都市の現在の天気を取得します",
    "ack_messages": [
      "はい、お調べします。"
    ],
    "parameters": {
      "type": "object",
      "properties": {
        "city": {
          "type": "string"
        }
      },
      "required": ["city"]
    }
  }
]

ack_messages フィールドは、ツール実行中にシステムが自然な応答を行うための内容を提供する。

研究用途のみ、本番チームは注意が必要

NVIDIAはVoiceChat 11Bを研究専用と明示している。

このモデルはトレーニング時に約2分以下の音声コンテキストウィンドウを使用しているため、より長い会話コンテキストは確実に保持されない可能性がある。

既知の問題には、推論エラー、幻覚、複数ターン後の音声品質の低下、繰り返し、文字化けテキスト、音声の途切れ、制御不能な継続発話、自己対話、確認ループ、文字起こしでの単語欠落、言語切り替えの不安定さ、および騒がしい環境や残響の多い環境でのパフォーマンス低下が含まれる。

VoiceChat 11Bの潜在的なユースケース

潜在的な研究およびプロトタイプのシナリオは以下のとおり:

コンタクトセンター

エージェントは自然に聞き取り、割り込みを処理し、カスタマーサービスツールを呼び出し、APIの応答を待つ間に確認メッセージを使用できる。

車載アシスタント

ドライバーは完全な音声応答が終了するのを待たずにアシスタントへ割り込むことができる。現在のバックグラウンドノイズへの感度は、車載デプロイに追加の最適化作業が必要であることを意味する。

小売・飲食店での注文

音声エージェントは注文を収集し、訂正に応答し、商品や在庫システムを呼び出すことができる。

アクセシビリティ支援

より自然なターン交代はハンズフリーインターフェースや音声ファーストアプリケーションに役立つが、アクセシビリティのデプロイには慎重なユーザーテストが必要である。

エンタープライズ音声エージェント

組織は内部ツールやセルフホスト型の音声対話で実験しながら、モデルを自社インフラ内に保持できる。

オープンモデルだが、2つの異なるライセンスがある

「オープンソース」という表現はより正確に理解する必要がある。

VoiceChatが使用するNeMo SpeechコードApache License 2.0でライセンスされている。

VoiceChatモデル素材OpenMDW 1.1ライセンスを使用している。

したがって、VoiceChat 11Bを、周囲のApacheライセンスのソフトウェアと同じライセンスであると仮定するのではなく、オープンモデルまたはオープンウェイトモデルと表現する方が安全である。

再配布や商用利用を計画しているチームは、OpenMDWライセンスを直接確認する必要がある。

本番前に開発者がテストすべき内容

有用な評価計画には以下を含めるべきである:

  • 会話のターン交代とユーザーの割り込み処理

  • 文途中のポーズとフィードバック信号

  • 騒がしい環境、反響、複数話者の音声

  • 誤った、または欠落したツールパラメータ

ツールのタイムアウトとAPI呼び出しの失敗

  • 長い会話
  • 暴走する音声
  • 幻覚と推論品質の問題
  • 敏感な操作には承認が必要
  • ログ記録、レート制限、人間によるエスカレーション

ツールを呼び出せる音声エージェントには、他の自律エージェントと同じ権限制御が必要です。

よくある質問

NVIDIA NemotronLabs VoiceChat 11Bとは何ですか?

NemotronLabs VoiceChat 11Bは、NVIDIAが開発した全二重対話型AI向けのエンドツーエンドのリアルタイム音声対音声モデルです。ストリーミング音声理解、Nemotron言語モデルの中核、音声生成、独立したツール呼び出しチャネルを組み合わせています。

VoiceChat 11Bの速度はどのくらいですか?

NVIDIAは、Full-Duplex-Bench 1.0において、スムーズなターンテイキングの遅延が448ミリ秒、割り込み遅延が約480ミリ秒であると報告しています。

ユーザーはVoiceChatの話声中に割り込めますか?

はい、通常の会話では挿入や割り込み処理がサポートされています。ただし、NVIDIAはツール実行中はユーザーがエージェントに割り込めないと述べています。

VoiceChat 11Bは関数呼び出しをサポートしていますか?

はい。このモデルは独立した出力チャネルを通じてツール呼び出しを発行でき、開発者は外部ツールの実行中に再生される確認メッセージを定義できます。

VoiceChat 11BにはどのくらいのGPUメモリが必要ですか?

NVIDIAのリアルタイムコンテナには、少なくとも80 GBのVRAMを備えたGPUが必要です。トラブルシューティングのドキュメントによると、読み込み後のモデルは約66 GBを使用します。

ホスト型のVoiceChat 11B APIはありますか?

NVIDIAは現在、セルフホスト型のオフライン推論と最適化されたリアルタイムコンテナのドキュメントを提供しています。Hugging Faceのモデルページには、現在ホスト型推論プロバイダーは記載されていません。

VoiceChatは声をクローンできますか?

いいえ。公開されているチェックポイントは固定の音声を使用しており、音声クローンはサポートされていません。

VoiceChat 11Bは本番環境で使用できますか?

NVIDIAはこのモデルを研究用のみと位置付けています。開発者は本番デプロイ前に、コンテキスト長、推論、ツール使用、ノイズの多い音声、繰り返し、文字起こし、暴走音声などの制限を評価する必要があります。

関連ツール

関連リンク

主要ソースは、リリース日、ベンチマーク、トレーニングデータ、アーキテクチャ、研究用限定のステータスをカバーしています。

概要

NVIDIA NemotronLabs VoiceChat 11Bは、統一された全二重アーキテクチャに音声理解、言語モデリング、音声生成、割り込み処理、ツール呼び出し機能を統合しています。NVIDIAはターンテイキング遅延がわずか448ミリ秒であると報告し、現在のオープンな全二重音声ベンチマークでこのモデルを最前線に位置付けています。

最も注目すべきエンジニアリング上の特徴はツール呼び出しです。独立した出力チャネルが外部機能をトリガーし、同時に確認メッセージによってAPI呼び出し中に会話が沈黙するのを防ぎます。

このリリースはまだ本番稼働可能な完全なサービスではありません。リアルタイムデプロイには少なくとも80 GBのGPU VRAMが必要です。現在のチェックポイントは固定音声を使用し、ホスト型推論はまだ広く提供されておらず、NVIDIAは長いセッション、推論、ノイズの多い音声、ツール実行における顕著な制限を明確に文書化しています。

VoiceChat 11Bは、本番環境のコンタクトセンターや消費者向け音声APIを置き換える成熟したソリューションというよりも、低遅延の音声エージェントを構築・研究するためのオープンな研究プラットフォームと見なすべきです。