英伟达近日推出首款开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B。该模型以统一网络直接完成流式语音理解与生成,区别于传统 ASR、LLM、TTS 串联架构,实测平滑轮换延迟低至 448 毫秒,支持边听边说及用户插话时让出话语权。VoiceChat 11B 还支持对话进行中的工具调用,通过独立输出通道和预置“保持”话术处理外部 API 请求。目前模型处于试点阶段,仅限研究用途,运行需至少 80GB 显存 GPU,尚未提供成熟托管 API。
英伟达近日推出首款开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B。该模型以统一网络直接完成流式语音理解与生成,区别于传统 ASR、LLM、TTS 串联架构,实测平滑轮换延迟低至 448 毫秒,支持边听边说及用户插话时让出话语权。VoiceChat 11B 还支持对话进行中的工具调用,通过独立输出通道和预置“保持”话术处理外部 API 请求。目前模型处于试点阶段,仅限研究用途,运行需至少 80GB 显存 GPU,尚未提供成熟托管 API。