英伟达发布开源全双工语音模型 VoiceChat 11B

英伟达近日推出首款开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B。该模型以统一网络直接完成流式语音理解与生成,区别于传统 ASR、LLM、TTS 串联架构,实测平滑轮换延迟低至 448 毫秒,支持边听边说及用户插话时让出话语权。VoiceChat 11B 还支持对话进行中的工具调用,通过独立输出通道和预置“保持”话术处理外部 API 请求。目前模型处于试点阶段,仅限研究用途,运行需至少 80GB 显存 GPU,尚未提供成熟托管 API。

上一篇:

下一篇:

发表回复

登录后才能评论