最新消息:关注人工智能 AI赋能新媒体运营

英伟达发布开源全双工语音模型VoiceChat 11B

科技资讯 admin 浏览

英伟达推出开源端到端全双工语音对话模型 VoiceChat11B

英伟达近日发布旗下首款开源端到端全双工语音对话模型 NemotronLabs VoiceChat11B,正式进军实时人工智能语音交互领域。

与传统需要串联语音识别(ASR)、大语言模型(LLM)及语音合成(TTS)的分步架构不同,VoiceChat11B 采用统一网络直接完成流式语音理解与生成,消除了多模型编排带来的繁琐交接。实测显示,该模型平滑轮换延迟低至 448 毫秒,支持边听边说的全双工交互,可在用户插话时迅速让出话语权。

VoiceChat11B 也是首个在对话进行中支持工具调用的开源全双工模型。其引入独立输出通道与预置"保持"话术机制,在处理复杂外部 API 请求时,可通过侧通道自动触发过渡台词,避免等待期间的长时间静默。

目前该模型仍处于试点阶段,运行需单张至少 80GB 显存的高性能 GPU,且仅限研究用途,尚未提供成熟托管 API。尽管在长上下文及多轮对话等极端场景下仍有局限,但其开放权重与容器设计已为联络中心、汽车座舱、零售点餐及智能无障碍辅助等领域提供了新的开发方向。