FEATUREDAI HOT 精选· aihot-apiZH23:58 · 08·09
NVIDIA 开源 NemotronLabs VoiceChat 11B:一个模型搞定语音对话,抢话延迟约 450 毫秒,还能边聊边调工具
NVIDIA 把 NemotronLabs VoiceChat 11B 的权重和代码都公开了。这是一个 110 亿参数、端到端的语音模型,不再走传统的“语音识别转文字、大模型思考、文字转语音”流水线,而是把听和说塞进同一个网络里流式处理。实测抢话反应延迟是 448 毫秒,基本跟人对话的节奏差不多。它支持全双工,也就是双方可以同时说话、随时打断,模型能实...
#NVIDIA#NemotronLabs#Open source
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
NVIDIA 把语音模型从“听写-思考-朗读”的流水线,压缩成一个能边听边说、随时打断的 11B 模型,抢话延迟压到 448 毫秒,还开源了权重。
锐评
这条消息最值得看的是架构简化。传统语音助手走 ASR-LLM-TTS 三步流水线,每一步都有延迟,打断体验很僵硬。NemotronLabs VoiceChat 11B 把听和说塞进同一个网络里流式处理,实测抢话反应延迟 448 毫秒,跟人对话的节奏差不多。它还支持对话中实时调用工具,比如查天气、订票,不用等一轮对话结束再动手。
不过要打个折:448 毫秒是在什么硬件、什么网络条件下测的,正文没披露。11B 参数对端侧部署来说不算轻,手机或嵌入式设备能不能跑得动、功耗多少,也没提。另外,全双工意味着双方可以同时说话,模型在嘈杂环境下的误打断率和漏打断率,文章同样没给数字。
开源权重和代码是好事,但实际能落地的场景还缺一份硬件基准和噪声鲁棒性报告。如果你打算拿它做实时语音产品,建议先在自己的目标设备上跑一下延迟和打断准确率,别只看纸面数字。
HKR 分解
hook ✓knowledge ✓resonance ✓