研究人员已识别并解决了全双工语音大语言模型中存在的一个问题,即像 Moshi 和 PersonaPlex 这样的模型会在用户长时间沉默期间不当地启动语音。该问题源于语音概率的突然激增,而非重复采样。开发了一种新的推理时方法,通过评估在用户输入被静音的情况下模型的响应是否会发生变化来抑制这些虚假启动,成功消除了所有测试的虚假启动,且不影响真实响应。 AI
影响 引入了一种无需重新训练的实时方法,以提高全双工语音大语言模型的可靠性。
排序理由 学术论文,详细介绍了一种缓解语音大语言模型特定问题的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →