研究人员推出了 HEAR,这是一个旨在评估语音语言模型 (SLM) 说话人归因推理能力的新基准。该基准包含来自 887 个音频剪辑的 2.4K 个人工验证样本,结果显示当前领先的 SLM 在这些任务上存在困难,通常优先考虑语义信息而非语音线索。为了解决这个问题,开发了一个新的 30B 模型 A2R,该模型在一个强调声学线索的数据集上进行了训练,在 HEAR 上表现强劲,并能对下游任务进行零样本泛化。 AI
影响 这项研究可能带来更强大的语音语言模型,能够准确地将对话归因于说话人,从而改进多方音频分析和转录等应用。
排序理由 该集群描述了一篇介绍语音语言处理新基准和模型的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →