研究人员推出了TELEVAL,一个旨在评估中文交互场景中口语语言模型(SLMs)的新基准。与专注于结构化设置中语义正确性的现有基准不同,TELEVAL通过将行为与听觉线索联系起来,评估在各种声学和语言条件下可靠的内容完成能力以及交互的恰当性。实验表明,虽然当前的SLMs在语义任务上表现良好,但在交互设置和声学可变性下的性能会显著下降,常常陷入“字幕陷阱”,即它们描述音频而不是恰当地响应。 AI
影响 该基准旨在提高口语语言模型的交互能力,推动它们超越简单的任务完成,实现更自然、更具上下文感知的对话。
排序理由 该集群包含一篇介绍用于评估AI模型的新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →