研究人员推出TurnBench,一个旨在评估口语对话系统轮次动态的新基准。该基准包含一个30小时、经过人工标注的、跨越六种互动风格的人类对话语料库,以及一个用于检测轮次结束和打断的标准评估协议。对14个系统的初步基准测试显示,虽然轮次结束检测一致性较高,但打断的误报率因对话类型而异。研究还指出,当前系统在不产生过多误报的情况下,难以复制人类轮次转移的微妙时机。 AI
影响 该基准通过提供一种衡量和增强轮次能力(turn-taking capabilities)的标准方法,有望推动对话式AI的改进。
排序理由 该集群描述了一篇介绍用于评估对话式AI基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →