研究人员推出 DuplexAct-Bench,这是一个新的双语基准,旨在评估全双工语音系统。该基准通过系统地涵盖六种不同的交互行为,包括打断、让步、主动发起和回应,来扩展现有评估。该基准在 1,290 次英语和中文试验中评估了这些交互的及时性和内容,揭示了当前系统之间显著的性能差异,并突显了它们在管理实时对话动态方面的局限性。 AI
影响 为对话式人工智能建立了更全面的评估标准,有可能推动实时交互能力的改进。
排序理由 该集群包含一篇详细介绍用于评估人工智能系统的新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →