研究人员推出了SPEARBench,这是一个旨在评估流式语音到语音语言模型自然度的新基准。与传统基准不同,SPEARBench侧重于对话方面,如时机、轮流和情感适宜性。该基准使用来自Seamless Interaction语料库的提示,并从多个维度评估模型,包括延迟、中断和方言一致性。初步结果表明,尽管当前模型表现出高信号质量和低错误率,但在几个关键领域仍未达到人类对话行为的水平。 AI
影响 该基准有望推动语音到语音AI系统对话自然度的改进。
排序理由 该集群描述了一个用于评估AI模型的新学术基准,发布在arXiv上。
- alphaXiv
- arXiv
- Bibliographic Explorer
- CatalyzeX
- Connected Papers
- CORE Recommender
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- Litmaps
- ScienceCast
- scite Smart Citations
- Seamless Interaction corpus
- SPEARBench
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →