引入了一个新的基准 DuplexSpeechBench-IFEval (DSB-IFEval),用于评估全双工语音代理根据角色或个性隐式遵循指令的能力,而不是显式命令。该基准包含八个助手角色下的 1,038 个测试用例,并衡量指令遵循度和个性一致性。初步测试显示,虽然 F-Actor 和 PersonaPlex 等模型对指令类型敏感,但 GPT-Realtime 和 MiniCPM-o 等模型在个性一致性方面表现出色,但在适应不同指令方法的楼层行为方面存在困难。 AI
影响 该基准可以通过提高语音代理从上下文中推断用户意图的能力,从而实现更自然、更直观的语音代理交互。
排序理由 该集群包含一篇介绍用于评估 AI 系统的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- DSB-IFEval
- DuplexSpeechBench-IFEval
- F-Actor
- Fun-Audio-Chat
- gpt-realtime
- Instruction Adherence Score
- MiniCPM-o
- Persona Adherence Score
- PersonaPlex
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →