研究人员推出了UXBench Pro,这是一个旨在评估多轮对话交互中个性化用户体验的新基准测试。该基准测试包含来自真实用户跨不同任务和领域的1000个测试实例,每个实例都附带一个包含七个行为方面的用户画像。UXBench Pro采用双视角评估系统,结合用于客观判断的个性化用户奖励模型(URM)和评估跨四个认知维度交互的用户模拟器Sim4Eval。该系统还包括元基准测试URMBench和USimBench,以验证这些评估者相对于真实人类偏好和行为的准确性。 AI
影响 该基准测试通过提供一种衡量用户体验的标准方法,有望带来更具个性化和更有效的对话系统。
排序理由 这是一篇介绍用于评估对话系统用户体验的新基准测试的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →