研究人员推出UXBench,这是一个旨在评估AI助手用户体验的新型基准测试。该基准测试是第一个使用真实用户反馈信号的基准测试,包含三个任务:UX Judge、UX Eval和UX Recovery。它建立在一个包含7400个实例的数据集之上,这些实例来源于一个中国AI助手的70000多条交互日志,涵盖了各种场景和失败模式。对26个语言模型的实验表明,用户反馈预测是一项可学习的能力,并突出了当前LLM作为裁判的评估方法中的偏见。 AI
影响 为AI助手建立了一个新的评估框架,推动超越原始能力的用户中心优化。
排序理由 该集群包含一篇介绍AI助手评估新基准测试的研究论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →