PulseAugur
实时 10:32:47
English(EN) UXBench: Benchmarking User Experience in AI Assistants

新的UXBench基准测试评估AI助手用户体验

研究人员推出UXBench,这是一个旨在评估AI助手用户体验的新型基准测试。该基准测试是第一个使用真实用户反馈信号的基准测试,包含三个任务:UX Judge、UX Eval和UX Recovery。它建立在一个包含7400个实例的数据集之上,这些实例来源于一个中国AI助手的70000多条交互日志,涵盖了各种场景和失败模式。对26个语言模型的实验表明,用户反馈预测是一项可学习的能力,并突出了当前LLM作为裁判的评估方法中的偏见。 AI

影响 为AI助手建立了一个新的评估框架,推动超越原始能力的用户中心优化。

排序理由 该集群包含一篇介绍AI助手评估新基准测试的研究论文。

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的UXBench基准测试评估AI助手用户体验

报道来源 [2]

  1. arXiv cs.CL TIER_1 English(EN) · Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, C… ·

    UXBench:为 AI 助手进行用户体验基准测试

    arXiv:2606.09570v2 Announce Type: replace Abstract: As AI assistants serve millions of users daily, evaluating user experience (UX) beyond general model capability has become increasingly important. We present UXBench, the first user-centric benchmark grounded in real user feedba…

  2. arXiv cs.CL TIER_1 English(EN) · Davey Chen ·

    UXBench:为 AI 助手评测用户体验

    As AI assistants serve millions of users daily, evaluating user experience (UX) beyond general model capability has become increasingly important. We present UXBench, the first user-centric benchmark grounded in real user feedback signals for evaluating preference alignment and d…