研究人员推出了Rushes,这是一个新的数据集和基准,旨在研究人类如何与AI生成的交互式叙事互动。该数据集捕获了来自8000名用户的超过44000个决策事件,侧重于顺序的、个性化的互动,而不是静态判断。初步研究结果揭示了一个显著的“互动差距”,即包括GPT-5在内的当前大型语言模型在预测用户选择方面存在困难,其表现不如简单的基线和经典的矩阵分解技术。这表明当前基于人类反馈的强化学习(RLHF)方法,通常依赖于群体层面的目标,不足以捕捉生成系统中用户偏好的异质性和依赖于上下文的性质。 AI
影响 强调了当前RLHF方法在捕捉交互式AI系统中异质用户偏好方面的局限性。
排序理由 该集群包含一篇详细介绍AI研究新数据集和基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- GPT-5
- Hugging Face
- reinforcement learning from human feedback
- Rushes
- singular value decomposition
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →