一篇新研究论文介绍了一个评估语言模型与用户任务对齐能力的框架,即使这些任务是模糊的或不完全指定的。该方法被形式化为一个部分可观察马尔可夫决策过程(POMDP),测试模型在不断演变的用户交互中推断用户真实意图的能力。人类研究表明,当前模型在此任务对齐方面存在显著困难,仅在22-32%的时间内能恢复用户的意图任务,而人类的成功率为48%。尽管监督微调和强化学习有所改进,但在通过交互解决不确定性方面,模型仍落后于人类能力,表明其在交互式自主性方面存在差距。 AI
影响 突出了当前AI模型在理解和解决模糊用户请求方面的关键差距,表明需要改进交互式自主性。
排序理由 该集群包含一篇详细介绍新框架和语言模型能力研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Language Models
- partially observable Markov decision process
- reinforcement learning
- supervised fine-tuning
- task alignment
- User Simulator
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →