研究人员引入了一种名为行为一致性奖励(BehR)的新训练范式,以改进基于文本的世界模型。与侧重于单步状态预测的传统方法不同,BehR通过衡量日志记录动作的可能性来优化世界模型与真实环境之间的功能一致性。在WebShop和TextWorld上的实验表明,基于BehR的训练增强了长期对齐,并减少了离线评估中的假阳性,同时在推理时间规划方面也显示出适度的收益。 AI
影响 增强了基于文本的世界模型的功能对齐,可能改进代理规划和评估。
排序理由 详细介绍AI模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →