研究人员开发了一种名为状态转移式评分信用分配(TRCA)的新方法,以改进长时程大语言模型(LLM)智能体的训练。TRCA通过使用评分标准来评估每个动作引起的转换(包括证据、执行和无效性),解决了稀疏终端结果任务中的信用分配难题。这种方法在不依赖学习型评估器或稀缺成功轨迹的情况下,生成了细粒度的步级奖励。在ALFWorld和WebShop等基准测试上的实验表明,与现有方法相比,尤其是在使用Qwen2.5模型时,TRCA取得了持续的改进。 AI
影响 TRCA为大语言模型智能体的信用分配提供了一种新颖的方法,有望实现更高效的复杂、长时程任务训练。
排序理由 该集群包含一篇学术论文,详细介绍了一种训练大语言模型智能体的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →