研究人员开发了一个名为 Parallel Shapley 的新强化学习框架,以解决大型语言模型(LLMs)多步推理中的奖励归因挑战。该方法将每个推理路径视为合作博弈中的一个参与者,使用 Shapley 值量化个体贡献,并使用带有蒙特卡洛采样的生成奖励模型进行有效近似。在数学推理基准上的实验表明,与现有方法相比,Parallel Shapley 能够实现更稳定和可解释的训练,有效识别和惩罚冗余或有害的推理路径。 AI
影响 该框架有望提高 LLMs 在复杂推理任务训练中的效率和可解释性。
排序理由 该集群包含一篇详细介绍 LLM 推理新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- large-language models
- Monte Carlo Sampling Methods
- Parallel Shapley
- reinforcement learning
- Shapley Values
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →