研究人员推出了一种新颖的强化学习框架Owen-Shapley Policy Optimization (OSPO),旨在解决用于个性化推荐任务的大型语言模型中的信用分配问题。标准方法难以识别哪些特定token有助于高质量输出,尤其是在从不明确的语言推断用户意图时。OSPO根据token的边际贡献重新分配序列级奖励,在不要求参数化价值模型的情况下进行片段级信用分配。 AI
影响 这种新的RL算法可以通过更好地将信用归因于特定的输出片段来提高LLM在推荐任务中的性能。
排序理由 这是一篇详细介绍LLM新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →