研究人员推出了一种名为指数奖励加权微调(Exp-RSFT)的新方法,用于改进生成式推荐系统,尤其是在处理稀疏和嘈杂的用户反馈时。该技术根据奖励值对记录的交互进行加权,并使用一个温度参数来平衡利用高奖励行为与保持对不完美数据的鲁棒性之间的权衡。与其他方法(如近端策略优化(PPO)和直接偏好优化(DPO))不同,Exp-RSFT避免了对不可靠奖励模型的过度优化,并且在不需要在线探索或显式偏好数据的情况下,持续提高了推荐性能。 AI
影响 这种新方法可以提高推荐系统的准确性和可靠性,尤其是在用户数据有限或嘈杂的情况下。
排序理由 该集群包含一篇研究论文,详细介绍了微调生成式推荐系统的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
- alphaXiv
- arXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Direct Preference Optimization
- Exp-RSFT
- Gotit.pub
- Hugging Face
- Influence Flower
- Keertana Chidambaram
- Proximal Policy Optimization
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →