PulseAugur
实时 04:26:43
English(EN) Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback

新方法Exp-RSFT增强了生成式推荐系统

研究人员推出了一种名为指数奖励加权微调(Exp-RSFT)的新方法,用于改进生成式推荐系统,尤其是在处理稀疏和嘈杂的用户反馈时。该技术根据奖励值对记录的交互进行加权,并使用一个温度参数来平衡利用高奖励行为与保持对不完美数据的鲁棒性之间的权衡。与其他方法(如近端策略优化(PPO)和直接偏好优化(DPO))不同,Exp-RSFT避免了对不可靠奖励模型的过度优化,并且在不需要在线探索或显式偏好数据的情况下,持续提高了推荐性能。 AI

影响 这种新方法可以提高推荐系统的准确性和可靠性,尤其是在用户数据有限或嘈杂的情况下。

排序理由 该集群包含一篇研究论文,详细介绍了微调生成式推荐系统的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.IR (Information Retrieval) 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法Exp-RSFT增强了生成式推荐系统

报道来源 [1]

  1. arXiv cs.IR (Information Retrieval) TIER_1 English(EN) · Moumita Bhattacharya ·

    指数奖励加权用于稀疏和嘈杂反馈下的生成式推荐器微调

    In recommendation systems, users interact with only a small fraction of a vast item catalog, producing feedback that is both sparse and noisy. This challenges post-training generative recommenders: reward models trained from logged interactions often fail to generalize, while dir…