PulseAugur
实时 05:29:52
实体 RRPO

RRPO

PulseAugur coverage of RRPO — every cluster mentioning RRPO across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_180202 ·

    新的HRPO框架增强了生成式推荐系统

    研究人员开发了分层残差策略优化(HRPO),一个旨在改进生成式推荐系统的新框架。与依赖监督式下一个词预测的传统方法不同,HRPO使用结果反馈来优化下游效用。该系统通过将项目级结果转换为密集、与词对齐的学习信号来解决稀疏信用分配问题。实验,包括在商业系统中的在线A/B测试,证明了会话级效用和关键业务指标的一致性改进。

  2. RESEARCH · CL_154008 ·

    研究表明:噪声数据对LLM的RLVR具有破坏性 · 追踪9个来源

    新研究表明,训练数据中的噪声对大型语言模型的强化学习可验证奖励(RLVR)有害,这与之前认为模型可以从不正确的标注中有效学习的发现相反。研究表明,现有的RLVR算法难以减轻噪声的影响,其表现与基本的GRPO相似。此外,与使用干净数据相比,在真正有噪声的数据上训练会导致数学推理和Text2SQL任务的性能显著下降,这凸显了高质量数据集的持续重要性。