PulseAugur
中
实时 19:49:22
实体 Latent reward models

Latent reward models

PulseAugur coverage of Latent reward models — every cluster mentioning Latent reward models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_270706 ·

    新研究解决AI中奖励模型的不稳定性和效率问题

    研究人员正在开发新方法来改进用于大型语言模型和扩散模型中的奖励模型的训练和鲁棒性。一种名为“密度感知奖励聚合”(DARA)的方法,通过根据奖励的活动密度对其进行加权来解决多奖励强化学习中不均衡的学习进展问题,从而在工具调用和数学推理等任务上实现更快的收敛。另一个研究重点是缓解奖励模型中的偏好不稳定性,例如使用稀疏自编码器(SAEs)识别和抑制导致矛盾判断的脆弱特征。针对视频理解,已创建了一个新的基准(VURB)和数据集(VUP-35K…