实体
VUP-35K
VUP-35K
PulseAugur coverage of VUP-35K — every cluster mentioning VUP-35K across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新研究解决AI中奖励模型的不稳定性和效率问题
研究人员正在开发新方法来改进用于大型语言模型和扩散模型中的奖励模型的训练和鲁棒性。一种名为“密度感知奖励聚合”(DARA)的方法,通过根据奖励的活动密度对其进行加权来解决多奖励强化学习中不均衡的学习进展问题,从而在工具调用和数学推理等任务上实现更快的收敛。另一个研究重点是缓解奖励模型中的偏好不稳定性,例如使用稀疏自编码器(SAEs)识别和抑制导致矛盾判断的脆弱特征。针对视频理解,已创建了一个新的基准(VURB)和数据集(VUP-35K…
-
新的基准和模型推动视频理解奖励建模的进步
研究人员开发了用于视频理解任务的奖励模型训练新方法,填补了当前AI能力的空白。一种方法引入了一个名为VURB的基准和VUP-35K数据集,催生了VideoDRM和VideoGRM等模型,取得了最先进的性能。另一种方法DeScore采用“先思考后评分”的范式,将推理与评分解耦,提高了视频奖励模型的训练效率和泛化能力。