实体
RG-OPD
RG-OPD
PulseAugur coverage of RG-OPD — every cluster mentioning RG-OPD across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新方法增强扩散模型与人类偏好的对齐
研究人员引入了潜在奖励寄存器(LRRs)来改进扩散模型与人类偏好的对齐。该机制直接从扩散过程中的中间噪声潜在变量估计最终偏好,解决了时间信用分配的挑战。LRRs 可通过奖励梯度 On-Policy 蒸馏(RG-OPD)进行训练,显著降低计算成本;也可通过奖励引导采样(RGS)进行推理,在不更新参数的情况下增强对齐和感知指标。经验上,LRRs 在评估的潜在奖励模型中表现出高准确性,并在无需训练的方法中取得了最先进的成果。
-
新方法增强在线策略蒸馏以进行AI模型训练 · 已追踪6个来源
研究人员正在开发新的在线策略蒸馏方法,这是一种通过让较小的AI模型学习较大、能力更强的模型的输出来训练这些较小模型的技术。Apple Machine Learning Research 引入了一个诊断框架,用于分析在线策略蒸馏在何处以及为何有效,发现该信号在学生模型不正确的输出时更有益。同时,Veto 和 RG-OPD 等新方法通过重新构建蒸馏目标或使用验证器反馈来过滤不可靠的教师信号,旨在稳定训练。此外,ReOPD 提供了一种离环境…