PulseAugur
实时 13:52:05
实体 Latent Reward Registers

Latent Reward Registers

PulseAugur coverage of Latent Reward Registers — every cluster mentioning Latent Reward Registers across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_183348 ·

    新方法增强扩散模型与人类偏好的对齐

    研究人员引入了潜在奖励寄存器(LRRs)来改进扩散模型与人类偏好的对齐。该机制直接从扩散过程中的中间噪声潜在变量估计最终偏好,解决了时间信用分配的挑战。LRRs 可通过奖励梯度 On-Policy 蒸馏(RG-OPD)进行训练,显著降低计算成本;也可通过奖励引导采样(RGS)进行推理,在不更新参数的情况下增强对齐和感知指标。经验上,LRRs 在评估的潜在奖励模型中表现出高准确性,并在无需训练的方法中取得了最先进的成果。