PulseAugur
实时 12:38:22
实体 Adaptive Correct-Only Efficiency Reward

Adaptive Correct-Only Efficiency Reward

PulseAugur coverage of Adaptive Correct-Only Efficiency Reward — every cluster mentioning Adaptive Correct-Only Efficiency Reward across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_106828 ·

    新的ACOER方法稳定LLM的推理效率训练

    研究人员开发了一种名为ACOER(自适应仅正确效率奖励)的新方法,以稳定大型语言模型用于高效推理的训练。现有的GRPO(组相对策略优化)等方法经常导致奖励崩溃,降低模型性能。ACOER通过将简洁奖励隔离到正确答案,并防止通过动态归一化和惩罚调整进行过度压缩来解决此问题。实验表明,ACOER在提高准确性的同时显著减少了令牌生成。

  2. RESEARCH · CL_99607 ·

    新研究探索用于智能体生存、导航和可解释性的高级强化学习 · 跟踪 7 个来源

    研究人员正在探索强化学习(RL)的高级技术,以增强智能体的性能和可解释性。一项研究提出了程序化策略(PERL)作为进化 RL 中神经策略(NERL)的替代方案,证明了 PERL 更高的生存率。另一篇论文侧重于使用 RL 进行自主机器人的流感知导航,发现使用速度和记忆传感器训练的智能体优于那些具有显式全局流参数的智能体。此外,正在开发新的方法来解释 RL 智能体,例如使用归纳逻辑编程(ILP)为策略可解释性创建客观指标,以及一种称为 S…