PulseAugur
中
实时 13:25:51
实体 Bag-of-Tokens Group Relative Policy Optimization

Bag-of-Tokens Group Relative Policy Optimization

PulseAugur coverage of Bag-of-Tokens Group Relative Policy Optimization — every cluster mentioning Bag-of-Tokens Group Relative Policy Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_286973 ·

    新的强化学习算法 BoT-GRPO 增强了大型语言模型的推理能力

    研究人员推出了一种新颖的强化学习算法 BoT-GRPO,旨在增强大型语言模型的推理能力。该方法是 GRPO 的扩展,通过将令牌级奖励聚合到“令牌包”中并相对于组统计数据计算优势,从而有效地利用令牌级奖励。BoT-GRPO 在没有评论员的情况下运行,使其成为令牌级奖励可用时 GRPO 的直接替代品。实验表明,与现有的 GRPO 变体相比,它在代码生成任务上实现了更高的编译率和更快的收敛速度,并且还提高了数学推理性能。