实体 Adaptive Group Policy Optimization

Adaptive Group Policy Optimization

PulseAugur coverage of Adaptive Group Policy Optimization — every cluster mentioning Adaptive Group Policy Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief

总计 · 30天

90 天内 1

发布 · 30天

90 天内 0

论文 · 30天

90 天内 1

层级分布 · 90 天

主题

论文 1
模型发布 1

最近 · 第 1/1 页 · 共 1 条

RESEARCH · CL_41786 · May 20 · 05:20

新的强化学习方法解决大语言模型训练问题

两篇新研究论文介绍了使用强化学习改进大语言模型训练的方法。其中一篇论文通过引入诊断指标和称为AVSPO的自适应扩展，解决了组相对策略优化（GRPO）中的“优势崩溃”问题。另一篇论文提出了自适应组策略优化（AGPO），该方法使用组级统计数据动态调整剪辑和解码温度等训练参数，在多个基准测试中表现优于现有方法。

新的强化学习方法解决大语言模型训练问题