PulseAugur
实时 15:34:58
实体 Group Entropy-Controlled Policy Optimization

Group Entropy-Controlled Policy Optimization

PulseAugur coverage of Group Entropy-Controlled Policy Optimization — every cluster mentioning Group Entropy-Controlled Policy Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_152745 ·

    新的GEPO方法通过群体熵控制增强LLM强化学习 · 跟踪2个来源

    一篇新论文介绍了一种名为群体熵控制策略优化(GEPO)的方法,它是GRPO的扩展,旨在改进大型语言模型的强化学习。GEPO通过考虑特定群体的熵水平来解决现有方法的局限性,从而更好地平衡各种任务中的探索与利用。实验表明,GEPO的性能优于GRPO和其他熵控制技术,能够带来更均衡的改进和持续的探索。