PulseAugur
实时 11:24:00
实体 Policy Gradient Steering

Policy Gradient Steering

PulseAugur coverage of Policy Gradient Steering — every cluster mentioning Policy Gradient Steering across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_167450 ·

    新的大语言模型训练方法利用强化学习和蒸馏技术

    研究人员开发了几种新方法,利用强化学习和蒸馏技术来改进大语言模型(LLM)的训练和行为。策略梯度引导(PGS)通过将引导构建为强化学习问题,提供了一种在推理时动态改变LLM行为的方法,并在国际象棋和足球等不同领域取得了成功。Beta-OPSD($eta$-OPD)通过引入一个可控参数来概括同策略自蒸馏(OPSD),该参数平衡了与参考策略的接近程度和教师引导,从而提高了推理性能和稳定性。对比强化策略优化(CRPO)通过使用对比学习来保…