PulseAugur
中
实时 23:32:36
实体 Policy-KL

Policy-KL

PulseAugur coverage of Policy-KL — every cluster mentioning Policy-KL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_217764 ·

    新的ERPO方法通过控制查询分布来稳定LLM训练

    研究人员推出了一种名为环境正则化策略优化(ERPO)的新方法,用于优化大型语言模型(LLM),该方法解决了稳定性-探索困境。ERPO通过引入查询KL(QKL)项,将正则化从输出(响应)端转移到输入(查询)端。这种方法在训练过程中限制了查询分布的变化,在保证稳定行为的同时保留了探索能力。与传统方法相比,ERPO在六个数学推理基准测试中表现出更强的准确性和更稳定的性能。