实体
KL-regularized RL
KL-regularized RL
PulseAugur coverage of KL-regularized RL — every cluster mentioning KL-regularized RL across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的博弈论框架优化语言模型微调
研究人员开发了一种新颖的博弈论框架用于微调语言模型,旨在优化在目标任务上的性能提升与遵守参考策略之间取得平衡。该方法超越了传统的KL正则化强化学习目标,将权衡视为智能体和监控器之间的序贯博弈,从而得到具有最优正则化参数的均衡策略。该方法在Qwen3-8B和Llama 3.2 1B模型上进行了演示,提供了一种学习该参数的原则性方法,可能在持续学习场景中降低训练成本并改善奖励保留权衡。
-
新的自蒸馏方法增强了大型语言模型的推理能力和训练稳定性
两篇新论文探讨了用于大型语言模型的先进自蒸馏技术,旨在提高推理能力和效率。第一篇论文介绍了“Power Distribution Bridges”,它连接了采样、自奖励强化学习和自蒸馏,表明功率分布可以优化 KL 正则化强化学习并实现一种新的离线蒸馏形式。第二篇论文提出了“基于偏好的自蒸馏”(PBSD),超越了简单的 KL 匹配,采用了一种奖励正则化目标来优化偏好差距,从而提高了训练稳定性和在推理及工具使用基准测试上的性能。