研究人员推出了一种新颖的在线对偶规划调度器CERO,旨在优化强化学习(RL)后训练的推出预算分配。与固定每次更新预算的传统方法不同,CERO通过调整提示选择、重访频率和组生成,在整个训练过程中协调有限的预算。该方法利用紧凑的Fenchel表示和投影在线梯度下降,在数学推理基准上的表现优于固定速率和时变基准。 AI
影响 优化强化学习的资源分配,可能提高复杂推理任务的训练效率和性能。
排序理由 这是一篇详细介绍强化学习新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- CERO
- Fenchel representation
- Hugging Face
- primal dual scheduler
- projected online gradient descent
- prompt exposure
- reinforcement learning
- reward-variation feedback
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →