研究人员推出了一种名为VERPO(Verified Evidence Regularized Policy Optimization)的新型框架,用于增强语言模型的后训练。该方法使用可验证的结果奖励来指导改进,区分应保留或修改的token级决策。VERPO将无证据的参考恢复与有符号的token级证据修正分开,通过Fisher Evidence Contrast和ZPD控制器根据奖励对齐和成本来缩放接受度。在五个科学推理和工具使用任务中,VERPO在Qwen3-4B、Qwen3-8B和Llama-3.2-1B模型上均取得了改进。 AI
影响 VERPO的方法通过在训练过程中优化token级决策,有望带来更强大、更准确的语言模型。
排序理由 该集群包含一篇详细介绍语言模型优化新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →