研究人员开发了一种名为 maximin PRM 引导搜索的新方法,以解决数学推理中的过度优化问题。该方法解决了过程奖励模型 (PRM) 可能为不正确的局部解分配过高分数的问题,导致搜索算法放弃有效的推理路径。通过将搜索构建为一个考虑了合理奖励扰动的鲁棒优化问题,maximin PRM 引导搜索降低了对这些嘈杂的 PRM 异常值的敏感性。这种无需训练的方法在各种设置下持续将 PRM 引导搜索的性能提高 17-35%,而无需进行微调或在线适应。 AI
影响 引入了一种新技术,以提高 AI 系统在复杂数学推理任务中的可靠性和性能。
排序理由 该集群包含一篇详细介绍 AI 数学推理新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →