研究人员开发了一种新方法,通过结合基于执行的验证和依赖感知过滤来提高大语言模型的数学推理能力。该方法生成具有依赖图的计算上可靠的解决方案,增强了科学任务的偏好优化。当应用于 Llama-3-8B 和 DeepSeekMath-7B 时,该方法在 MATH 和 GSM8K 基准测试上取得了显著的改进。此外,扩展此框架在 PhyX 多模态物理推理任务上取得了最先进的成果,展示了高度的科学有效性并减少了科学定律的违规行为。 AI
影响 这项研究可能带来更可靠、更准确的大语言模型,用于科学和数学推理任务。
排序理由 该集群描述了一篇关于改进大语言模型在特定基准测试上性能的新研究论文。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →