一篇新研究论文探讨了大型语言模型不同聚合策略的有效性,特别是在初始候选答案不正确的情况下。该研究使用 Qwen3-4B 模型在 AIME-2025 和 HMMT-2025 数学基准测试上进行,发现虽然以多个正确候选答案为条件可以提高准确性,但依赖不正确的候选答案实际上会降低性能,与生成全新解决方案相比。研究还指出,显式答案字段可以引导模型输出,但掩盖它们并未带来可衡量的准确性改进。 AI
影响 探讨了当初始候选解决方案存在缺陷时,大型语言模型的聚合方法表现如何,为更鲁棒的推理能力提供了见解。
排序理由 在 arXiv 上发表的研究论文,详细介绍了大型语言模型的聚合策略。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →