一篇新发布的 arXiv 研究论文对大型语言模型中复杂的自我反思和精炼方法的有效性提出了质疑。研究人员发现,在 token 成本相同的情况下,诸如重复采样答案并选择最常见答案等更简单的技术,其表现与更复杂的精炼方法相当甚至更好。这一发现适用于从 1.5B 到 7B 参数的模型,并在数学基准测试中得到验证,表明自我检查的额外复杂性并不能可靠地提高准确性。 AI
影响 表明更简单、更有效的方法可能更适合提高大语言模型的性能,从而可能降低计算成本。
排序理由 学术论文,展示大语言模型方法的创新研究成果。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →