一篇新发表在arXiv上的研究论文探讨了自我共识作为一种降低推理模型推理成本的方法的有效性。研究发现,虽然自我共识可以节省token,但它并不是一个安全可靠的提前退出信号。研究人员发现了一个“共识-终止差距”,即对答案的同意并不能保证推理过程已经结束,导致非终止答案被接受。即使进行了调整,这个问题仍然存在,有相当比例的提前停止切断了潜在的修正或接受了占位符答案。 AI
影响 这项研究突显了优化LLM推理中的一个潜在陷阱,表明当前的自我共识方法可能不适用于安全的提前退出。
排序理由 学术论文,详细介绍了关于AI模型行为的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →