研究人员发现功率采样(一种用于改进语言模型推理的技术)存在悖论。虽然它可以将概率质量集中到正确答案上,但它却会适得其反地导致整体推理性能下降,在推理基准测试中观察到的准确率下降高达 18.5 个百分点。该问题源于“剂量不匹配”,即固定的指数导致不同问题出现不同的分布变化;以及“覆盖不匹配”,即全局锐化将焦点集中在主导路径上,可能丢失广泛的推理支持。提出的解决方案是采用一种变形可控、保留支持的功率目标,该目标可以校准锐化并限制对中等概率路径的抑制,从而优于标准的得多重采样推理。 AI
影响 这项研究通过解决当前采样方法中一个违反直觉的缺陷,有望提高大型语言模型中推理的可靠性和准确性。
排序理由 研究论文,详细介绍了语言模型推理技术的新发现和拟议解决方案。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- Influence Flower
- Power Sampling
- ScienceCast
- Self Consistency In Llms
- weighted self-consistency
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →