PulseAugur
实时 07:48:22
English(EN) More Correct Mass, Worse Answers: Why Power Sampling Can Fail and How to Fix It

功率采样悖论:推理技术降低大型语言模型答案质量

研究人员发现功率采样(一种用于改进语言模型推理的技术)存在悖论。虽然它可以将概率质量集中到正确答案上,但它却会适得其反地导致整体推理性能下降,在推理基准测试中观察到的准确率下降高达 18.5 个百分点。该问题源于“剂量不匹配”,即固定的指数导致不同问题出现不同的分布变化;以及“覆盖不匹配”,即全局锐化将焦点集中在主导路径上,可能丢失广泛的推理支持。提出的解决方案是采用一种变形可控、保留支持的功率目标,该目标可以校准锐化并限制对中等概率路径的抑制,从而优于标准的得多重采样推理。 AI

影响 这项研究通过解决当前采样方法中一个违反直觉的缺陷,有望提高大型语言模型中推理的可靠性和准确性。

排序理由 研究论文,详细介绍了语言模型推理技术的新发现和拟议解决方案。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

功率采样悖论:推理技术降低大型语言模型答案质量

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Haohui Yang, Jiaxing Sun, Xiujun Ma ·

    更准确的质量,更差的答案:为什么功率采样会失败以及如何修复它

    arXiv:2608.14420v1 Announce Type: new Abstract: Power Sampling sharpens a language model's distribution over complete generation trajectories, offering a verifier-free way to improve reasoning at inference time. It also has the potential to serve as a general-purpose front end fo…