一篇新研究论文提出了一个三阶段框架,用于分析监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)如何影响大型语言模型在推理过程中的置信度校准。该研究在数学推理基准上进行,发现OPD对于预推理置信度最有效,SFT在提前停止方面表现最佳,而RL为答案聚合提供了最可靠的信号。研究人员还开发了PosConf,一种位置感知置信度策略,通过利用来自可靠相对位置区间的置信度信号,改进了RL答案聚合和OPD提前停止。 AI
影响 这项研究通过改进生成过程中置信度的测量和利用方式,有望提高LLM推理的可靠性和效率。
排序理由 该集群包含一篇学术论文,详细介绍了大型语言模型的新分析框架和方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →