研究人员开发了一个新的三阶段框架,用于分析监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)如何影响大型语言模型在推理过程中的置信度。研究发现,OPD对预推理置信度最有效,SFT在早期终止信号方面表现出色,而RL为答案聚合提供了可靠的追踪级别置信度。引入了一种新颖的位置感知置信策略PosConf,该策略仅利用来自可靠相对位置区间的置信信号,从而提高了答案聚合和早期停止的性能。 AI
影响 为提高大型语言模型在推理任务中的可靠性和效率提供了见解。
排序理由 学术论文,详细介绍了大型语言模型推理的新分析框架和策略。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →