PulseAugur
实时 02:17:35
English(EN) Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration

新框架分析大型语言模型训练方法如何影响推理置信度

研究人员开发了一个新的三阶段框架,用于分析监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)如何影响大型语言模型在推理过程中的置信度。研究发现,OPD对预推理置信度最有效,SFT在早期终止信号方面表现出色,而RL为答案聚合提供了可靠的追踪级别置信度。引入了一种新颖的位置感知置信策略PosConf,该策略仅利用来自可靠相对位置区间的置信信号,从而提高了答案聚合和早期停止的性能。 AI

影响 为提高大型语言模型在推理任务中的可靠性和效率提供了见解。

排序理由 学术论文,详细介绍了大型语言模型推理的新分析框架和策略。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架分析大型语言模型训练方法如何影响推理置信度

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Xiaoyu Shen ·

    训练后校准转变:SFT、RL和OPD如何塑造预共情、共情内和共情后校准的三阶段分析

    Large language models have made strong reasoning gains through supervised fine-tuning, reinforcement learning, and on-policy distillation, yet these post-training methods are usually evaluated only by final-answer accuracy. We study how they reshape confidence during reasoning. W…