PulseAugur
实时 10:34:09
实体 PosConf

PosConf

PulseAugur coverage of PosConf — every cluster mentioning PosConf across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_154407 ·

    新研究分析SFT、RL和OPD如何塑造LLM推理置信度

    一篇新研究论文提出了一个三阶段框架,用于分析监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)如何影响大型语言模型在推理过程中的置信度校准。该研究在数学推理基准上进行,发现OPD对于预推理置信度最有效,SFT在提前停止方面表现最佳,而RL为答案聚合提供了最可靠的信号。研究人员还开发了PosConf,一种位置感知置信度策略,通过利用来自可靠相对位置区间的置信度信号,改进了RL答案聚合和OPD提前停止。

  2. TOOL · CL_145670 ·

    新框架分析大型语言模型训练方法如何影响推理置信度

    研究人员开发了一个新的三阶段框架,用于分析监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)如何影响大型语言模型在推理过程中的置信度。研究发现,OPD对预推理置信度最有效,SFT在早期终止信号方面表现出色,而RL为答案聚合提供了可靠的追踪级别置信度。引入了一种新颖的位置感知置信策略PosConf,该策略仅利用来自可靠相对位置区间的置信信号,从而提高了答案聚合和早期停止的性能。