PulseAugur
实时 18:20:24
实体 Shuhao Li

Shuhao Li

PulseAugur coverage of Shuhao Li — every cluster mentioning Shuhao Li across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_154407 ·

    新研究分析SFT、RL和OPD如何塑造LLM推理置信度

    一篇新研究论文提出了一个三阶段框架,用于分析监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)如何影响大型语言模型在推理过程中的置信度校准。该研究在数学推理基准上进行,发现OPD对于预推理置信度最有效,SFT在提前停止方面表现最佳,而RL为答案聚合提供了最可靠的信号。研究人员还开发了PosConf,一种位置感知置信度策略,通过利用来自可靠相对位置区间的置信度信号,改进了RL答案聚合和OPD提前停止。