实体
Dharshan Kumaran
Dharshan Kumaran
PulseAugur coverage of Dharshan Kumaran — every cluster mentioning Dharshan Kumaran across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
研究发现:LLM置信度报告表明承诺而非正确性
一项新的研究论文表明,大型语言模型(LLMs)报告的置信水平与其承诺给出答案的意愿相比,更能反映其真实正确性。该研究采用了一个两阶段的弃权范式,发现LLMs的口头置信度报告比它们预测答案是否正确,更能准确地预测它们是会给出答案还是弃权。这种分离现象在各种模型、提示框架和基准测试中都有观察到,表明口头置信度可能代表一种‘承诺就绪’状态,而不是可靠性的直接代理。
-
大型语言模型利用内部置信信号检测和纠正错误
研究人员调查了大型语言模型如何在没有外部输入的情况下识别和纠正自身错误,并将其与决策神经科学中的二阶置信模型进行了类比。他们的发现表明,一个在回答后缓存的特定内部信号在错误检测和自我纠正中起着至关重要的作用,其作用超越了简单的 token 对数概率。该信号不仅表明可能存在错误,还表明模型是否拥有修复该错误所需的知识,Gemma 3 27B 和 Qwen 2.5 7B 模型通过实验证明了这一点。