一篇新的研究论文探讨了语言模型内部所知与其通过输出来表达的内容之间的差异。研究发现,虽然对模型内部状态进行线性探测可以准确预测模型的知识,但由于决策阈值校准失误,模型的实际行为往往无法反映这些知识。这个问题,特别是单一标量偏移,即使在模型的内部表示准确的情况下,也可能抹去正确的答案。研究表明,通过调整决策阈值或使用校准边际解码等简单修正,可以在不重新训练的情况下显著提高模型的行为准确性。 AI
影响 强调了大型语言模型可解释性中的一个关键差距,并提出了提高模型可靠性以及使内部知识与外部行为保持一致的方法。
排序理由 研究论文,详细介绍了关于语言模型行为和内部知识的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →