研究人员在大型语言模型(LLM)中发现了一种几何特性,该特性量化了模型在面对有限上下文时对先验知识的依赖程度。这种“无知方向”被编码在反嵌入矩阵中,并充当贝叶斯先验,模型在不确定时会默认使用它。在Llama、Qwen、Gemma和Pythia等各种模型系列中都观察到了这种现象,与其参数大小无关。 AI
影响 这项研究为理解和潜在控制LLM的不确定性和校准提供了一个新的视角。
排序理由 该集群包含一篇详细介绍LLM行为新发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →