研究人员开发了一种奖励信息稀疏自编码器(RI-SAE)来解释语言模型激活,特别是关注推理能力。虽然 RI-SAE 成功地将 Llama-3.1-8b 中的高奖励和低奖励推理轨迹分开,但进一步的分析表明,这种分离主要是由于解的完整性,而不是真正的推理质量。对照实验表明,即使是简单的 TF-IDF 分类器和诸如答案框之类的结构线索也能达到相似的区分能力,这表明奖励过滤是一种有效的但肤浅的解释方法。 AI
影响 这项研究表明,当前使用奖励信号的解释方法可能无法完全捕捉推理质量,这可能会影响我们如何评估和理解 AI 的行为。
排序理由 这是一篇详细介绍语言模型新解释方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →