PulseAugur
实时 20:38:48
English(EN) Can Interpretation Predict Behavior on Unseen Data?

新的AI可解释性方法可预测模型在未见数据上的行为

研究人员提出了一个针对可解释性研究的新目标,该目标侧重于预测模型在未见数据上的行为,而不仅仅是对目标干预的响应。通过分析注意力等内部模式,即使这些模式不能因果性地解释行为,研究人员也可以预测模型在分布变化下的表现。这种方法通过在合成任务上训练的数百个Transformer模型进行了演示,成功预测了它们的分布外泛化规则。 AI

影响 这项研究可能通过提高我们预测AI在新型条件下的行为的能力,从而带来更可靠的AI系统。

排序理由 该集群包含一篇详细介绍AI可解释性新研究方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AI可解释性方法可预测模型在未见数据上的行为

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Victoria R. Li, Jenny Kaufmann, Tian Qin, Martin Wattenberg, David Alvarez-Melis, Naomi Saphra ·

    解释能否预测在未见过数据上的行为?

    arXiv:2507.06445v2 Announce Type: replace-cross Abstract: Interpretability research often predicts model responses to targeted mechanistic interventions. But can we predict responses to unseen input data? We propose and demonstrate this alternate objective by using model internal…