研究人员提出了一个针对可解释性研究的新目标,该目标侧重于预测模型在未见数据上的行为,而不仅仅是对目标干预的响应。通过分析注意力等内部模式,即使这些模式不能因果性地解释行为,研究人员也可以预测模型在分布变化下的表现。这种方法通过在合成任务上训练的数百个Transformer模型进行了演示,成功预测了它们的分布外泛化规则。 AI
影响 这项研究可能通过提高我们预测AI在新型条件下的行为的能力,从而带来更可靠的AI系统。
排序理由 该集群包含一篇详细介绍AI可解释性新研究方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- ScienceCast
- transformers
- Victoria R Li
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →