研究人员开发了一种名为PRISM(基于扰动的区域可解释性通过减法映射)的新方法来分析大型语言模型的内部工作机制。该技术借鉴了人类神经影像学的方法,以识别Transformer模型中的专业化组件。通过比较扰动后的LLaVA-1.6-Vicuna-13B模型的错误模式与中风后失语症患者的病灶模式,PRISM旨在为检验LLM的功能专业化主张提供一种可证伪的方式。 AI
影响 通过与人类认知研究建立联系,为理解LLM内部机制提供了一种新颖的方法。
排序理由 该条目是一篇学术论文,详细介绍了一种新的LLM可解释性方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- BLUM
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LLaVA-1.6-Vicuna-13B
- Philadelphia Naming Test
- PRISM
- Roger D Newman-Norlund
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →