研究人员开发了一种新颖的言语冲突任务,用于研究大型语言模型中的一致性效应,并与心理学和神经科学研究进行类比。该任务涉及引发默认完成的提示,其中明确的规则要么同意,要么与此默认规则相冲突。对 Gemma-2-2B 和各种 Pythia 版本的模型分析显示出强烈的默认倾向和显著的一致性效应,这归因于权重内默认映射与上下文内基于规则的映射之间的竞争。该研究利用了因果归因、注意力分析和消融来识别由表面线索或明确规则激活的不同处理路径。 AI
影响 为分析内部模型机制和学习映射之间的竞争提供了一个新框架。
排序理由 学术论文,详细介绍了大型语言模型行为的新颖方法和发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →