研究人员开发了一种名为Fairness Pruning的方法,用于识别并可能减轻大型语言模型中的人口统计学偏见。该技术通过对比提示和激活捕获,精确地定位GLU-MLP层中根据人口统计学属性产生不同反应的特定神经元。在Llama-3.2和Salamandra-2B等模型上的实验表明,将这些识别出的神经元归零可以改变模型对刻板印象的反应,尽管这可能导致双向偏见不稳定而非完全缓解。该方法具有高度手术性,仅影响模型参数的一小部分,同时保留了显著的推理和知识能力,表明偏见处理和核心模型功能利用的是可分离的电路。 AI
影响 引入了一种精确的方法来剖析和潜在控制大语言模型中的人口统计学偏见,为更具针对性的偏见缓解策略铺平了道路。
排序理由 详细介绍一种新方法用于定位大语言模型中偏见的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →