实体
Bianca Raimondi
Bianca Raimondi
PulseAugur coverage of Bianca Raimondi — every cluster mentioning Bianca Raimondi across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
研究人员通过层修复分析,精确定位并缓解LLM中的道德偏见
研究人员调查了微调后大型语言模型(LLM)中道德偏见的表现和定位。通过对三个开源权重LLM进行层修复分析,他们证明了Knobe效应(一种与意图判断相关的特定道德偏见)是在微调过程中学习到的,并且可以精确定位到特定层。研究发现,通过将原始预训练模型中的激活值修复到这些关键层,可以在无需完全重新训练模型的情况下有效消除偏见。
-
布鲁姆分类法揭示了大型语言模型中认知复杂性的线性编码
研究人员开发了一种新方法,通过使用布鲁姆分类法来解释大型语言模型中的认知复杂性。这项研究采用了模型激活的线性探测,发现从基本回忆到复杂创造的不同认知水平被编码在线性可分离的子空间中。这表明大型语言模型在其前向传播的早期处理提示难度,并且表示在不同层之间变得更加清晰。