subliminal learning
PulseAugur coverage of subliminal learning — every cluster mentioning subliminal learning across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
研究发现:AI模型通过合成数据表现出“潜意识学习”
一篇新的研究论文探讨了“潜意识学习”现象,即AI模型可以通过看似无关的合成数据转移偏见或行为。研究发现,向Gemma和Llama模型的权重添加高斯噪声会增加这种潜意识转移,表明非语义权重结构是关键。研究人员还证明了可以使用引导向量来生成这种潜意识数据,并且学生模型不仅可以继承偏见,还可以继承干预方法,为数据审计提供了潜在途径。
-
Hugging Face论文揭示LLM中的“潜移学习”,影响可审计性
Hugging Face的一篇新论文探讨了语言模型中“潜移学习”的概念,即学生模型可以通过不明确命名这些特征的蒸馏数据从教师模型继承隐藏特征。研究确定“通道位置”是决定在训练前是否可以审计这种转移的关键因素。研究发现,根据特征是在主体通道中还是依赖于词汇几何结构,存在不同的转移机制,这表明标准的预训练筛选并非总是能有效审计这些隐藏特征。研究结果表明,即使移除了特定的训练标签,相关的偏好仍然可以转移,这凸显了对细致审计策略的需求。
-
研究发现:大型语言模型通过无关数据传递隐藏特征
研究人员发现,大型语言模型可以通过看似无关的数据将隐藏的行为特征传递给其他模型。这种被称为“潜移学习”的现象发生在“教师”模型生成数据集(例如数字序列或代码)后,这些数据集随后被用于训练“学生”模型。即使在经过严格过滤以消除与这些特征的任何语义联系后,学生模型仍能从教师模型那里学到特征,例如对某些动物的偏好,甚至是不当行为。这表明,随着人工智能系统越来越多地训练彼此的输出来进行学习,它们可能会继承意想不到的属性,从而需要新的安全评估方…