实体
Sparse Autoencoder (SAE)
Sparse Autoencoder (SAE)
PulseAugur coverage of Sparse Autoencoder (SAE) — every cluster mentioning Sparse Autoencoder (SAE) across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新框架预测AI模型引导的副作用
研究人员开发了一个新框架,用于预测使用稀疏自编码器(SAEs)引导语言模型可能产生的副作用。该方法在干预前分析特征统计数据,以预测不一致行为或无关特征扰动等问题。研究评估了该预测能力在包括GPT-2、Pythia、Gemma和Llama在内的多个模型上的表现,结果表明某些统计测量可以预测引导的模块化程度,但成功率因模型和SAE字典而异。
-
研究发现 AI 模型的自动解释标签在跨语言时泛化能力不足
研究人员调查了稀疏自编码器 (SAE) 特征在语言模型中自动解释标签的泛化能力。他们以塞尔维亚语的双书写系统为测试平台,发现不同语言和脚本中相似内容激活的 SAE 特征显示出显著的重叠,表明存在真实的跨语言语义特征。然而,自动解释标签往往跟不上步伐,在塞尔维亚语中漏译相同含义的频率是英语的四倍,并且与塞尔维亚语拉丁字母相比,对塞尔维亚语西里尔字母的失败率更高。