研究人员发现,语言模型中的“拒绝”能力(AI安全的关键方面)是由模型内部运作中的一个单一方向控制的。这一最初在Transformer架构中观察到的发现,即使在信息处理机制不同的状态空间模型(SSMs)中也得以保留。研究表明,这种“拒绝方向”可以在不同架构之间对齐,从而使在一种模型类型上训练的安全工具能够有效地标记另一种模型中的有害输入。此外,研究表明,“写入点”(一个层在计算其输出后将其添加到主数据流之前的位置)对于读取这种安全表示至关重要,而不是“读取点”(应用该表示的位置)。 AI
影响 识别出跨AI架构的可转移安全机制,可能简化鲁棒AI安全工具的开发。
排序理由 详细介绍AI安全机制新研究发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →