一项新的研究论文探讨了AI模型如何处理有害请求,发现预训练后应用的对齐技术会产生浅层拒绝。研究表明,模型理解道德的能力源于其预训练阶段,形成一个独立的子空间。对齐方法随后旋转这个子空间而不是重建它,从而创建一个独立于模型更广泛道德判断的“拒绝门”。这表明当前的拒绝机制仅处理模型知识的一小部分,而其大部分理解则保持不变,易于编辑。 AI
影响 表明当前的AI安全措施可能很肤浅,可能导致更容易的越狱,并需要新的对齐策略。
排序理由 学术论文,详细介绍了AI模型行为的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →