研究人员调查了大规模AI模型(特别是名为GLM-5.3-Flash的320B参数混合专家(MoE)模型)的安全对齐脆弱性。他们发现,先前在小型密集模型上有效的单向消融攻击仍然适用于MoE架构,但其影响分布在不同的组件上。单独编辑注意力、密集和路由专家写入器效果有限,但组合干预消除了模型很大一部分的拒绝能力。该研究还发现了一个在各种编辑中持续存在的类别集中残差,表明模型安全对齐存在潜在漏洞。 AI
影响 突显了大规模MoE模型安全对齐的潜在漏洞,需要对鲁棒的对齐技术进行进一步研究。
排序理由 学术论文,详细介绍了针对AI模型安全对齐的新攻击方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →