研究人员在一个名为sarvam的多语言混合专家(MoE)模型中,识别出了一个负责拒绝有害请求的特定电路。该电路的拒绝能力是语言无关的,这意味着检测有害内容的底层机制在不同语言中是一致的。然而,实际的拒绝响应生成是一个后期过程,它是在文本生成过程中组装起来的,而不是直接从有害内容检测中读取的。 AI
影响 识别出多语言MoE模型中用于安全拒绝的特定、可定位电路,为有针对性的修复和成本效益干预提供了潜在途径。
排序理由 该集群包含一篇详细介绍AI安全对齐研究成果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →