一篇题为《系统提示的幻觉》的新研究论文,探讨了系统提示如何影响语言模型的内部计算。该研究使用中心核对齐(CKA)方法对17种不同模型进行了分析,发现虽然定义角色或格式的提示会显著改变模型表征,但安全指令的影响却微乎其微。这表明当前的安全机制,即使在大规模模型中,可能也没有深入整合到模型的计算路径中,这或许可以解释持续存在的越狱漏洞。 AI
影响 表明当前大语言模型的安全机制可能比较表面化,可能影响更鲁棒的AI安全协议的开发。
排序理由 学术论文,详细介绍了关于大语言模型行为的新研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →