研究人员推出了一种名为分层接种提示(Stratified Inoculation Prompting, SIP)的新技术,旨在在保留语言模型预期功能的同时减轻其非期望行为。与以往的方法不同,SIP通过利用一小部分干净的训练数据,有效地缩小了有害特征的表达范围。这种方法在多样化的上下文中对这些干净的示例进行过采样,与标准的接种提示(Inoculation Prompting, IP)相比,显著减少了涌现式失准,并提高了选择性泛化能力。该方法还包括了后门稀释和密码锁定接种等扩展功能,即使在明确提示的情况下也能进一步控制非期望行为。 AI
影响 这项研究提供了一种新颖的方法来增强AI安全性,通过减少有害输出,同时不牺牲模型所需的性能。
排序理由 该集群包含一篇学术论文,详细介绍了一种改进AI模型安全性方面的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →