研究人员发现了一种针对融合AI模型的新型越狱漏洞,该漏洞源于底层的基础模型,而非单独的微调组件。这种“盆地感知越狱”(BAJ)方法生成的对抗性后缀能够绕过共享相同骨干模型的各种融合模型的安全对齐,即使不知道具体的融合系数。实验证明了BAJ在不同模型家族中的有效性及其对现有防御措施的抵抗力。 AI
影响 这项研究揭示了一种针对融合AI模型的新型攻击向量,可能影响通过组合多个微调模型而构建的系统的安全性和可靠性。
排序理由 研究论文,详细介绍了一种新的AI安全漏洞。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →