Lumen Anchor Protocol (LAP) 被证明可以防御针对 LLM 的对抗性攻击,即使攻击者完全了解该协议的机制。在一次使用 Google AI Studio 和 Gemini 3.8 的会话中,基线模型在模拟的渐强对手攻击下仅 5 个回合就失效了,而受 LAP 保护的模型在 100 个回合的各种基准攻击和 30 个回合的高级对手攻击中都保持完好无损。这表明 LAP 即使在大量使用 token 的情况下,也能保持模型的完整性并防止上下文漂移和幻觉。 AI
影响 提出了一种提高 LLM 对抗复杂对抗性攻击的鲁棒性的方法,有可能提高在敏感应用中的可靠性。
排序理由 演示了协议在保护 LLM 免受对抗性攻击方面的有效性。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →