一篇新论文介绍了“安全最低标准”1.0 版,这是一个用于评估前沿 AI 模型在 67 种静态越狱技术面前安全性的基准。该研究测试了 Claude Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro 和 Grok 4.5,发现其鲁棒性存在显著差异。研究发现 Grok 4.5 和 Gemini 3.1 Pro 容易受到多种越狱攻击,而 Claude Fable 5 和 GPT-5.6 Sol 在所测试的策略下未表现出普遍的越狱漏洞。研究人员认为,利用现有技术弥合这些安全差距是可行的,并建议采取纵深防御的方法。 AI
影响 突出了领先 AI 模型中的关键漏洞,可能加速更强大的安全措施的开发。
排序理由 该集群包含一篇介绍 AI 安全新方法论和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →