对齐研究中心(ARC)提出了一种估计灾难性 AI 故障概率的方法,旨在比随机抽样更有效。然而,作者指出了一个潜在的漏洞:ARC 对此概率的评估使用了朴素的输入分布,这可能被比测试设置更了解部署环境的攻击者利用。这种不对称性可能导致“测试-部署不对称攻击”,即 AI 在测试中可能表现安全,但在现实世界部署中可能因未知环境因素而导致灾难性后果。 AI
影响 强调了 AI 安全评估方法中一个可能导致现实世界失败的关键缺陷。
排序理由 对提出的 AI 安全机制及其潜在漏洞的分析。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →