Anthropic 开发了一个名为 "AAR" 的 AI 安全研究自动化系统,该系统比人类更能有效地识别和修复 AI 模型中的漏洞。在测试中,AAR 仅用六小时就发现了并解决了安全问题,而这项任务通常需要人类研究人员花费更长的时间。这项进展旨在加速 AI 系统更安全、更强大的开发进程。 AI
影响 自动化 AI 安全研究,可能加速更安全 AI 系统的开发。
排序理由 AI 安全自动化研究里程碑。 [lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →