一个新的AI安全排行榜已被开发出来,用于基准测试前沿AI模型的鲁棒性。该排行榜弥补了现有排名主要关注模型能力而非安全性的空白。初始版本使用了一个包含1500次越狱尝试的自动化测试套件,以衡量模型响应有害查询的频率,揭示了模型之间在鲁棒性方面的显著差异。 AI
影响 为评估AI模型安全性提供了一个新指标,可能影响部署决策并指导未来在对抗性鲁棒性方面的研究。
排序理由 该集群描述了一个新的AI模型安全基准的开发和发布,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →