Anthropic 最新发布的风险报告显示,其对齐不当和生物武器风险的评估显著增加,均从“非常低”升至“低”。该报告还披露了一个内部模型“Model 2”,该模型在多项基准测试中表现优于公开的 Claude Mythos 5,但由于部署前评估不完整而未发布。一项关键发现是,一项针对生物武器滥用的安全措施在约 11 个月内被意外禁用,影响了约 1.33 亿次对话,且未被记录。 AI
影响 凸显了评估前沿 AI 安全性日益增长的难度,以及内部模型超越公开模型的潜力。
排序理由 公司自行发布的风险报告,详细说明了内部模型性能和安全故障。
- AI Security Institute (AISI)
- Anthropic
- Astra
- Claude Mythos 5
- CoBench
- Epoch Capability Index
- GitHub
- Model 2
- OpenAI
- Responsible Scaling Policy (RSP)
- SHADE-Arena
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →