Anthropic 于 2026 年 8 月 14 日发布的第二份风险报告披露了一个内部未发布的模型,代号为 "Model 2"。据报道,该模型在内部基准测试中优于其最新的旗舰模型 Mythos 5,尽管 Anthropic 指出其能力并未实现显著飞跃。该报告还标志着 Anthropic 首次调整其 "因错位造成的灾难性危害" 风险级别,将其从 "非常低" 调整为 "低",表明对 AI 可能违背人类意图的担忧加剧。 AI
影响 预示着 AI 能力的不断增强以及对 AI 安全日益增长的担忧,可能影响未来的发展和透明度标准。
排序理由 该集群讨论了一个新的内部模型以及一家主要 AI 实验室风险评估的变化,属于研究和安全报告类别。 [lever_c_demoted from research: ic=1 ai=1.0]
- Anthropic
- CoBench v2
- DeepSeek V4-Pro
- Hermes Agent
- Misalignment risk
- Model 2
- Mythos 5
- Opus-4.6
- Responsible Scaling Policy
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →