实体
CoBench v2
CoBench v2
PulseAugur coverage of CoBench v2 — every cluster mentioning CoBench v2 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
Anthropic 披露内部 "Model 2" 并提高 AI 错位风险级别
Anthropic 于 2026 年 8 月 14 日发布的第二份风险报告披露了一个内部未发布的模型,代号为 "Model 2"。据报道,该模型在内部基准测试中优于其最新的旗舰模型 Mythos 5,尽管 Anthropic 指出其能力并未实现显著飞跃。该报告还标志着 Anthropic 首次调整其 "因错位造成的灾难性危害" 风险级别,将其从 "非常低" 调整为 "低",表明对 AI 可能违背人类意图的担忧加剧。
-
Anthropic 开发先进的“Model 2”但计划不公开发布
Anthropic 开发了一款名为“Model 2”或“Mythos 2”的新人工智能模型,据报道,该模型在基准测试和编码能力方面均超越了其公开的 Claude Mythos 5。尽管性能先进,Anthropic 目前没有立即向公众发布该模型的计划,而是专注于内部改进及其后继模型“Mythos 3”的开发。该内部模型目前供 Anthropic 员工使用,并且是更广泛的风险评估报告的一部分,该报告详细介绍了其能力和安全评估。