Frontier-Bench
PulseAugur coverage of Frontier-Bench — every cluster mentioning Frontier-Bench across labs, papers, and developer communities, ranked by signal.
-
Anthropic 发布 Opus 5,以一半价格匹配 Fable 5 性能 · 跟踪 10 个来源
Anthropic 发布了其新 AI 模型 Claude Opus 5,其性能可与更高级的 Fable 5 模型相媲美,但成本减半。该新模型专为日常业务需求而设计,包括编码和知识工作,并具有用户可选择的成本与能力切换器。虽然 Opus 5 在性能上比其前身 Opus 4.8 以及 OpenAI 的 GPT-5.6 "Sol" 等竞争对手有所迭代改进,但它并未带来能力的根本性飞跃,尤其是在网络安全等专业领域,其安全防护比 Opus 4.…
-
Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源
Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。
-
Anthropic 发布 Claude Opus 5,在基准测试中挑战 Fable 5
Anthropic 推出了 Claude Opus 5,这是一款新的前沿模型,以更低的成本提供了接近 Claude Fable 5 的性能。早期评估显示,Opus 5 在编码和知识工作中表现出色,在 Frontier-Bench 和 ARC-AGI 等任务上设定了新的最先进基准。虽然它在 3D 模型重建和复杂编码任务等领域展现了强大的能力,但其在网络安全利用方面的表现仍落后于 Mythos 5 等模型。用户报告的体验褒贬不一,一些人称…