PulseAugur
实时 07:06:21
实体 Frontier-Bench

Frontier-Bench

PulseAugur coverage of Frontier-Bench — every cluster mentioning Frontier-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. FRONTIER RELEASE · CL_162005 ·

    Anthropic 发布 Opus 5,以一半价格匹配 Fable 5 性能 · 跟踪 10 个来源

    Anthropic 发布了其新 AI 模型 Claude Opus 5,其性能可与更高级的 Fable 5 模型相媲美,但成本减半。该新模型专为日常业务需求而设计,包括编码和知识工作,并具有用户可选择的成本与能力切换器。虽然 Opus 5 在性能上比其前身 Opus 4.8 以及 OpenAI 的 GPT-5.6 "Sol" 等竞争对手有所迭代改进,但它并未带来能力的根本性飞跃,尤其是在网络安全等专业领域,其安全防护比 Opus 4.…

  2. FRONTIER RELEASE · CL_160596 ·

    Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源

    Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。

  3. FRONTIER RELEASE · CL_162004 ·

    Anthropic 发布 Claude Opus 5,在基准测试中挑战 Fable 5

    Anthropic 推出了 Claude Opus 5,这是一款新的前沿模型,以更低的成本提供了接近 Claude Fable 5 的性能。早期评估显示,Opus 5 在编码和知识工作中表现出色,在 Frontier-Bench 和 ARC-AGI 等任务上设定了新的最先进基准。虽然它在 3D 模型重建和复杂编码任务等领域展现了强大的能力,但其在网络安全利用方面的表现仍落后于 Mythos 5 等模型。用户报告的体验褒贬不一,一些人称…