PulseAugur
实时 07:06:25
实体 CursorBench 3.2

CursorBench 3.2

PulseAugur coverage of CursorBench 3.2 — every cluster mentioning CursorBench 3.2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. FRONTIER RELEASE · CL_230640 ·

    Anthropic 的 Claude Fable 5.1 发布,基准测试有所提升,成本引发争议 · 已追踪 10 个来源

    Anthropic 发布了其新一代 AI 模型 Claude Fable 5.1,现已在 Cursor 和 Perplexity 等平台上可用。此次发布在基准测试方面取得了显著进步,尤其是在智能体任务和减少对良性查询的拒绝方面。然而,定价结构仍然是讨论的焦点,实际成本因缓存命中率和工作负载类型而异,引发了关于其是否物有所值(与 Opus 5 相比价格翻倍)的争论。

  2. FRONTIER RELEASE · CL_175840 ·

    Anthropic 发布 Claude Opus 5,以一半价格匹配 Fable 5 性能 · 已追踪 4 个来源

    Anthropic 发布了 Claude Opus 5,这是一款新的 AI 模型,定位为比其顶级 Fable 5 模型更实惠的替代品。在许多编码基准测试中,Opus 5 的性能与 Fable 5 相当,尤其是在代码库级别任务和通用计算机工作中,但价格却只有一半。该模型还具有 100 万个 token 的上下文窗口,并显著减少了安全分类器的干预,使其更适合自主编码代理。与 Opus 5 一同发布的还有 Claude Code v2.1.…

  3. FRONTIER RELEASE · CL_162242 ·

    Anthropic 的 Claude Opus 5 性能大幅提升且成本降低 · 跟踪 8 个来源

    Anthropic 发布了 Claude Opus 5,这是一款新的前沿模型,与前代 Opus 4.8 相比,在成本降低的同时提供了显著的性能提升。虽然 Anthropic 的官方基准测试突出了大幅提升(通常以比率形式呈现),但详细分析显示,在 SWE-bench Pro 编码基准测试上提高了 10 个点,并在内部生命科学任务上有了显著改进。该模型的定价旨在颠覆市场,以一半的成本提供接近 Fable 5 的能力,引发了关于迁移策略以及…

  4. FRONTIER RELEASE · CL_160596 ·

    Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源

    Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。

  5. FRONTIER RELEASE · CL_162004 ·

    Anthropic 发布 Claude Opus 5,在基准测试中挑战 Fable 5

    Anthropic 推出了 Claude Opus 5,这是一款新的前沿模型,以更低的成本提供了接近 Claude Fable 5 的性能。早期评估显示,Opus 5 在编码和知识工作中表现出色,在 Frontier-Bench 和 ARC-AGI 等任务上设定了新的最先进基准。虽然它在 3D 模型重建和复杂编码任务等领域展现了强大的能力,但其在网络安全利用方面的表现仍落后于 Mythos 5 等模型。用户报告的体验褒贬不一,一些人称…