PulseAugur
实时 01:24:05
实体 CursorBench

CursorBench

PulseAugur coverage of CursorBench — every cluster mentioning CursorBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 19
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 19 条
  1. TOOL · CL_226621 ·

    CursorBench 按代币成本效率对 AI 模型进行排名

    一个名为 CursorBench 的新基准发布,专注于各种 AI 模型的代币成本效率。该排名于 8 月 30 日发布,提供了关于哪些模型在代币使用和成本方面提供最佳价值的见解。

  2. TOOL · CL_213138 ·

    埃隆·马斯克的 Grok 4.6 声称在 CursorBench 上名列前茅

    埃隆·马斯克宣布,Grok 4.6 在其“超高思考模式”下运行,已在 CursorBench 基准测试中取得最高分。这一成就使 Grok 4.6 在此特定评估中成为领先模型。

  3. TOOL · CL_201568 ·

    CursorBench 因在模型成本比较中省略 token rate 而受到批评

    Reddit r/cursor 版块的一位用户正在质疑为什么性能基准测试工具 CursorBench 不在其计算中包含“Cursor Token Rate”。用户认为,这个速率是 Cursor 中大多数模型(不包括 Grok 和 Composer)的一个重要成本因素,应该被纳入基准测试中,以更准确地反映模型成本。他们建议,省略此速率会使竞争模型在 Cursor 用户看来比实际成本更便宜。

  4. TOOL · CL_199542 ·

    Anthropic的Opus 5以一半的成本媲美Fable 5的性能

    最近的一项CursorBench测试表明,Anthropic的Opus 5模型在每项任务成本减半的情况下,实现了与Fable 5相当的性能。这一发现表明,成本效益可能比原始性能成为企业AI采购决策中更重要的因素,可能改变当前的支出动态。

  5. COMMENTARY · CL_199446 ·

    Reddit 质疑 CursorBench 的模型与线束测量

    Reddit 上的一场讨论质疑了 CursorBench 作为 AI 模型基准测试的有效性,特别是考察了 Grok 4.6 的表现。提出的核心问题是,该基准测试衡量的是模型的能力还是 Cursor 提供的“线束”,尤其是考虑到 Grok 4.6 是与 Cursor 联合开发的。该帖子认为,每 token 成本可能是编码代理过时的指标,提出考虑上下文增长和恢复等因素,完成任务的可靠成本更为相关。

  6. SIGNIFICANT · CL_175218 ·

    xAI 发布 Grok 4.5,该模型在真实开发者工作流上进行训练 · 跟踪 1 个来源

    xAI 发布了 Grok 4.5,这是一个拥有 1.5 万亿参数的混合专家(MoE)模型,该模型在 Cursor IDE 的真实开发者交互数据上进行了训练。这种独特的训练方法,包括多文件差异和调试器会话,旨在提高模型在代理工作流中协助开发者的能力。虽然 Grok 4.5 提供了快速的服务速度和超越纯编码的广泛训练组合,但与前代模型相比,其上下文窗口有所减小,并且由于意外包含了 Cursor 的代码库,面临基准测试污染问题。

  7. TOOL · CL_166494 ·

    Together将Kimi K3集成到Cursor AI助手

    Together已与Cursor合作,将Kimi K3集成到Cursor AI助手。此次集成允许用户通过Fireworks、Together和Baseten提供的基于美国的推理基础设施访问Kimi K3,并支持零数据保留。Kimi K3在CursorBench基准测试中表现强劲,接近前沿模型的能力。

  8. TOOL · CL_166454 ·

    Cursor IDE 集成了 Kimi K3 语言模型

    AI驱动的IDE Cursor已集成Kimi K3,该语言模型在CursorBench基准测试中的表现可与前沿模型相媲美。此次集成通过美国境内的推理合作伙伴(包括Fireworks、Together和Baseten)提供,并支持零数据保留。欧洲用户也可以访问Kimi K3。

  9. TOOL · CL_162028 ·

    Cursor 添加 Claude Opus 5,在基准测试中以更低价格匹配 Fable 5

    Cursor 宣布将其 AI IDE 集成 Claude Opus 5,将其定位为 Fable 5 的竞争性替代品。据报道,Claude Opus 5 在 CursorBench 基准测试中的表现与 Fable 5 相当,在默认努力下得分 66.7,而 Fable 5 为 66.5。此外,Claude Opus 5 提供零数据保留功能,这是 Fable 所不具备的,并且价格只有 Fable 的一半。

  10. FRONTIER RELEASE · CL_160596 ·

    Anthropic 的 Claude Opus 5 以一半的价格匹配 Fable 5 的性能 · 跟踪了 10 个来源

    Anthropic 发布了 Claude Opus 5,一款新模型,其性能可与 Fable 5 相媲美,而价格却只有 Fable 5 的一半。早期评估和用户轶事表明,Opus 5 在编码、复杂推理和智能体任务方面表现出色,在 Frontier-Bench 和 CursorBench 等基准测试中,其能力常常能与 Fable 5 相匹配甚至超越。该模型还拥有 100 万个 token 的上下文窗口和更高的效率,使其成为开发人员和企业应用的有力选择。

  11. TOOL · CL_134454 ·

    Cursor 集成了 GPT-5.6 Sol、Terra 和 Luna;发布性能基准测试

    Cursor 宣布集成了三款新的人工智能模型:GPT-5.6 Sol、Terra 和 Luna。该公司还推出了 CursorBench,一个用于比较人工智能模型性能的平台。在 CursorBench 上,GPT-5.6 Sol 的得分为 67.2%。

  12. TOOL · CL_119229 ·

    Claude Fable 5 在用户询问后重返 Cursor IDE

    Claude Fable 5,一个曾一度在 CursorBench 基准测试中领先的模型,已重新在 Cursor AI IDE 中提供。用户曾询问其回归事宜,一些用户注意到它并未出现在 Anthropic 关于 API 访问和其他平台的官方公告中。尽管性能优异,Claude Fable 5 也被指出是每项任务中最昂贵的模型。

  13. TOOL · CL_118824 ·

    Cursor AI IDE 集成 Claude Sonnet 5,性能有所提升

    AI 驱动的 IDE Cursor 宣布集成了 Claude Sonnet 5,标志着其相比先前版本的一次重大升级。该公司还分享了其最新的模型排名,突出了 Claude Sonnet 5 的性能改进。在 CursorBench 上,Claude Sonnet 5 的得分达到 57%,相比 Claude Sonnet 4.6 的 49% 有显著提升。

  14. FRONTIER RELEASE · CL_112971 ·

    Anthropic 的 Claude Fable 5 引发关于 AI 实力和监管的辩论 · 已追踪 4 个来源

    Anthropic 的新 AI 模型 Claude Fable 5 被定位为一项重大进展,有比较表明其性能优于 Claude Opus 4.8 等早期版本。一些报道指出,该模型在 2026 年 6 月 9 日发布后不久,因其感知到的强大能力而被美国政府短暂下线。Claude Fable 5 的推出也促使人们重新评估 AI 的概念化和使用方式。

  15. COMMENTARY · CL_69243 ·

    Polymarket:Anthropic的Claude Opus 4.8被看好在AI模型竞赛中领先

    Polymarket上的预测市场显示,强烈看好Anthropic的Claude Opus 4.8在2026年6月底成为最佳AI模型,赔率达到96%。这种信心的激增归因于早期预览和在基准测试中的强劲表现,显著影响了OpenAI的主导地位感知。交易员还在押注Anthropic持续的私募估值增长,预计年底将大幅增加,而NVIDIA预计将因其基础设施角色而保持最大公司的地位。

  16. SIGNIFICANT · CL_61719 ·

    Anthropic 的 Opus 4.8 推出支持并行代理的动态工作流

    Anthropic 发布了 Opus 4.8,引入了一个名为动态工作流的新编程模型,该模型允许在单个会话中支持数百个并行子代理。此功能旨在通过处理并发、结构化输出验证和重试来简化代理开发,从而取代自定义编排器的需求。此次更新还包括显著的基准改进,Opus 4.8 在 CursorBench 和 Terminal-Bench 2.1 评估中均超越了 GPT-5.5。

  17. TOOL · CL_60535 ·

    Anthropic 的 Claude Opus 4.8 提供渐进式改进和平台更新

    Anthropic 发布了 Claude Opus 4.8,该版本在特定任务(如文档解析和文档忠实度)上提供了一些细微的改进,但并未实现显著的基准飞跃。一些用户报告了在特定任务上的微小进步,而另一些用户则注意到内容准确性方面有所回退。此次更新还包括了平台增强功能,例如对话中系统指令,但 API 用户对定价仍有争议。

  18. FRONTIER RELEASE · CL_55155 ·

    Anthropic 发布 Claude Opus 4.8,增强了编码和推理能力

    Anthropic 发布了 Claude Opus 4.8,这是其旗舰 AI 模型的升级版,在编码、推理和可靠性方面都有显著改进。新版本在识别代码缺陷和处理复杂的代理工作流方面表现更佳,早期测试者报告称其判断力和诚实度有所提高。虽然 Anthropic 将其定位为一次小幅升级,但也暗示了未来具有更高智能的“Mythos 级”模型,需要进一步加强安全性。

  19. SIGNIFICANT · CL_48042 ·

    Fireworks AI 实现万亿参数 MoE 模型训练

    Fireworks AI 开发了新的训练基础设施,能够微调万亿参数的混合专家(MoE)模型,克服了之前的内存和编排瓶颈。该平台在最近发布的 Cursor Composer 2.5 中发挥了关键作用,Composer 2.5 是一个在多个基准测试中取得顶尖性能的编码模型。该系统利用低精度专家量化和优化器状态卸载等技术来管理大型 MoE 模型内存需求,使其更容易进行训练和微调。