CursorBench 4.0 结果显示,Opus 5.5 Max 取得了最高的 57.8% 的分数,但每任务成本为 13.43 美元。Sonnet 5.5 Max 和 Haiku 5.5 Max 提供了更好的成本效益,分别获得 55.5%(7.05 美元)和 48.4%(1.12 美元)的分数。模型之间的性能差异可能具有统计学意义。 AI
影响 提供 AI 模型的性能和成本对比数据,有助于为特定应用选择模型。
排序理由 AI 模型基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →