Cognition 的 SWE-2 模型在 Terminal-Bench 2.1 基准测试中取得了 92.8 分。这一性能指标突显了该模型在特定评估环境中的能力。 AI
影响 为特定评估中的 AI 模型设定了新的基准分数。
排序理由 该集群报告了 AI 模型的基准分数,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →