Cognition 发布了 SWE-2,这是一款使用 Moonshot AI 的 Kimi K3 模型进行强化学习后训练的新型编码模型。据报道,该新模型在 FrontierCode 基准测试上的表现与 Fable 5.1 相当,但成本显著降低。SWE-2 还引入了可选的推理工作量级别,在一次强化学习运行中进行训练,并且与前代 SWE-1.7 相比,在编码任务上展现出更高的效率和更少的绕路。 AI
影响 为编码模型设定了新的成本效益基准,可能影响未来的开发和部署策略。
排序理由 来自前沿实验室 (Cognition) 的新模型发布,并附有性能基准。 [lever_c_demoted from frontier_release: ic=1 ai=1.0]
- cognition
- Devin
- Fable 5.1
- FrontierCode
- GPT-6 Astra
- Kimi K3
- Moonshot AI
- SWE-1.7
- Terminal-Bench 2.1
- Terminal-Bench 4
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →