Poolside AI 发布了 Laguna S 2.1,这是一款拥有 118B 参数的混合专家模型,其中 8B 参数被激活,并拥有 1M token 的上下文窗口。该模型在不到九周的时间内开发完成,在长时程编码基准测试中表现强劲,在同级别模型中超越了体积大其数倍的模型。Laguna S 2.1 在 Terminal-Bench 2.1 上获得了 70.2% 的分数,在 DeepSWE v1.1 上获得了 40.4% 的分数,所有评估轨迹均已公开。 AI
影响 这款紧凑型、高上下文的模型可以支持更复杂的 AI 代理在本地运行,可能加速专业 AI 工具的开发。
排序理由 Poolside AI 发布了带有系统卡的 Frontier-lab 模型。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
在 Hacker News — AI stories ≥50 points 阅读 →
- Claude fable
- Inkling
- Kimi k3
- Muse Spark
- Nemotron 3 Ultra
- Poolside AI
- Qwen
- SWE Atlas
- SWE-Bench Multilingual
- SWE-Bench Pro
- Terminal-Bench 2.1
- Toolathlon Verified
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →