Poolside 的新 Laguna S 2.1 (118B-A8B) 模型已作为浏览器代理规划器进行了基准测试。它实现了 71% 的 Sonnet 对齐,表现与腾讯的 Hy3 和 Minimax M3 相当,但略逊于 Gemma 4 31B Q。 AI
影响 为代理规划任务提供性能数据,对选择模型的开发者有用。
排序理由 该项目对特定模型的任务性能进行了基准测试,并与其他模型进行了比较。 [lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →