PulseAugur
实时 23:14:53
English(EN) Benchmarked Poolside's new Laguna S 2.1 (118B-A8B) as a browser-agent planner. 71% Sonnet alignment. Near Hy3/MiniMax M3 but below them, and below Gemma 4 31B Q

Poolside 的 Laguna S 2.1 已作为浏览器代理规划器进行基准测试

Poolside 的新 Laguna S 2.1 (118B-A8B) 模型已作为浏览器代理规划器进行了基准测试。它实现了 71% 的 Sonnet 对齐,表现与腾讯的 Hy3 和 Minimax M3 相当,但略逊于 Gemma 4 31B QAI

影响 为代理规划任务提供性能数据,对选择模型的开发者有用。

排序理由 该项目对特定模型的任务性能进行了基准测试,并与其他模型进行了比较。 [lever_c_demoted from research: ic=1 ai=1.0]

在 Mastodon — fosstodon.org 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Poolside 的 Laguna S 2.1 已作为浏览器代理规划器进行基准测试

报道来源 [1]

  1. Mastodon — fosstodon.org TIER_1 English(EN) · [email protected] ·

    Benchmarked Poolside's new Laguna S 2.1 (118B-A8B) as a browser-agent planner. 71% Sonnet alignment. Near Hy3/MiniMax M3 but below them, and below Gemma 4 31B Q

    Benchmarked Poolside's new Laguna S 2.1 (118B-A8B) as a browser-agent planner. 71% Sonnet alignment. Near Hy3/MiniMax M3 but below them, and below Gemma 4 31B QAT / Qwen 3.6 27B (~77%). Best US open-weight in its class, half the size of M3 👇 https://www. webbrain.one/blog/poolsid…