对 Meta 新推出的专为本地代理工作流程设计的 30B Muse Glimmer 模型进行的最新基准测试显示,虽然它在常见任务上表现正确,但其延迟明显高于较小的模型。作者在 MacBook Pro 上将 Muse Glimmer 与 14B Qwen3 和 3B Llama3.2 模型进行了测试,发现所有模型在模式一致性和工具调用任务上都达到了完美的准确率。然而,在 JSON 提取等任务中,30B 模型比 3B 模型慢了 56 倍,这主要是由于其权重内部存在过度的审议,即使在指示禁用思考的情况下也是如此。 AI
影响 尽管 Meta 的新 30B 模型准确,但对于本地代理任务而言,其速度明显慢于较小的替代模型,凸显了模型选择中的经济权衡。
排序理由 文章针对特定用例对现有模型发布进行了基准测试,而不是宣布新的前沿模型。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →