一位用户使用Toolery基准测试了15个本地大型语言模型在工具和代理使用方面的能力。该基准测试包含四个难度级别的143个场景,每个模型在每个场景下进行3次试验。模型在本地使用LM Studio运行,具有30k token上下文窗口和0.8的温度。qwen/qwen3.8-27b模型以71.8%的总分获得最高分,在简单和中等难度级别中表现尤为出色。 AI
影响 提供了本地LLM在代理任务方面的实际能力见解,指导用户选择用于工具使用的模型。
排序理由 用户进行的基准测试和对多个开源模型的比较。[lever_c_demoted from research: ic=1 ai=1.0]
- Bonsai 27B
- google/gemma-4-26b-a4b
- granite-4.2-8b
- lfm2.5-8b-a1b
- LM Studio
- mellum2-12b-a2.5b-thinking
- meta/muse-glimmer
- mistralai/devstral-small-2-2512
- ornith-1.5-35b-a3b
- ornith-1.5-9b
- qwen3.8-flash-next-iq2_xs
- qwen/qwen3.8-27b
- Toolery
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →