一项比较多种大型语言模型在工具调用能力方面表现的基准测试显示,Ornith 1.5 和 Tiel-Coder 的表现最佳。这些专为显存有限硬件设计的模型,其表现优于原始的 Qwen3.6-35B-A3B 和 Qwen3.6-27B 变体。KAT Coder 也显示出比原始 Qwen3.6-35B-A3B 的改进,而 Ornith-1.5-Heretic 在测试中令人失望。 AI
影响 新的基准测试突显了 Ornith 1.5 和 Tiel-Coder 在工具调用方面的强劲表现,可能为显存有限的用户提供替代方案。
排序理由 该项目详细介绍了在工具调用能力方面比较不同 LLM 的基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →