最近的一项基准测试评估了两个本地大型语言模型 Qwen3-14B 和 Llama-3.2-3B 在执行真实 API 任务函数调用方面的能力。虽然两个模型都表现出很强的 JSON 有效性,其中较小的 Llama-3.2-3B 模型略占优势,但较大的 Qwen3-14B 模型在参数正确性方面表现更优,尤其是在多轮对话和错误恢复场景中。尽管 Qwen3-14B 模型未能达到 GPT-4 的可靠性水平,但其性能表明它更适合需要准确数据提取和上下文维护的复杂本地编码代理。 AI
影响 本地 LLM 在函数调用方面正在改进,大型模型在复杂场景下表现出更高的准确性。
排序理由 对两个特定 LLM 在技术能力(函数调用)方面的比较。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →