PulseAugur
实时 09:22:29
English(EN) PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

新的PluginEval基准改进了LLM工具路由评估

研究人员推出PluginEval,一个旨在更有效地评估大型语言模型(LLM)工具路由能力的新诊断基准。该基准通过确保对罕见场景的更好表示、纳入对抗性困难负例以及通过实际API执行来验证LLM判断,解决了现有方法的局限性。PluginEval按能力和意图分解插件,生成不同难度级别的查询,为每个模型创建详细的错误配置文件,超越了简单的聚合准确性。 AI

影响 增强了对LLM代理的评估,可能导致更可靠的自主系统。

排序理由 该集群描述了一个用于评估LLM能力的新的基准,该基准在一篇学术论文中提出。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的PluginEval基准改进了LLM工具路由评估

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu ·

    PluginEval:函数调用中细粒度错误归因的诊断基准

    arXiv:2608.08700v1 Announce Type: new Abstract: Reliable evaluation of tool routing is critical as Large Language Models increasingly operate as autonomous agents. Current benchmarks face three structural limitations: data distributions that follow a power law leave rare scenario…