研究人员推出PluginEval,一个旨在更有效地评估大型语言模型(LLM)工具路由能力的新诊断基准。该基准通过确保对罕见场景的更好表示、纳入对抗性困难负例以及通过实际API执行来验证LLM判断,解决了现有方法的局限性。PluginEval按能力和意图分解插件,生成不同难度级别的查询,为每个模型创建详细的错误配置文件,超越了简单的聚合准确性。 AI
影响 增强了对LLM代理的评估,可能导致更可靠的自主系统。
排序理由 该集群描述了一个用于评估LLM能力的新的基准,该基准在一篇学术论文中提出。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →