研究人员推出AISE-Bench,一个旨在评估大型语言模型(LLMs)从学术知识图谱中检索信息能力的新基准。该基准通过整合真实的用户意图、复杂的多步API规划以及带有引用的接地答案,解决了现有工具的局限性。AISE-Bench包含超过1100个问答对,附带详细的API执行轨迹和全面的评估协议。初步测试表明,即使是像PLAY2PROMPT(使用Gemini-3-Pro)这样的先进模型,也只取得了中等水平的性能,凸显了LLM代理在API规划和执行方面面临的重大挑战。 AI
影响 为提高LLM代理与复杂学术知识图谱交互的能力,建立了一个新的、具有挑战性的测试平台。
排序理由 该集群包含一篇介绍用于评估AI模型的新基准的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →