PulseAugur
实时 10:35:05
English(EN) AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

新的AISE-Bench基准挑战LLM在学术知识图谱信息检索方面的能力

研究人员推出AISE-Bench,一个旨在评估大型语言模型(LLMs)从学术知识图谱中检索信息能力的新基准。该基准通过整合真实的用户意图、复杂的多步API规划以及带有引用的接地答案,解决了现有工具的局限性。AISE-Bench包含超过1100个问答对,附带详细的API执行轨迹和全面的评估协议。初步测试表明,即使是像PLAY2PROMPT(使用Gemini-3-Pro)这样的先进模型,也只取得了中等水平的性能,凸显了LLM代理在API规划和执行方面面临的重大挑战。 AI

影响 为提高LLM代理与复杂学术知识图谱交互的能力,建立了一个新的、具有挑战性的测试平台。

排序理由 该集群包含一篇介绍用于评估AI模型的新基准的学术论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AISE-Bench基准挑战LLM在学术知识图谱信息检索方面的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li ·

    AISE-Bench:面向学术知识图谱信息检索的全周期精选基准测试

    arXiv:2607.20498v1 Announce Type: new Abstract: Large language models (LLMs) augmented with tools are emerging as autonomous agents capable of using Web engine, APIs, and code to solve complex, long-horizon tasks. Current tool-using benchmarks for information seeking on academic …