ScholarQABench
PulseAugur coverage of ScholarQABench — every cluster mentioning ScholarQABench across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的大型知识模型旨在为AI代理组织科学文献
研究人员推出了一种新颖的知识基础——大型知识模型(LKM),旨在支持大规模代理科学。LKM将科学文献组织成推理图,其中主张是节点,由明确的推理链和证据连接。这种结构支持高并发访问,保留可追溯的推理,并实现科学知识的增量增长。该系统在包括SciFact-Open、ScholarQABench、ChemBench、PubMedQA和SciBench在内的各种基准测试中,在科学检索、引用准确性和问答方面均表现出改进。
-
EMBL AI Librarian 增强 AI 代理对生命科学文献的访问能力
研究人员开发了 EMBL AI Librarian,这是一个旨在增强 AI 代理对生命科学文献访问能力的新知识层。该系统升级了 Europe PMC 界面,允许代理使用自然语言进行查询并获得基于证据的直接答案。通过协调互补的子查询和分析检索到的论文,Librarian 显著提高了在文献综合、主张验证和开放领域问答基准测试上的性能。当集成到主张验证流程中时,它提高了与专家共识的一致性,并且在使用 Librarian 时,GPT-5.4 …
-
EMBL AI Librarian 增强AI代理对生命科学文献的访问能力
研究人员开发了EMBL AI Librarian,这是一个旨在增强AI代理对生命科学文献访问能力的新知识层。该系统升级了Europe PubMed Central界面,允许代理使用自然语言查询信息,并接收具体证据而非整篇论文。一个中央LLM协调对Europe PMC搜索引擎的子查询,并综合选定文章的发现。评估显示,在文献综合和声明验证等任务方面有了显著改进,使用Librarian时,GPT-5.4代理在基准测试中的得分明显更高。