研究人员推出 MetaSyn,一个包含来自 Nature Portfolio 期刊的 442 篇专家策展的荟萃分析的新数据集,旨在对大型语言模型 (LLM) 智能体在科学推理方面的能力进行基准测试。该数据集包括 PI/ECO 标准、140,000 篇 PubMed 文章的语料库以及经过验证的研究,旨在评估文献检索、研究选择和统计汇总的完整流程。对十二种不同 LLM 配置的基准测试显示,筛选过程存在显著瓶颈,当前系统在从干扰项中可靠识别合格研究方面存在不足,尽管检索率很高,但召回率最高仅为 52.7%。 AI
影响 这项研究突显了 LLM 智能体在复杂科学推理方面(尤其是在研究选择方面)的当前局限性,指明了未来发展的方向。
排序理由 该集群描述了一篇介绍新数据集和基准测试的学术论文,用于评估 LLM 智能体在特定科学任务上的表现。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- Hugging Face
- LLM Agents
- Nature Portfolio
- PubMed
- alphaXiv
- CatalyzeX
- Connected Papers
- DagsHub
- Gotit.pub
- Litmaps
- ScienceCast
- scite Smart Citations
- Anzhe Xie
- arXiv
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →