一个名为 InfiniteScienceGym 的新基准已被开发出来,用于评估大型语言模型的科学推理能力。这个程序生成的基准创建了真实的科学知识库和问答任务,旨在克服现有数据集的局限性,如发表偏差和噪声。初步评估显示,目前专有的和开源的模型都表现不佳,没有一个准确率超过 50%,尤其是在识别无法回答的问题方面。研究还表明,更先进的模型倾向于有效利用工具,而不是仅仅处理更多数据。 AI
影响 该基准通过突出证据推理和工具使用方面的当前局限性,有可能加速更强大的 AI 科学助手的开发。
排序理由 该条目描述了一个用于评估 AI 模型的新基准,该基准发表在 arXiv 的学术论文中。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- InfiniteScienceGym
- Oliver Bentham
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →