PulseAugur
实时 08:05:36
English(EN) InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

新的基准 InfiniteScienceGym 测试 LLM 的科学推理能力

一个名为 InfiniteScienceGym 的新基准已被开发出来,用于评估大型语言模型的科学推理能力。这个程序生成的基准创建了真实的科学知识库和问答任务,旨在克服现有数据集的局限性,如发表偏差和噪声。初步评估显示,目前专有的和开源的模型都表现不佳,没有一个准确率超过 50%,尤其是在识别无法回答的问题方面。研究还表明,更先进的模型倾向于有效利用工具,而不是仅仅处理更多数据。 AI

影响 该基准通过突出证据推理和工具使用方面的当前局限性,有可能加速更强大的 AI 科学助手的开发。

排序理由 该条目描述了一个用于评估 AI 模型的新基准,该基准发表在 arXiv 的学术论文中。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准 InfiniteScienceGym 测试 LLM 的科学推理能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Oliver Bentham, Vivek Srikumar ·

    InfiniteScienceGym:一个无界、程序化生成的科学分析基准

    arXiv:2604.13201v2 Announce Type: replace-cross Abstract: Large language models are emerging as scientific assistants, but evaluating their ability to reason from empirical data remains challenging. Benchmarks derived from published studies and human annotations inherit publicati…