PulseAugur
中
实时 22:58:37
English(EN) BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering

新的BioEVAL基准测试用于评估LLM在生物工程任务上的表现

一项名为BioEVAL的新基准测试已被开发出来,用于评估大型语言和多模态模型在生物工程领域的实验推理能力。该项目涉及22个研究小组,创建了一个博士级别的基准测试,包含608个条目,涵盖11个子领域,包括选择题、文献综合任务和多模态问题。ChatGPT、Gemini和Grok等云规模模型在选择题上的准确率高达90%,但在不同生物工程领域的表现差异很大。 AI

影响 该基准测试可以指导未来LLM在专业科学应用中的开发,并揭示复杂推理任务中的性能差距。

排序理由 该集群描述了一个用于评估特定科学领域LLM和多模态模型的新学术基准测试。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的BioEVAL基准测试用于评估LLM在生物工程任务上的表现

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Shun Ye, Vinny Chandran Suja, Chenlong Li, Chongming Jiang, Reza Zamani, Xiang Li, Christopher Bain, Yuqi Zhou, Walker Peterson, Huidong Wang, Chenglang Hu, Jongchan Park, Xiao Cheng, Benjamin Swedlund, Sandra Murillo, Anjali Sivanandan, Shiyu Sun, Liang… ·

    BioEVAL:一个用于生物工程的大型语言和多模态模型的全球、多机构基准测试

    arXiv:2609.30489v1 Announce Type: new Abstract: Large Language Models (LLMs) have demonstrated historic breakthroughs in general reasoning with early successes in biomedical science. However, existing LLM benchmarking emphasizes factual recall, offering limited insight into model…