PulseAugur
实时 10:12:58
English(EN) Stress-testing large language model agents in a robotic chemistry laboratory

大型语言模型代理在机器人化学实验室压力测试中失败

一篇新发表在arXiv上的研究详细介绍了如何利用机器人化学实验室对大型语言模型(LLM)代理进行压力测试。研究人员发现,LLM代理在可靠的物理操作和根据证据进行适应方面存在困难,只有3.3%的试验产生了专家评估的可执行工作流。尽管实验反馈促使了微小调整,但代理并未展示出工作流级别的重新规划或分析方法重新设计能力。该研究旨在为LLM在科学研究中的部署就绪度提供可衡量的评估,并为改进提供一个框架。 AI

影响 凸显了当前LLM代理在执行复杂、现实世界科学任务方面的显著局限性,表明需要改进规划和适应能力。

排序理由 学术论文,详细介绍了关于LLM能力的研究发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

大型语言模型代理在机器人化学实验室压力测试中失败

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Lulu Guo, Yingkai Sun, Xiaobo Li, Luyao Ge, Ziming Wang, Haitao Zheng, Jingyu Li, Huijuan Zhang, Bingxu Chen, Daobin Liu, Yuebo Liu, Jie Li, Xiaohui Li, Linjiang Chen, Yi Luo, Jun Jiang ·

    Stress-testing large language model agents in a robotic chemistry laboratory

    arXiv:2607.23045v1 Announce Type: new Abstract: AI is evaluated through knowledge, reasoning and plan generation, yet scientific agency requires reliable physical action and adaptation to evidence. Here, we use a robotic chemistry laboratory as a physical-world testbed to make sc…