一篇新发表在arXiv上的研究详细介绍了如何利用机器人化学实验室对大型语言模型(LLM)代理进行压力测试。研究人员发现,LLM代理在可靠的物理操作和根据证据进行适应方面存在困难,只有3.3%的试验产生了专家评估的可执行工作流。尽管实验反馈促使了微小调整,但代理并未展示出工作流级别的重新规划或分析方法重新设计能力。该研究旨在为LLM在科学研究中的部署就绪度提供可衡量的评估,并为改进提供一个框架。 AI
影响 凸显了当前LLM代理在执行复杂、现实世界科学任务方面的显著局限性,表明需要改进规划和适应能力。
排序理由 学术论文,详细介绍了关于LLM能力的研究发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →