一个名为ABLE的新基准已被开发出来,用于评估大型语言模型(LLM)代理在使用生物AI模型进行蛋白质设计任务方面的能力。该基准评估了结构检索、序列生成和设计验证方面的性能。在评估的15个前沿模型中,有7个拒绝了所有任务,而其他模型则表现出显著的性能差异。Claude Sonnet 4和Gemini 3 Pro在信息检索、工具选择和工具使用方面得分最高,这表明虽然大型语言模型(LLM)可以降低蛋白质设计的门槛,但它们在规划以及将生物知识与工具应用相结合方面仍然存在困难。 AI
影响 该基准可以加速在蛋白质设计等领域开发更具能力的AI代理,以促进科学发现。
排序理由 该集群描述了一篇介绍用于评估大型语言模型(LLM)代理基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →