PulseAugur
实时 09:44:41
English(EN) MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

新的MDArena基准揭示了编码代理在分子动力学方面的局限性

研究人员推出了MDArena,这是一个旨在评估编码代理在真实分子动力学(MD)工作流中的能力的新基准。该基准由来自活跃的生物分子模拟项目的50个容器化任务组成,涵盖了轨迹分析和系统准备等领域。在评估中,Codex GPT-5.5表现最强,实现了48%的Strict-Pass@1成功率,OpenCode Gemini Flash 3.5紧随其后。尽管取得了一部分进展,但目前的编码代理在复杂任务上仍然面临挑战,凸显了它们作为助手和作为独立研究人员的可靠性之间的差距。 AI

影响 强调了在科学研究中需要更强大的AI代理,特别是在复杂的模拟任务方面。

排序理由 该集群描述了一个用于评估AI模型在科学任务上的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MDArena基准揭示了编码代理在分子动力学方面的局限性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin ·

    MDArena:在真实的分子动力学工作流上评估编码代理

    arXiv:2608.02642v1 Announce Type: cross Abstract: Accelerating scientific discovery is among the most consequential applications of AI, and computational biomolecular simulation stands out as a particularly promising target within this broader effort. Coding agents promise to aut…