研究人员推出了MDArena,这是一个旨在评估编码代理在真实分子动力学(MD)工作流中的能力的新基准。该基准由来自活跃的生物分子模拟项目的50个容器化任务组成,涵盖了轨迹分析和系统准备等领域。在评估中,Codex GPT-5.5表现最强,实现了48%的Strict-Pass@1成功率,OpenCode Gemini Flash 3.5紧随其后。尽管取得了一部分进展,但目前的编码代理在复杂任务上仍然面临挑战,凸显了它们作为助手和作为独立研究人员的可靠性之间的差距。 AI
影响 强调了在科学研究中需要更强大的AI代理,特别是在复杂的模拟任务方面。
排序理由 该集群描述了一个用于评估AI模型在科学任务上的新基准,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- Codex GPT-5.5
- coding agents
- free-energy protocols
- MDArena
- membrane protein
- molecular dynamics simulation
- OpenCode Gemini Flash 3.5
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →