PulseAugur
实时 00:13:21
实体 AutoMedBench

AutoMedBench

PulseAugur coverage of AutoMedBench — every cluster mentioning AutoMedBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_65383 ·

    新基准评估AI Agent在医学研究工作流中的表现

    研究人员推出了AutoMedBench,一个旨在评估AI Agent在端到端医学研究工作流中性能的新基准。该基准将Agent执行组织成一个五阶段过程,包括规划、设置、验证、推理和提交,任务平均有33个Agent回合。对数千次运行的分析显示,验证阶段是最薄弱的,而设置阶段是最强的,这表明当前的Agent在创建可执行管道方面比确保其可靠性更在行。