研究人员开发了MedBenchAgent,一个新颖的多智能体框架,旨在自动化医疗视觉语言模型(VLM)基准的构建。该框架将基准创建视为一个受约束的编译过程,能够从多样化的标注和医学知识中系统地推导出评估规范。MedBenchAgent将规划与实例化分离,实现了90.9%的任务空间F1分数,并通过了99.4%抽样项目的 [人类审计],显著优于先前的方法。 AI
影响 为创建医疗VLM基准建立了一个新的可审计框架,有望加速专业领域VLM的开发和评估。
排序理由 该集群描述了一篇研究论文,详细介绍了一个用于自动化基准构建的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →