PulseAugur
实时 07:02:04
English(EN) ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

新的ClinLens基准揭示了AI编码代理在临床数据科学中的局限性

研究人员推出了ClinLens,这是一个旨在评估长时程编码代理在多模态临床数据科学中能力的新基准。该基准包含200个可执行任务,使用了五个链接的MIMIC资源,包括电子健康记录、笔记和各种医学影像类型。评估分类法跨越了患者时间范围和分析能力,目前领先的配置在部分任务上的准确率仅为56.3%,这凸显了可运行代码与正确临床分析之间存在的巨大差距。 AI

影响 凸显了AI代理在复杂、纵向临床数据分析中面临的重大挑战,表明需要改进推理和执行能力。

排序理由 该集群描述了一篇介绍AI研究新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的ClinLens基准揭示了AI编码代理在临床数据科学中的局限性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han ·

    ClinLens:面向纵向多模态临床数据科学的长时域编码代理

    arXiv:2607.26155v1 Announce Type: new Abstract: Clinical data-science agents must transform heterogeneous longitudinal records into auditable analyses, yet existing benchmarks largely isolate medical question answering, structured-table reasoning, or generic scientific repositori…