研究人员推出了ClinLens,这是一个旨在评估长时程编码代理在多模态临床数据科学中能力的新基准。该基准包含200个可执行任务,使用了五个链接的MIMIC资源,包括电子健康记录、笔记和各种医学影像类型。评估分类法跨越了患者时间范围和分析能力,目前领先的配置在部分任务上的准确率仅为56.3%,这凸显了可运行代码与正确临床分析之间存在的巨大差距。 AI
影响 凸显了AI代理在复杂、纵向临床数据分析中面临的重大挑战,表明需要改进推理和执行能力。
排序理由 该集群描述了一篇介绍AI研究新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- ClinLens
- CORE Recommender
- DagsHub
- Gotit.pub
- GPT-4o mini
- Hugging Face
- Influence Flower
- MIMIC
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →