研究人员推出了AnesTRACE,这是一个旨在对术中麻醉决策进行基准测试的新评估套件。该套件包括用于感知和决策任务的AnesTRACE-Bench,以及使用麻醉师定义的标准来评估临床正确性、证据基础、安全性和时间一致性的AnesTRACE-Eval。当前模型在细粒度视觉基础和干预选择方面存在困难,领先模型在视觉基础方面的mIoU仅为32.2%,在多步管理中的重大/危急安全错误率为17.5%。评估还强调,虽然评估者与专家的_对齐_有所改善,但仅凭_聚合_性能并不能保证安全及时的纵向决策。 AI
影响 凸显了AI在复杂、安全关键型决策方面面临的重大挑战,表明需要改进医疗应用中的多模态感知和推理能力。
排序理由 该集群包含一篇详细介绍特定领域AI评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- AnesTRACE
- AnesTRACE-Bench
- AnesTRACE-Eval
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- Ziwei Huang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →