PulseAugur
中
实时 01:27:19
English(EN) AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment

新的AcuityBench基准评估LLM医疗紧急情况识别能力

研究人员推出AcuityBench,一个旨在评估大型语言模型准确识别用户提出的医疗情况紧急程度能力的新基准。与关注问答或分诊的现有健康基准不同,AcuityBench将五个数据集整合到一个统一的四级敏锐度框架中,涵盖914个病例。对12个前沿模型进行的初步测试显示,性能存在显著差异,模型在过度分诊和分诊不足之间存在权衡,具体取决于响应格式。该基准还强调,当前模型在模糊病例上的判断与医生不符,并且不确定性表达不够细致。 AI

影响 凸显了当前LLM在医疗应用中存在的关键安全差距,需要对不确定性对齐进行进一步研究。

排序理由 学术论文介绍新的LLM评估基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的AcuityBench基准评估LLM医疗紧急情况识别能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Robin Linzmayer (Department of Computer Science, Columbia University, Department of Biomedical Informatics, Columbia University), Georgianna Lin (Department of Biomedical Informatics, Columbia University), Di Coneybeare (Department of Emergency Medicine,… ·

    AcuityBench:评估临床敏锐度识别与不确定性对齐

    arXiv:2605.11398v2 Announce Type: replace Abstract: We introduce AcuityBench, a benchmark for evaluating whether language models identify the appropriate urgency of care from user medical presentations. Existing health benchmarks emphasize medical question answering, broad health…