PulseAugur
实时 10:04:09
English(EN) RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

新基准揭示LLM在呼吸科临床护理中的局限性

研究人员推出了RESPClinBench,这是一个旨在评估大型语言模型(LLM)在处理复杂的呼吸科临床决策和纵向疾病管理能力的新基准。该基准包括慢性阻塞性肺疾病急性加重(AECOPD-PIM)和肺结节评估(PNBIM)的病例,并用于测试七个LLM。Qwen模型表现最佳,其中Qwen3.6-27B在总体和AECOPD-PIM方面领先,而Qwen3.5-397B-A17B在PNBIM类别中名列前茅。评估还突出了模型响应中成像幻觉和医疗风险的重大问题,强调了临床基础验证的必要性。 AI

影响 凸显了LLM在专业医疗应用中的关键安全性和准确性差距,指导了未来模型的开发和验证。

排序理由 该集群在一篇学术论文中描述了一个新的基准测试以及对LLM在临床任务上的评估。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准揭示LLM在呼吸科临床护理中的局限性

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Mouxiao Bian, Zhi Chen, Ruiyao Chen, Lu Lu, Hengrui Liang, Chaoyi Huang, Yiluo Lin, Jingru Ding, Yun Zhong, Yuming Su, Jie Xu ·

    RESPClinBench:呼吸专科护理中的多模态临床决策和纵向疾病管理基准测试

    arXiv:2608.04514v1 Announce Type: new Abstract: Background: Respiratory specialty care requires multimodal interpretation, longitudinal risk assessment, guideline-concordant intervention, and whole-course management, which are poorly represented by examination-oriented medical be…