研究人员推出了RESPClinBench,这是一个旨在评估大型语言模型(LLM)在处理复杂的呼吸科临床决策和纵向疾病管理能力的新基准。该基准包括慢性阻塞性肺疾病急性加重(AECOPD-PIM)和肺结节评估(PNBIM)的病例,并用于测试七个LLM。Qwen模型表现最佳,其中Qwen3.6-27B在总体和AECOPD-PIM方面领先,而Qwen3.5-397B-A17B在PNBIM类别中名列前茅。评估还突出了模型响应中成像幻觉和医疗风险的重大问题,强调了临床基础验证的必要性。 AI
影响 凸显了LLM在专业医疗应用中的关键安全性和准确性差距,指导了未来模型的开发和验证。
排序理由 该集群在一篇学术论文中描述了一个新的基准测试以及对LLM在临床任务上的评估。[lever_c_demoted from research: ic=1 ai=1.0]
- AECOPD-PIM
- chronic obstructive pulmonary disease
- computed tomography
- Hugging Face
- PNBIM
- Qwen3.5-397B-A17B
- Qwen3.6-27B
- RESPClinBench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →