一个名为RESPClinBench的新基准已被开发出来,用于评估大型语言模型在呼吸专科护理中的临床决策和纵向疾病管理能力。该基准结合了胸部CT扫描和临床信息,用于评估七个LLM。Qwen3.6-27B和Qwen3.5-397B-A17B模型表现强劲,但评估也突显了模型响应中成像幻觉和医疗错误的重大风险。 AI
影响 强调了当前LLM在专业医疗应用中的局限性和风险,指导未来模型的开发和验证。
排序理由 该集群描述了一个用于评估特定医疗领域LLM的新学术基准。
在 Hugging Face Daily Papers 阅读 →
- AECOPD-PIM
- chronic obstructive pulmonary disease
- computed tomography
- Hugging Face
- PNBIM
- Qwen3.5-397B-A17B
- Qwen3.6-27B
- RESPClinBench
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →