对三个大型语言模型(LLMs)在临床护理管理任务中的基准测试揭示了重大的安全隐患。尽管 Gemini 3.7 Flash、Gemma 4 31B 和 GPT-5.4 Mini 在药物安全审查和分诊优先排序方面表现完美,但它们在生成护理计划时都未能包含关键要素。值得注意的是,所有模型都忽略了指南推荐的针对心肌梗死后患者的抑郁筛查,这表明尽管生成了流畅且权威的护理计划,但在社会心理因素方面存在严重的盲点。 AI
影响 突显了当前医疗保健领域大型语言模型存在的关键安全漏洞,表明流畅性不等于临床安全性,需要进行专门评估。
排序理由 该项目详细介绍了一个用于评估大型语言模型在特定领域(临床护理管理)的新基准,并报告了其性能和局限性。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →