一项新的基准研究评估了大型语言模型(LLMs)在临床分诊场景中的可靠性,并将其建议与执业医师的建议进行了比较。研究发现,大型语言模型更容易建议不必要的治疗,并且当临床文本受到干扰时,这种倾向会加剧。此外,与人类医生相比,大型语言模型的建议对性别和语气变化等不相关文本变化的敏感性更高。这些发现强调了在临床环境中部署大型语言模型之前,需要进行基于专家医生行为并考虑现实世界变化的评估。 AI
影响 强调了在医疗保健领域部署大型语言模型的潜在风险,并强调了进行稳健、专家验证的评估的必要性。
排序理由 学术论文,提出了一个新的基准和关于大型语言模型在特定领域表现的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →