一个名为 CARE-Bench 的新基准已被开发出来,用于评估大型语言模型 (LLM) 在面向患者的医疗分诊场景中的安全性和有效性。该基准包含 500 个病例和 1,000 多个评估的对话前缀,评估模型推荐患者下一步适当行动的程度。对 11 种不同 LLM 的评估表明,即使经过提示,模型在准确性方面也存在困难,经常过早推荐护理或未能收集必要的澄清信息。 AI
影响 凸显了语言模型在医疗保健领域中关键的安全问题,表明当前模型尚未准备好进行无监督的患者分诊。
排序理由 该集群描述了一篇介绍用于评估语言模型性能的基准的新学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →