PulseAugur
实时 08:22:13
English(EN) CARE-Bench: Benchmarking Patient-Facing LLM Triage

新基准显示语言模型在患者分诊准确性方面存在困难

一个名为 CARE-Bench 的新基准已被开发出来,用于评估大型语言模型 (LLM) 在面向患者的医疗分诊场景中的安全性和有效性。该基准包含 500 个病例和 1,000 多个评估的对话前缀,评估模型推荐患者下一步适当行动的程度。对 11 种不同 LLM 的评估表明,即使经过提示,模型在准确性方面也存在困难,经常过早推荐护理或未能收集必要的澄清信息。 AI

影响 凸显了语言模型在医疗保健领域中关键的安全问题,表明当前模型尚未准备好进行无监督的患者分诊。

排序理由 该集群描述了一篇介绍用于评估语言模型性能的基准的新学术论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准显示语言模型在患者分诊准确性方面存在困难

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yining Hua, Hongbin Na, Cyrus Ayubcha ·

    CARE-Bench:面向患者的LLM分诊基准测试

    arXiv:2608.03731v1 Announce Type: new Abstract: Patient-facing medical LLMs and agents increasingly answer symptom questions before clinician contact, where the key safety question is what action the user should take next. We introduce CARE-Bench, a source-grounded benchmark that…