PulseAugur
实时 09:19:39
实体 CARE-Bench

CARE-Bench

PulseAugur coverage of CARE-Bench — every cluster mentioning CARE-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_183083 ·

    新基准显示语言模型在患者分诊准确性方面存在困难

    一个名为 CARE-Bench 的新基准已被开发出来,用于评估大型语言模型 (LLM) 在面向患者的医疗分诊场景中的安全性和有效性。该基准包含 500 个病例和 1,000 多个评估的对话前缀,评估模型推荐患者下一步适当行动的程度。对 11 种不同 LLM 的评估表明,即使经过提示,模型在准确性方面也存在困难,经常过早推荐护理或未能收集必要的澄清信息。