一项新近发表在arXiv上的研究评估了16种大型语言模型(LLMs)与60名执业中医师的表现。在医疗建议和诊断任务等领域,LLMs的表现优于人类医师,在中医专家评估中得分更高。然而,模型在处方准确性方面存在局限,包括药材选择和剂量,并产生了幻觉和模板化回复等令人担忧的输出,因此需要医师的监督。 AI
影响 大型语言模型在专业医疗领域的决策支持方面展现出潜力,但出于安全性和准确性考虑,需要人工监督。
排序理由 该集群包含一篇评估大型语言模型在特定领域表现的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →