一项发表在arXiv上的新研究评估了大型语言模型(LLM)从临床注册表数据中提取信息的性能。研究人员发现,与人工提取者相比,LLM在处理未经处理的电子病历数据时准确性显著降低。随着问题所需歧义和临床推理的增加,LLM的准确性明显下降,在药物标记等简单任务上表现最好,在复杂事件时间问题上表现最差。 AI
影响 强调了当前LLM在医疗保健等复杂、高风险领域的局限性,表明需要改进推理和歧义处理能力。
排序理由 该集群包含一篇学术论文,详细介绍了LLM在特定领域性能的研究。[lever_c_demoted from research: ic=1 ai=1.0]
- American College of Cardiology National Cardiovascular Data Registry
- Hugging Face
- large language model
- Medication/Event Flag
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →