一项最新研究评估了GPT-4o、Llama 3和Command R+等大型语言模型(LLMs)在医疗环境中的社会沟通能力。研究人员发现,尽管这些模型表现出无敌意,但在信息组织结构方面表现不佳,在敏感性和非侵入性方面结果好坏参半。研究结果表明,当前的大型语言模型缺乏作为医疗顾问安全有效使用所必需的一致可靠的社交技能,因此需要调整现有的人机交互评估框架。 AI
影响 在能够安全部署于面向患者的医疗岗位之前,大型语言模型需要在社交和沟通技能方面进行大量开发。
排序理由 该集群包含一篇评估大型语言模型在特定领域能力的论文,以及一篇讨论该领域AI测试方法的博客文章。
- Command R+
- GPT-4o
- health care
- HELP-Med dataset
- IC-MD instrument
- large-language models
- Llama 3
- conversational AI
- Dr. Harry Cruz
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →