研究人员开发了 PrinciplismQA,这是一个旨在评估大型语言模型(LLMs)在临床医学背景下伦理推理能力的新基准。该方法将其评估建立在已建立的哲学框架,特别是原则主义之上,并包含超过 3,600 个专家验证的问题。使用 PrinciplismQA 进行的初步评估显示,当前的大型语言模型存在显著的伦理推理差距,即使是在基于知识的任务上准确率很高,这也表明仅进行知识训练并不能保证在临床决策中的伦理一致性。 AI
影响 强调了对临床人工智能进行专门伦理评估的必要性,表明当前的大型语言模型可能尚未准备好部署到敏感的医疗决策中。
排序理由 该集群描述了一篇介绍用于评估大型语言模型伦理推理的新基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →