研究人员推出了MEGA-CDP,这是一个旨在评估大型语言模型(LLM)在多大程度上遵循基于既定医疗指南的临床决策路径(CDP)的新基准。与以往主要关注最终答案准确性的基准不同,MEGA-CDP评估模型生成符合指南路径的能力。该基准使用超过2000项临床实践指南创建,并包含一个用于衡量单轮和多轮场景下路径一致性的框架。对16个LLM进行的初步实验表明,为当前模型实现可靠的临床决策支持仍然是一个重大挑战。 AI
影响 该基准可以推动在医疗应用中开发更可靠、更符合指南的LLM。
排序理由 该集群描述了一篇介绍用于评估LLM的新型基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →