DDXPlus
PulseAugur coverage of DDXPlus — every cluster mentioning DDXPlus across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
贝叶斯逆向推理增强多代理LLM决策能力
研究人员开发了一种新颖的多代理决策方法,采用贝叶斯逆向推理,为评估代理性能提供了无标签锚点。该方法通过为每个实例构建反向后验,与传统的正向推理技术形成对比,旨在减少代理之间的相关错误。提出的策略包括MinJS、FwdJS和LogLin,利用从这种逆向推理中获得的交叉路径一致性来改进集体决策,并在DDXPlus数据集上的各种LLM骨干网络上显示出一致的性能提升。
-
新的MTDiag数据集评估LLM在多轮临床诊断中的表现
研究人员开发了MTDiag,这是一个新的多轮诊断对话数据集,旨在更好地评估大型语言模型(LLM)在临床环境中的表现。与静态基准测试不同,MTDiag通过从DDXPlus、MIMIC-IV和AJCR病例报告中提取数据,模拟了医疗诊断的交互式和渐进式性质。该数据集使用UMLS和ICD-10等医学知识库进行标准化,并包含一个用于生成自然语言语句的管道。该计划旨在评估LLM作为诊断代理的能力,超越简单的准确性,引入临床基础的指标来评估多轮鉴别诊断。
-
新的审计方法评估医疗大语言模型证据使用,超越准确性
研究人员开发了一种新的方法来审计大语言模型(LLMs)在医疗诊断中的证据使用模式。这种方法超越了简单的准确性评估,将患者信息分解为证据单元,并根据受控证据子集对诊断进行评分。该研究在 DDXPlus、CupCase 和 MedCase 等数据集上评估了五个开源大语言模型,发现大多数证据交互是临床上合理的,而非诊断失败。审计发现,无效或捷径式案例通常涉及否定或缺失的发现,这凸显了在医疗大语言模型评估中进行角色感知审计的必要性。