一项名为OpenMTB-Audit的新开源基准已被开发出来,用于评估大型语言模型(LLM)在分子肿瘤委员会(MTB)工作流程中的安全性。该基准包含500个合成的非小细胞肺癌病例,揭示出当前的LLM存在显著的过度拒绝问题,未能正确识别部分支持的治疗建议。为解决此问题,创建了一个名为MTB-AuditAgent的框架,该框架将过度拒绝率降低至6.7%,并在安全性分类方面达到91.2%的准确率。 AI
影响 凸显了LLM在医疗应用中的关键安全局限性,需要专门的框架来实现可靠的临床决策支持。
排序理由 该集群包含一篇学术论文,详细介绍了用于评估特定领域LLM安全性的新基准和框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →