研究人员推出了 OpenTumorBoard,这是一个旨在评估大型语言模型 (LLM) 在多学科肿瘤委员会讨论背景下能力的新基准。该基准包含 611 个患者病例和超过 19,000 个讨论轮次,来源于公开的 YouTube 录音。它在两种场景下评估 LLM:回应专家的提问,以及模拟整个委员会的讨论以就治疗计划达成共识。对 14 个 LLM 的初步评估显示存在显著局限性,表现最好的模型在临床等效性和与委员会结论的一致性方面仅获得中等分数,表明需要进一步的模型调整。 AI
影响 该基准可以加速能够协助复杂医疗决策制定的 LLM 的开发,从而可能改善癌症治疗计划。
排序理由 该集群描述了一个用于评估 LLM 在专业领域的新的学术基准,并有研究论文及相关代码/数据发布支持。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →