研究人员开发了SEER-Bench,这是一个用于评估大型语言模型更新医学知识能力的新基准。该基准使用肿瘤分期数据和NCCN指南,在匹配的训练预算下测试模型。结果表明,“EMQ”监督格式对于稳定的知识更新和保留最有效,优于MSQ、FITB和SAQ等其他格式。使用EMQ监督训练的4B模型在时间锚定的肿瘤分期任务上取得了具有竞争力的准确性。 AI
影响 这项研究可能通过改进训练新临床信息的方式,从而实现更可靠的医学LLM。
排序理由 该集群是关于一篇介绍特定领域LLM评估基准和方法学的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →