研究人员开发了TreeProbe,这是一个旨在评估大型语言模型在传统藏医药方面文化偏见的新基准。该基准围绕本地“医药树”框架组织,包含超过4700个由专家裁定的条目,涵盖疾病和子任务。使用TreeProbe进行的实验显示,当前的LLM在藏医药语境中存在困难,根据其训练数据,倾向于偏向生物医学或中医药的推理。 AI
影响 该基准有望在医疗保健领域,特别是对于代表性不足的医学传统,带来更具文化敏感性和公平性的AI系统。
排序理由 该集群描述了一篇介绍用于评估LLM的基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →