研究人员开发了 CHARM,这是一个新的基准测试,旨在评估大型语言模型 (LLM) 在角色扮演场景中对角色知识边界的遵循程度。该基准包含 40 个来自不同文化背景的角色,区分了模型对超出范围查询的认知能力以及其避免回答这些查询的能力。评估表明,LLM 主要失败于在识别到查询不当时提供事实性的、不符合角色的回答,这种现象通常与参数覆盖有关,即模型拥有正确信息但无法抑制它。研究还注意到这些失败在文化上的差异,表明模型知识中嵌入不同文化表征的方式存在偏见。 AI
影响 该基准通过识别和解决特定的失败模式,有望促使 LLM 在角色扮演方面更加健壮和具有文化敏感性。
排序理由 该集群包含一篇详细介绍评估 LLM 能力的新基准的研究论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →