一个名为SWORD的新基准已被开发出来,用于评估大型语言模型(LLM)在不同语言中拒绝事实错误的能力。SWORD使用源自Wikidata的失真来创建事实错误的陈述,揭示了模型在处理语义上合理的错误时比处理随机错误时表现更好。该基准还突显了LLM在处理东亚语言与其他语言相比时存在显著的性能差异,准确率下降高达28个百分点。 AI
影响 突出了LLM事实推理中关键的跨语言弱点,表明当前的基准可能掩盖了真正的理解。
排序理由 该集群包含一篇介绍LLM评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →