研究人员开发了一个名为Waldo的新基准测试,用于研究大型语言模型(LLM)如何处理跨语言知识差异。该基准测试由维基百科构建,包含12,000个问答对,这些问答对要么突显一种语言中信息的缺失,要么突显跨语言信息的冲突。当事实缺失时,LLM通常会利用可用语言的证据,但当事实冲突时,模型倾向于偏好查询语言中的来源,导致根据用户的语言得出不同的答案。研究还探讨了缓解策略,包括消融注意力头和使用基于LoRA的训练,这些策略将查询语言偏好差距减少了高达61.5%。 AI
影响 突显了LLM中可能存在的偏见,这些偏见可能会影响不同语言的信息访问和准确性。
排序理由 该集群包含一篇详细介绍新基准测试和研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →