一种名为多语言干扰(MDI)的新评估协议已被开发出来,用于评估大型语言模型如何处理包含不相关外语句子的提示。当在 Llama-3.1-8B 模型上使用印地语干扰进行测试时,该模型经常切换到梵文书写系统,尽管在精确匹配评分中这看起来像是幻觉,但通常保留了语义的正确性。其他模型在面对这种多语言干扰时倾向于不作答。该研究强调了在评估多语言大型语言模型可靠性时,区分脚本切换和语义错误的重要性,尤其是在检索增强生成等应用中。 AI
影响 突出了 RAG 等多语言大型语言模型应用中潜在的可靠性问题,并建议需要更细致的评估指标。
排序理由 介绍大型语言模型新评估方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Devanagari
- Hindi
- Llama-3.1-8B
- Multilingual Distractor Interference
- retrieval-augmented generation
- TriviaQA
- TruthfulQA
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →