一篇新的arXiv论文调查了开放式大语言模型(LLMs)中英语和孟加拉语之间性能差异的原因。研究人员开发了一个一致的流程将8个英语基准测试翻译成孟加拉语,并评估了10个开放式大语言模型。研究发现,脚本碎片化(分词器将孟加拉语的字母音节分解成更小的部分)和评估格式遵循是导致性能差距的因素。虽然孟加拉语文本比英语消耗更多的token,但这种成本和序列长度与模型得分仅显示出弱相关性。 AI
影响 凸显了大语言模型评估中潜在的偏见以及多语言模型性能的挑战。
排序理由 关于大语言模型性能评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →