一个新的基准 VialectBench 被开发出来,用于评估大型语言模型 (LLMs) 对越南语方言的鲁棒性。该基准包含跨越六个方言组的 2,400 个方言改写,用于情感识别、自然语言推理和问答等任务。结果表明,方言输入平均会降低 LLM 性能 2.82%,没有模型表现出完全的方言不变性。特别是中部地区的特定方言会导致性能显著下降和有害翻转率更高,这凸显了标准越南语性能与真实世界方言使用之间的差距。 AI
影响 强调了 LLM 训练和评估需要考虑标准形式以外的语言多样性。
排序理由 学术论文,介绍了一个用于 LLM 评估的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →