研究人员开发了BavGround,这是一个旨在评估大型语言模型(LLM)在巴伐利亚地区的文化基础和方言能力的新基准。该基准包含618个多并行实例,涵盖英语、德语和巴伐利亚语,涉及一般文化知识和本地化信息。对十五个7B-10B开源模型和一个闭源模型的评估显示,尽管强大的多语言模型表现最佳,但它们在巴伐利亚方言和基于来源的问题上遇到困难。研究还强调了不同的评估协议如何显著影响模型排名和性能结论。 AI
影响 该基准可能导致对LLM进行更细致的评估,特别是针对代表性不足的地区方言和文化。
排序理由 该集群描述了一个用于评估LLM的新学术基准,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →