一个名为MORFES的新基准已被开发出来,用于评估语言模型在现代希腊语中的屈折能力。该基准包含500个专家验证的项目,旨在测试希腊语屈折形式的识别和生成能力,重点关注低频词条,以评估基于规则的理解而非记忆。包括LLaMA、Qwen3、DeepSeek-R1、Magistral和Kimi K2在内的几款开源语言模型在MORFES上进行了评估,这凸显了开源生态系统中日益增长的多语言能力,但也表明了对形态丰富语言的语法能力测量不足。Sophea-Genesis-1,一个开源模型,在屈折形态学方面表现领先,同时保持了与同等规模模型相当的通用能力。 AI
影响 该基准测试有望推动多语言大型语言模型在形态丰富语言方面的能力提升。
排序理由 该集群描述了一个用于评估语言模型在特定语言任务上性能的新学术基准。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →