一个名为 MÖVE 的新评估框架已被开发出来,用于评估德国公共部门的大型语言模型(LLMs)。与侧重于英语和美国背景的现有基准不同,MÖVE 考虑了能耗、提供商透明度以及对德国政党立场的了解。初步研究结果表明,模型之间存在显著的权衡,没有一个 LLM 在所有评估维度上表现最佳。能耗差异很大,并且不完全取决于模型大小,信息披露因提供商而异,欧洲模型在了解德国政党立场方面并未表现出优势。 AI
影响 该框架可以指导公共部门组织选择更具情境适应性和责任感的大型语言模型,超越简单的性能指标。
排序理由 该项目是一篇研究论文,提出了一个新的大型语言模型评估框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →