一个名为SHELF的新基准测试系统已被开发出来,用于评估语言模型在与图书馆和档案馆相关的书目任务上的表现。该系统基于美国国会图书馆的词汇表生成合成数据,创建分类、聚类和检索任务。初步测试显示不同方法的表现各异,稀疏方法在分类方面仍具竞争力,而TF-IDF在主题时效性方面被证明是高效的。 AI
影响 为LLM在书目任务中提供了一个新的评估框架,有助于更好地理解模型在图书馆和档案馆环境中的表现。
排序理由 该条目描述了一个新的基准测试系统及相关论文,用于评估语言模型在特定任务上的表现。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →