研究人员开发了SHELF(Synthetic Harness for Evaluating LLM Fitness),一个用于评估LLM适应性的合成工具包,旨在为图书馆和档案馆进行书目任务的基准测试。该Python系统从标记的分类法和写作规范中生成受控的基准测试数据。首个版本包含基于美国国会图书馆词汇表的超过62,000份模型编写的文档,任务包括分类、聚类和检索。虽然主题分类得分达到0.8887,但体裁形式分类得分显著较低,为0.2605,部分任务表现接近随机。该项目旨在为管理大型馆藏的方法评估提供资源,并已在GitHub和Hugging Face上发布了其代码和数据。 AI
影响 为LLM在书目任务中提供了一个新的评估框架,有可能提高AI在图书馆和档案馆管理中的实用性。
排序理由 该集群描述了一篇介绍基准测试和相关系统的学术论文。
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →