实体
LCSHBench
LCSHBench
PulseAugur coverage of LCSHBench — every cluster mentioning LCSHBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新的SHELF基准测试LLM在图书馆书目任务上的表现
一个名为SHELF的新基准测试系统已被开发出来,用于评估语言模型在与图书馆和档案馆相关的书目任务上的表现。该系统基于美国国会图书馆的词汇表生成合成数据,创建分类、聚类和检索任务。初步测试显示不同方法的表现各异,稀疏方法在分类方面仍具竞争力,而TF-IDF在主题时效性方面被证明是高效的。
-
新的SHELF基准测试LLM在图书馆书目任务上的表现 · 跟踪2个来源
研究人员开发了SHELF(Synthetic Harness for Evaluating LLM Fitness),一个用于评估LLM适应性的合成工具包,旨在为图书馆和档案馆进行书目任务的基准测试。该Python系统从标记的分类法和写作规范中生成受控的基准测试数据。首个版本包含基于美国国会图书馆词汇表的超过62,000份模型编写的文档,任务包括分类、聚类和检索。虽然主题分类得分达到0.8887,但体裁形式分类得分显著较低,为0.26…
-
新基准评估多语言国会图书馆主题词分配
研究人员推出了LCSHBench,这是一个新的基准数据集,旨在评估国会图书馆主题词(LCSH)的自动化主题分类。该数据集包含15种语言的22,346本书籍,来源于哈佛大学、哥伦比亚大学和普林斯顿大学的目录,并且仅当至少有两个机构就LCSH分配达成一致时才选择记录。LCSHBench同时考虑了精确匹配和概念匹配,解决了图书馆在主题上一致但在精确标题表达上存在差异的常见问题。