研究人员开发了一个名为 Enriched Text 的新管道,用于处理和注释大型机构图书收藏(如哈佛大学图书馆的 IB-HL)的 OCR 文本。该方法旨在解决现有管道过度过滤和去重文本、丢失宝贵元数据的局限性。Enriched Text 在保留元数据的同时通过注释进行文本规范化,允许用户根据特定需求定制数据处理。该系统分离尾部内容、检测段落级语言、识别重复内容并计算文本质量分数,使机器解析和人类研究都能更方便地访问该收藏。 AI
影响 通过提供更灵活且保留元数据的处理管道,增强了大型数字化图书收藏在人工智能研究中的可用性。
排序理由 该项目描述了一个用于学术研究的新开源管道和处理后的数据集。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →