研究人员开发了机构报纸管道(Institutional Newspapers Pipeline),这是一个模块化系统,旨在从历史报纸扫描件中提取高质量、结构化数据。该管道与波士顿公共图书馆合作开发,对扫描件进行分段,执行光学字符识别(OCR),然后分析文本的各种特征,如命名实体和主题分类。由此产生的开放数据集包含来自近150万份1795年至1930年间出版的报纸扫描件的超过160亿个词元,使得历史公共生活记录在计算上更易于访问。 AI
影响 通过使海量文本档案在计算上易于访问,从而能够进行新形式的历史研究和数据分析。
排序理由 该项目描述了一篇研究论文,其中详细介绍了一种处理历史文件的新方法和数据集。[lever_c_demoted from research: ic=1 ai=0.7]
在 Hugging Face Daily Papers 阅读 →
- Boston Public Library
- Harvard Law Library
- Institutional Data Initiative
- Institutional Newspapers Pipeline
- o200k_base
- optical character recognition
- Tesseract
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →