PulseAugur
实时 09:17:53
English(EN) BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval

新数据集BullingerDB面向历史文本识别

研究人员推出了BullingerDB,这是一个用于分析历史手写文档的新型大规模数据集。该数据集源自Heinrich Bullinger的通信,包含来自796位不同作者、跨越六十年的超过20,000页文档和近五十万行文本。它包含多语言内容和用于作者识别及时间分析的元数据,旨在为历史文本识别和作者检索设定新基准。 AI

影响 为历史文档分析树立了新基准,有望推动OCR和作者识别技术的发展。

排序理由 该集群描述了一个新的学术数据集及其在现有模型上的评估,符合研究类别。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新数据集BullingerDB面向历史文本识别

报道来源 [2]

  1. arXiv cs.CV TIER_1 English(EN) · Marco Peer, Anna-Scius Bertrand, Patricia Scheurer, Andreas Fischer ·

    BullingerDB:手写文本识别和作者检索数据集

    arXiv:2605.30235v1 Announce Type: new Abstract: We present BullingerDB, a large-scale benchmark dataset for historical document analysis based on the correspondence of Heinrich Bullinger (1504-1575). The corpus comprises 20,898 pages and 499,222 text lines written by 796 writers …

  2. arXiv cs.CV TIER_1 English(EN) · Andreas Fischer ·

    BullingerDB:手写文本识别和作者检索数据集

    We present BullingerDB, a large-scale benchmark dataset for historical document analysis based on the correspondence of Heinrich Bullinger (1504-1575). The corpus comprises 20,898 pages and 499,222 text lines written by 796 writers over six decades, featuring stylistic variation,…