TrOCR
PulseAugur coverage of TrOCR — every cluster mentioning TrOCR across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的合成数据集提升波斯语OCR能力
研究人员推出了Persian Pixel,一个旨在提高波斯语光学字符识别(OCR)能力的大规模合成数据集。该数据集包含超过343,000个图像-文本对,使用SynthOCR-Gen框架生成,以准确模拟波斯语脚本的复杂性,包括连写连接和风格变化。Persian Pixel旨在克服标注数据的稀缺性,从而能够训练TrOCR和Donut等先进的OCR模型,并推动波斯语文档分析的发展。
-
TrOCR 适配中世纪手稿识别,研究发现
研究人员探索了将 TrOCR 模型应用于中世纪手稿的文字识别(HTR)任务,该任务因模型在现代文本上预训练而变得复杂。通过对 13 世纪意大利手稿(I-CT 91 "Cortonese")和 READ-16 基准进行的受控实验,他们研究了对比度归一化、数据增强和层冻结对准确性的影响。研究发现,移除对比度归一化后,字符错误率(CER)为 7.84%,与专用基线相当,并且特定的层冻结策略可以跨数据集转移,但建议进行特定数据集的重新验证。研…
-
Mamba模型提供更快的OCR速度,但在历史文本上准确性落后于Transformer
研究人员对状态空间模型(SSMs),特别是Mamba,与Transformer和BiLSTM在历史报纸的光学字符识别(OCR)方面进行了基准测试。研究表明,虽然Mamba模型提供了显著的计算优势,将推理时间减半并显示出更好的内存扩展性,但与基于Transformer的模型相比,它们在严重退化的文本上的准确性略低。进一步的消融研究表明,Mamba在段落等长序列上的性能高度依赖于超参数调整,并且可能需要大量数据,在真实手写体上落后于Tra…
-
AI代理旨在安全地总结患者出院数据
本文详细介绍了创建AI代理的过程,该代理旨在从PDF文档中总结患者出院信息。该代理专注于提取结构化数据,如诊断、药物和过敏信息,通过避免捏造或猜测来优先考虑准确性和安全性。它采用OCR技术处理手写笔记,并使用LLM进行证据提取,确保信息流向模型的精炼和受控。
-
新数据集BullingerDB面向历史文本识别
研究人员推出了BullingerDB,这是一个用于分析历史手写文档的新型大规模数据集。该数据集源自Heinrich Bullinger的通信,包含来自796位不同作者、跨越六十年的超过20,000页文档和近五十万行文本。它包含多语言内容和用于作者识别及时间分析的元数据,旨在为历史文本识别和作者检索设定新基准。
-
AI管道以88%的准确率转录中世纪法律文本
研究人员开发了一个开源管道,用于转录中世纪英格兰的法律手稿,这些手稿是用高度缩写的拉丁语写成的。该系统使用神经网络进行分割和手写识别,在一个包含4029行的数据集上达到了79%的词语准确率。通过使用n-gram语言模型并让Gemini Pro纠正错误,准确率进一步提高到88%。该管道已集成到一个网络门户中,以使这些历史法律文件更容易获取。