PulseAugur
中
实时 08:31:15
实体 TEI/XML

TEI/XML

PulseAugur coverage of TEI/XML — every cluster mentioning TEI/XML across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_257317 ·

    AI 用户寻求统一的 OCR、嵌入和重排堆栈

    一位 Reddit 用户正在寻求解决方案,以整合目前涉及单独的 OCR、嵌入和重排服务的文档处理工作流。目前的设置使用了 OpenAI 进行嵌入,Cohere 进行重排,以及 Textract 进行 OCR,这导致了多个账单、SDK 和数据传输。该用户正在探索 TEI 与单独的重排器和 docling、Infinity 或 SIE 等选项,并对 SIE 特别感兴趣,因为它有可能通过单个 API 处理所有三个功能并解决数据驻留问题。他们…

  2. TOOL · CL_212172 ·

    新AI模型Phoenix提高了阿拉伯手稿转录的准确性

    研究人员开发了Phoenix,一个拥有499万参数的CNN-BiLSTM-CTC模型,用于转录历史阿拉伯手稿。该模型通过文档感知重放和专门的保护机制适应不同的手稿领域,以在新数据集上保持性能。该系统在大型独立数据集上显著降低了字符错误率(CER),从19.98%提高到14.93%。Phoenix还配备了Athar,一个用于管理不确定读数和保留视觉证据的审查工作流程,并导出可审计的TEI和PAGE-XML记录。

  3. TOOL · CL_59106 ·

    新的视觉语言模型评估方法应对复杂的古希腊文本识别

    研究人员开发了新的资源并评估了现有的视觉语言模型(VLMs),以应对古希腊评注本中复杂的文本识别任务。这些历史文献具有复杂的版式语义、密集的引用层级和大量的页边注释,对当前的VLMs构成了挑战。该研究引入了一个包含185,000张页面图像的合成语料库和一个真实扫描版评注本的基准测试,结果显示在零样本设置下,大多数VLMs的表现不如传统软件。然而,Qwen3VL-8B模型表现出了最先进的性能,在真实扫描版上实现了1.0%的字符错误率,凸…