PulseAugur
实时 10:10:26
实体 Google Document AI

Google Document AI

PulseAugur coverage of Google Document AI — every cluster mentioning Google Document AI across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_117795 ·

    新的僧伽罗语 OCR 数据集和模型达到最先进性能

    研究人员开发了一个新的数据集 sinhala-ocr-lk-acts-1010,以改进僧伽罗语的光学字符识别 (OCR)。僧伽罗语是斯里兰卡约 1600 万人使用的语言。该数据集包含 1010 页图像及其转录文本,来源是跨越二十年的斯里兰卡立法法案。实验对包括 DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B 在内的三个深度学习模型进行了微调,结果表明 LightOnOCR-2-1B …

  2. TOOL · CL_125165 ·

    新的僧伽罗语 OCR 数据集和 LightOnOCR-2-1B 达到最先进性能

    研究人员开发了一个新的数据集 sinhala-ocr-lk-acts-1010,以改进僧伽罗语的光学字符识别 (OCR)。僧伽罗语是一种约有 1600 万人使用的语言。该数据集包含来自斯里兰卡立法法案跨越二十年的 1010 个页面级图像和转录文本。通过使用 QLoRA 对 DeepSeek-OCR V1、DeepSeek-OCR V2 和 LightOnOCR-2-1B 等模型进行微调,研究发现 LightOnOCR-2-1B 是表现…

  3. RESEARCH · CL_00834 ·

    在竞技场:LMSys 如何永远改变了 LLM 基准测试

    Hugging Face 开发的 AraGen 基准测试旨在通过解决静态基准测试的局限性来改进 LLM 评估。它引入了一种类似于 LMSys 的 Chatbot Arena 的众包方法,允许进行更动态和用户导向的评估。这种方法旨在捕捉传统指标之外的真实用户偏好和模型性能。此外,一个名为 DharmaOCR 的新的开源 OCR 模型已经发布,与大型商业和开源模型相比表现强劲。