PulseAugur
中
实时 02:23:26
实体 PureDocBench

PureDocBench

PulseAugur coverage of PureDocBench — every cluster mentioning PureDocBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_260591 ·

    腾讯发布基于 Qwen3-VL 模型微调的 WeVisDoc 文档解析器

    腾讯发布了 WeVisDoc,这是一款专为页面图像设计的端到端文档解析器。该模型基于 Qwen3-VL-2B-Instruct 和 Qwen3-VL-4B-Instruct 微调而来,可将页面图像转换为结构化 Markdown,包括 LaTeX 公式和 HTML 表格。WeVisDoc-4B 在 OmniDocBench 和 PureDocBench 等基准测试中表现出色,在多种场景下优于其他端到端解析器。

  2. TOOL · CL_261209 ·

    WeVisDoc框架提升文档解析准确性

    研究人员推出WeVisDoc,一个旨在增强端到端文档解析模型鲁棒性的新颖两阶段框架。第一阶段拓宽了模型在各种语义、结构和外观类型上的覆盖范围,第二阶段则使用诊断探针来识别和纠正残留错误。这种方法使WeVisDoc-4B在OmniDocBench v1.6和PureDocBench上取得了最高分,优于其他端到端解析器,并在退化文档轨道上显示出显著改进。

  3. TOOL · CL_200034 ·

    NaviDC-OCR框架通过变形感知学习增强文档解析

    研究人员推出NaviDC-OCR,一个旨在增强数字和摄像头捕获文档解析的新框架。该系统通过引入变形感知学习来更好地处理几何失真,并采用自适应采样机制来处理复杂布局,从而解决了现有方法的局限性。NaviDC-OCR还采用内容-结构解耦学习策略来显式建模公式和表格,从而改进了结构化表示。该框架在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench等多个基准测试中展示了最先进的性能,并在ICDAR…

  4. TOOL · CL_205662 ·

    NaviDC-OCR框架通过变形感知学习增强文档解析

    NaviDC-OCR是一个新的视觉语言框架,旨在通过解决处理变形的相机捕获文档的挑战和增强结构推理来改进文档解析。该框架结合了变形感知学习、自适应布局采样和内容-结构解耦的训练策略。实验表明,NaviDC-OCR在包括OmniDocBench v1.6和Wild-OmniDocBench在内的多个基准测试中取得了最先进的结果,并在ICDAR 2026 Sci-ImageMiner挑战赛中获得第一名。

  5. RESEARCH · CL_145635 ·

    OvisOCR2 文档解析模型在基准测试中达到最先进水平 · 跟踪到 3 个来源

    研究人员推出 OvisOCR2,这是一款新的 0.8 亿参数文档解析模型,能够以自然阅读顺序生成文档的 Markdown 表示,包括文本、公式和表格。该模型结合了监督微调、强化学习、蒸馏和模型融合进行训练。OvisOCR2 在 OmniDocBench v1.6 和 PureDocBench 基准测试中取得了最先进的成果,优于之前的流水线方法,并在具有挑战性的场景中展现出强大的泛化能力。

  6. TOOL · CL_140498 ·

    OvisOCR2:新的0.8B OCR模型将文档转换为结构化Markdown

    OvisOCR2是一个新的0.8B参数端到端OCR模型,可将整页文档转换为结构化Markdown。基于Qwen3.5-0.8B,据报道它在OmniDocBench和PureDocBench等文档理解基准测试中取得了高分。该模型可在Apache 2.0许可下使用,并支持vLLM,但与其他OCR模型的实际性能比较仍在进行中。

  7. TOOL · CL_26975 ·

    新的PureDocBench基准揭示文档解析远未解决

    研究人员推出了PureDocBench,一个用于文档解析的新基准,它解决了现有OmniDocBench数据集存在的问题,该数据集存在标注错误和潜在的污染。PureDocBench是程序化生成且可追溯源的,在干净、数字降级和真实世界文档场景中提供了更可靠的评估。对40个模型的初步评估显示,文档解析远未解决,模型之间存在显著的性能差距,并且公式识别存在共同的瓶颈。