OmniDocBench v1.6
PulseAugur coverage of OmniDocBench v1.6 — every cluster mentioning OmniDocBench v1.6 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
WeVisDoc框架提升文档解析准确性
研究人员推出WeVisDoc,一个旨在增强端到端文档解析模型鲁棒性的新颖两阶段框架。第一阶段拓宽了模型在各种语义、结构和外观类型上的覆盖范围,第二阶段则使用诊断探针来识别和纠正残留错误。这种方法使WeVisDoc-4B在OmniDocBench v1.6和PureDocBench上取得了最高分,优于其他端到端解析器,并在退化文档轨道上显示出显著改进。
-
Jina-OCR-v1 模型可在低预算 GPU 上实现高效文档解析
研究人员推出 Jina-OCR-v1,这是一款专为在低预算 GPU 上高效运行而设计的新型文档解析模型。该模型集成了 DeepSeek-OCR 架构和 FastMTP 推测解码头,该解码头递归共享草稿块以加速预测。Jina-OCR-v1 在 OmniDocBench v1.6 和 olmOCR-Bench 等基准测试中取得了高分,并在 NVIDIA L4 等硬件上展示了比传统解码方法显著的速度提升。该模型的训练涉及指令对齐、鲁棒性微调…
-
NaviDC-OCR框架通过变形感知学习增强文档解析
研究人员推出NaviDC-OCR,一个旨在增强数字和摄像头捕获文档解析的新框架。该系统通过引入变形感知学习来更好地处理几何失真,并采用自适应采样机制来处理复杂布局,从而解决了现有方法的局限性。NaviDC-OCR还采用内容-结构解耦学习策略来显式建模公式和表格,从而改进了结构化表示。该框架在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench等多个基准测试中展示了最先进的性能,并在ICDAR…
-
NaviDC-OCR框架通过变形感知学习增强文档解析
NaviDC-OCR是一个新的视觉语言框架,旨在通过解决处理变形的相机捕获文档的挑战和增强结构推理来改进文档解析。该框架结合了变形感知学习、自适应布局采样和内容-结构解耦的训练策略。实验表明,NaviDC-OCR在包括OmniDocBench v1.6和Wild-OmniDocBench在内的多个基准测试中取得了最先进的结果,并在ICDAR 2026 Sci-ImageMiner挑战赛中获得第一名。
-
PaddlePaddle发布HPD-Parsing模型,创纪录吞吐量 · 跟踪2个来源
PaddlePaddle发布了HPD-Parsing,这是一款利用分层并行解码范式的新型轻量级文档解析模型。该模型在OmniDocBench v1.6基准测试中取得了94.91%的新SOTA分数,并拥有4,752 TPS的峰值吞吐量。HPD-Parsing模型旨在通过协调全局文档结构并将局部内容生成分派到并发分支来克服传统解析器的顺序瓶颈,从而显著提高推理效率。
-
OvisOCR2 文档解析模型在基准测试中达到最先进水平 · 跟踪到 3 个来源
研究人员推出 OvisOCR2,这是一款新的 0.8 亿参数文档解析模型,能够以自然阅读顺序生成文档的 Markdown 表示,包括文本、公式和表格。该模型结合了监督微调、强化学习、蒸馏和模型融合进行训练。OvisOCR2 在 OmniDocBench v1.6 和 PureDocBench 基准测试中取得了最先进的成果,优于之前的流水线方法,并在具有挑战性的场景中展现出强大的泛化能力。
-
OvisOCR2:新的0.8B OCR模型将文档转换为结构化Markdown
OvisOCR2是一个新的0.8B参数端到端OCR模型,可将整页文档转换为结构化Markdown。基于Qwen3.5-0.8B,据报道它在OmniDocBench和PureDocBench等文档理解基准测试中取得了高分。该模型可在Apache 2.0许可下使用,并支持vLLM,但与其他OCR模型的实际性能比较仍在进行中。
-
HunyuanOCR-1.5通过更快的推理和增强的功能提升轻量级OCR VLM · 跟踪3个来源
研究人员推出了HunyuanOCR-1.5,这是一款专为光学字符识别(OCR)设计的增强型轻量级视觉语言模型。该模型将各种文档处理任务,包括解析、文本检测和信息提取,统一到一个端到端的系统中。HunyuanOCR-1.5通过DFlash适配实现了更快的解码,提高了效率,显著加快了Transformer推理和vLLM的性能。其能力通过Agentic Data Flow得到进一步增强,这是一个由代理驱动的系统,可以提高在古籍OCR和细粒度…
-
美国电力行业并购额达2000亿美元创纪录,受人工智能数据中心热潮推动;百度OCR模型开源
美国电力和公用事业部门的并购活动激增,今年前五个月的交易额已超过2000亿美元,这得益于对支持数据中心能源基础设施的需求。这一激增标志着与去年全年相比有了显著增长。与此同时,百度已发布并开源了其Unlimited OCR模型,该模型因其处理长文档的能力,在GitHub和Hugging Face等平台上迅速获得关注。
-
百度Unlimited OCR模型荣登榜首并迅速普及
百度发布并开源了其端到端OCR模型Unlimited OCR。该模型迅速在GitHub和Hugging Face上取得了顶级排名,在长文档解析方面表现强劲。Unlimited OCR在OmniDocBench v1.6基准测试中以93.92%的综合得分创下新纪录,并已获得快速采用和本地部署。
-
百度PaddleOCR-VL-1.6刷新文档解析SOTA
百度文心发布了其开源OCR工具的新版本PaddleOCR-VL-1.6。此次更新在OmniDocBench v1.6基准测试中实现了超过96.33%的准确率,超越了Gemini-3-Pro和GPT-5.2等主流模型。该模型在理解扫描件、弯曲文档和屏幕截图等复杂文档方面表现出显著的改进,使其成为文档数字化的领先解决方案。
-
新基准和模型推动文档解析和表格提取发展
研究人员推出了新的基准和改进的模型,用于文档解析和表格提取。Dr. DocBench 专注于专家级别的文档解析,包括化学式和音乐符号等复杂结构,突出了当前模型的局限性。DTBench 提供了一个用于文档到表格提取的合成基准,评估 LLM 的推理和冲突解决能力。此外,PaddleOCR-VL-1.6 通过区域感知优化和渐进式后训练得到了增强,在 OmniDocBench v1.6 上取得了最先进的结果。
-
PaddleOCR-VL-1.6 在文档解析领域创下新的SOTA记录
PaddlePaddle 发布了 PaddleOCR-VL-1.6,这是一款先进的文档解析模型,在包括 OmniDocBench v1.6 在内的多个基准测试中达到了最先进的准确率,得分为 96.33%。新版本采用了一个区域感知数据优化框架和一个渐进式训练后策略,以提高性能,特别是在识别表格、古籍和罕见字符方面。该模型架构与其前身 PaddleOCR-VL-1.5 保持兼容,便于集成。