Unlimited OCR
PulseAugur coverage of Unlimited OCR — every cluster mentioning Unlimited OCR across labs, papers, and developer communities, ranked by signal.
- 2026-07-30 product_launch Baidu released the open-source Unlimited-OCR model. 来源
- 2026-07-05 product_launch Baidu has launched its "Unlimited OCR" system, capable of processing over 40 pages of documents in a single pass. 来源
- 2026-06-29 product_launch Baidu released and open-sourced its Unlimited OCR model, which has achieved top rankings on GitHub and Hugging Face. 来源
- 2026-06-28 product_launch Baidu has open-sourced its new Unlimited OCR model, which sets a new state-of-the-art for long document processing. 来源
- 2026-06-27 product_launch Baidu released and open-sourced its Unlimited OCR model, which quickly gained traction on platforms like Hugging Face and GitHub. 来源
- 2026-06-23 product_launch Baidu has developed a new technology called Unlimited OCR that enables AI to retain information from long documents after a single viewing. 来源
- 2026-06-19 product_launch Baidu has unveiled Unlimited-OCR, a new model for long-document transcription and parsing. 来源
- 2026-06-19 product_launch Baidu has launched its new Unlimited OCR model, designed for advanced document parsing. 来源
- 2026-06-19 product_launch Baidu has released Unlimited OCR, a new AI model for long-document parsing. 来源
5 天有情绪数据
-
百度发布Unlimited-OCR,支持本地文档处理
百度发布了Unlimited-OCR,一个开源OCR模型,能够一次性处理整篇文档。该模型可以处理多页表格,保留阅读顺序,并以Markdown格式输出。它拥有32K token的上下文窗口,并且可以在本地运行。
-
中国 AI 模型 Kimi K3 和 Unlimited OCR 领跑全球榜单
中国 AI 模型在全球范围内获得显著关注,Kimi K3 和 Unlimited OCR 在 Hugging Face 趋势榜上名列前茅。Kimi K3 在发布后迅速登顶,而百度开发的 Unlimited OCR 则获得了持续的欢迎。Unlimited OCR 的成功归功于其创新的参考滑动窗口注意力(R-SWA)机制,该机制通过管理上下文记忆来高效处理长文档,这一突破解决了 OCR 技术中的一个关键挑战,并为大型模型的长距离推理提供了新方法。
-
百度 Unlimited-OCR 教程详解高分辨率图像和 PDF 解析
本教程演示了如何利用百度的 Unlimited-OCR 模型构建一个端到端的 OCR(光学字符识别)管道。该过程包括设置 GPU 环境、安装 transformers 和 PyTorch 等必需库,以及加载 3B 参数的视觉语言模型。教程涵盖了高分辨率图像处理和多页 PDF 解析,详细介绍了不同的推理模式和输出处理,以获得可复现的结果。
-
寻求用于PDF文本和布局提取的AI模型
一位r/MachineLearning用户正在寻求能够准确提取PDF文本和布局的最新模型推荐。他们已经尝试了包括DocLayout、Docling、MinerU和Marker在内的几种模型,发现虽然Docling表现良好,但它倾向于过度分割内容。MinerU被指出会遗漏关键信息,如通讯作者详细信息和文章类型标签。Unlimited OCR尽管在通用文本提取方面表现强劲,但在样式识别和徽标识别方面存在困难。
-
DharmaOCR 在巴西葡萄牙语 OCR 方面取得卓越性能
DharmaOCR 是一款专为巴西葡萄牙语设计的 OCR 模型,与 Mistral OCR4 和 Unlimited-OCR 等模型相比,其性能表现更优。这种优势源于一个两阶段的训练过程:首先在葡萄牙语数据上进行监督微调以建立领域能力,然后进行直接偏好优化 (DPO) 以提高稳定性和降低推理成本。DPO 阶段教会模型从比较偏好数据中学习,从而提高可靠性并抑制生成模型中常见的故障模式。
-
百度无界OCR采用新颖记忆机制处理40+页文档
百度开发了一个“无界OCR”系统,能够一次性处理超过40页的文档,相比之前一次只能处理约十页的系统有了显著提升。这一进步是通过一种改进的注意力机制实现的,该机制能够保持恒定的内存使用量,而与文档长度无关。该系统还拥有每秒5580个token的处理速度,并且目前在最重要的OCR基准测试中处于领先地位。
-
Grok4.5进入私测,DeepSeek V4将推出新定价,百度OCR模型登顶
埃隆·马斯克宣布Grok4.5正在SpaceX和Tesla进行私密测试,性能可能超越Claude Opus。与此同时,DeepSeek宣布其V4官方版本将于7月中旬推出,并为其API引入峰谷定价机制。百度的Unlimited OCR模型在HuggingFace和GitHub上取得了顶级排名,创下了端到端OCR性能的新纪录。
-
百度OCR模型登顶榜单;马斯克Grok 4.5进入测试阶段;AI成本上升
百度OCR模型OCR能力在HuggingFace和GitHub上均取得榜首排名,创下端到端OCR性能新纪录。另外,埃隆·马斯克宣布Grok 4.5已在SpaceX和Tesla进行内部测试,并计划每月发布新AI模型。与此同时,由于需求增加和计算能力供应有限,AI行业面临成本上升的挑战,尽管Anthropic等一些公司已实现盈利。
-
美国电力行业并购额达2000亿美元创纪录,受人工智能数据中心热潮推动;百度OCR模型开源
美国电力和公用事业部门的并购活动激增,今年前五个月的交易额已超过2000亿美元,这得益于对支持数据中心能源基础设施的需求。这一激增标志着与去年全年相比有了显著增长。与此同时,百度已发布并开源了其Unlimited OCR模型,该模型因其处理长文档的能力,在GitHub和Hugging Face等平台上迅速获得关注。
-
个人开发者本地化AI模型在Hugging Face上人气飙升
个人开发者 yuxinlu1 的两个基于 Gemma 4-12B 的模型在 Hugging Face 上获得了显著关注。这两个模型 V1 (Coder) 和 V2 (agentic) 设计用于本地运行,对显存要求低,使得没有高端硬件的用户也能使用先进的AI能力。V1 专注于编程和推理,在经过验证的代码执行数据上训练;V2 则增加了多步工具调用功能,用于代理任务。开发者 Lu Yuxin 是一名研究生,他将这些模型作为个人项目来提升自己…
-
百度发布Unlimited OCR,挑战长文本AI记忆机制 · 追踪1个来源
百度已开源一款名为Unlimited OCR的新OCR模型,该模型通过模仿人类阅读习惯,在处理长文档方面表现出色。与传统的逐页处理文档然后拼接结果的OCR系统不同,Unlimited OCR采用了新颖的参考滑动窗口注意力(R-SWA)机制。这使其能够在不增加通常随文档长度而增加的内存和计算开销的情况下,保持连续阅读状态,并在OmniDocBench基准测试中达到了新的最先进水平。
-
百度Unlimited OCR模型荣登榜首并迅速普及
百度发布并开源了其端到端OCR模型Unlimited OCR。该模型迅速在GitHub和Hugging Face上取得了顶级排名,在长文档解析方面表现强劲。Unlimited OCR在OmniDocBench v1.6基准测试中以93.92%的综合得分创下新纪录,并已获得快速采用和本地部署。
-
Papers with Code 整合开源 OCR 模型和基准测试
创建了一个新资源来跟踪开源光学字符识别 (OCR) 模型,整合了关于顶级模型、基准测试以及其论文和代码链接的信息。该计划重点介绍了百度最近发布的具有参考滑动窗口注意力机制的 3B 参数 Unlimited OCR 模型,以及可通过 API 获得的 Mistral 的 OCR 4。该平台旨在简化各种应用(如代理 RAG 和 AI 代理的数据摄取)的 OCR 模型选择。
-
百度无界OCR赋予AI处理长文档的类人记忆能力
百度开发了一项名为“无界OCR”的新技术,使AI在单次查看后就能保留长文档中的信息,克服了当前AI能力的一个重大局限。这项进展旨在赋予AI更类人的记忆能力,可能拓展人工智能的未来应用。
-
Unlimited OCR 模型采用新的注意力机制高效处理长文档
研究人员开发了 Unlimited OCR,这是一种新模型,解决了当前 OCR 系统在处理长文档时存在的内存和速度限制。通过用参考滑动窗口注意力 (R-SWA) 替换标准注意力层,该模型保持恒定的 KV 缓存,使其能够在一个前向传播中转录数十页。这种方法建立在 DeepSeek OCR 基线的基础上,也适用于 ASR 和翻译等其他序列任务。
-
百度发布Unlimited OCR,具有恒定的KV缓存用于长文档
百度发布了Unlimited OCR,这是一个30亿参数的混合专家模型,专为高效的长文档解析而设计。该模型利用参考滑动窗口注意力(R-SWA)来保持恒定的KV缓存,克服了传统OCR模型在处理长输出时面临的内存和速度限制。这项创新使得Unlimited OCR能够在一个前向传播中处理数十页文档,并在OmniDocBench v1.5等基准测试中取得了最先进的性能。