PulseAugur
中
实时 07:38:44
实体 optical character recognition

optical character recognition

PulseAugur coverage of optical character recognition — every cluster mentioning optical character recognition across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
118
90 天内 118
发布 · 30天
0
90 天内 0
论文 · 30天
68
90 天内 68
层级分布 · 90 天
主题
关系
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/7 页 · 共 128 条
  1. RESEARCH · CL_280076 ·

    新研究解决生成式AI内容摄取和推理计算问题

    两篇新的arXiv论文解决了生成式AI部署的关键方面。第一篇论文《面向生成式AI工作负载的智能内容摄取》介绍了一个生产级系统,用于从各种企业文档格式中提取和构建信息,旨在提高下游检索和推理的可靠性。第二篇论文《评估生成式AI的推理计算:企业工作负载的框架》提出了一个评估推理硬件性能和成本效益的框架,特别针对优先考虑每令牌解码延迟和可靠性的代理AI轨迹。一篇相关文章讨论了移动应用中生成式AI的用户期望功能,强调了诸如改进搜索、带来源的可…

  2. RESEARCH · CL_275431 ·

    新的OCR方法提高了手写孟加拉语文本的识别率 · 跟踪2个来源

    研究人员开发了专门针对手写孟加拉语文本的光学字符识别(OCR)新方法。一项研究侧重于使用SSD与MobileNetV2以及Faster R-CNN与InceptionResNetV2等深度学习模型进行单词识别,使用集成模型达到了92.61%的F1分数。第二项研究解决了从转录的孟加拉语段落中进行与颜色无关的单词分割问题,报告了91.20%的F1分数,并强调了其在智能手机拍摄图像上的适用性。

  3. TOOL · CL_273770 ·

    Olud Pulse追踪各类别开源AI工具的采用情况 · 追踪6个来源

    Olud Pulse每日采用率得分追踪开源AI工具,使用GitHub、Docker、PyPI和npm的数据。近期报告突出了各个类别中的表现最佳者,包括低代码AI构建器中的Dify(79/100),编码助手中的OpenCode(99/100),以及AI/ML教育中的Generative AI for Beginners(93/100)。ComfyUI在AI图像生成领域领先(94/100),Unsloth在微调方面表现出色(71/100)…

  4. RESEARCH · CL_273409 ·

    EVICALC 系统在 DocSem 任务中准确率达 8.61%,凸显 OCR 挑战

    一个名为 EVICALC 的系统,专为 DocSem 共享任务设计,在 1,730 个任务上实现了 8.61% 的联合准确率。该系统通过选择段落来处理 PDF,使用语言模型生成算术表达式,然后在本地评估这些表达式。一个单独的公开验证运行获得了更高的分数,准确率为 92.17%,证据 F1 为 1.00,尽管由于配置不同,这些指标不能直接比较。分析显示,光学字符识别错误(如合并文本块)等问题可能导致系统从不相关的内容中回答。

  5. TOOL · CL_277020 ·

    Jev 决策模型为边缘编排提供比 LLM 更快的替代方案

    一项新的研究论文提出,在低延迟边缘服务编排中使用 Jev 决策模型替代大型语言模型(LLM)。研究发现,与最快的 LLM 相比,Jev 决策模型可将中位数决策延迟降低 22.7-64.5%,同时保持高比例的精确和准时请求。这种替代方法对于有界合同和延迟敏感型应用尤其有效,尽管其优势会随着合同范围的扩大或缓存的大量使用而减弱。

  6. TOOL · CL_259224 ·

    新方法解析视觉语言模型如何通过 OCR 头部阐述图像语义

    研究人员开发了一种方法来理解视觉语言模型(VLMs)如何处理图像语义,特别关注其光学字符识别(OCR)能力。通过识别 Qwen3-VL-8B 等模型中的特定注意力头部,他们发现这些头部对于 OCR 至关重要,并且还能从图像标记中提取通用语义特征。该技术允许阐述图像概念,即使在模型的早期层中也是如此,并可用于操纵图像内容,例如用其他对象替换对象。

  7. TOOL · CL_259175 ·

    量子启发式Transformer (QiT) 推进视觉识别

    研究人员开发了QiT,一种用于视觉识别任务的量子启发式Transformer模型。QiT利用了量子模型的结构思想,例如角度启发式编码和周期性特征自注意力,来创建一个模仿量子神经网络特性的经典Transformer。虽然不使用量子计算,QiT旨在经典模型中分离和评估受量子启发的归纳偏差。该模型在图像分类基准测试中表现出竞争力,其QiT-B变体在ImageNet-1K上达到了78.3%的top-1准确率。

  8. TOOL · CL_257276 ·

    LandingAI 发布 ADE Gen2,支持原子级归因和面向代理的 JSON 输出

    LandingAI 推出了其 Agentic Document Extraction (ADE Gen2) 系统的第二代产品,该系统基于其新的 DPT-3 模型系列构建。此次更新侧重于为开发者改进输出结构、归因和成本效益。ADE Gen2 提供低至单词或行级别的原子级归因,为提取的数据提供精确的来源归属,这对于受监管的工作流程至关重要。该系统现在返回为代理消费设计的、干净的、结构化的 JSON,并与 SDK 和异步作业 API 集成,…

  9. TOOL · CL_254402 ·

    AI工作流程筛查南非食品的钠含量合规性

    研究人员开发了一种支持OCR的工作流程,用于根据监管限值筛查南非包装食品的钠含量。该系统结合了区域检测、光学字符识别和视觉-语言模型,以对产品进行分类并识别属于R214范围之内或之外的产品。对442种产品的评估表明,集成工作流程和独立的Qwen2.5-VL 7B模型在类别分配和范围确定方面取得了高度一致,证明了基于图像的自动化筛查在食品安全法规管理方面的潜力。

  10. TOOL · CL_254228 ·

    视觉语言模型在文档提取方面的评估揭示了权衡取舍

    一项新的研究论文探讨了使用视觉语言模型(VLM)从业务文档中提取结构化数据所涉及的权衡。该研究在一个合成支票数据集上评估了包括 GPT-5 等商业产品和 Claude Sonnet 4.5 等开源模型在内的十一个系统。微调开源 VLM 可显著提高其性能,在某些情况下甚至超过商业系统,而 GPT-5 在整体准确性方面领先,Claude Sonnet 4.5 在日期提取方面则表现不佳。该研究还引入了一个框架,帮助从业者根据质量、延迟、治理…

  11. TOOL · CL_252237 ·

    VideoXAgent 通过在线代理工具集解决长视频理解问题

    研究人员开发了 VideoXAgent,这是一个用于理解长视频的在线代理工具集。该系统可以规划任务,按需使用 VLMs、OCR 和 ASR 等专业工具,并聚合证据来回答查询。VideoXAgent 旨在克服将整个视频打包到单个上下文窗口中带来的上下文遗忘和高计算成本的限制。与密集打包基线相比,它在 Video-MME-Long 和 MINERVA 等基准测试中表现出具有竞争力的性能,即使上下文占用空间显著减小。

  12. TOOL · CL_251713 ·

    MinerU 在 Olud Pulse 文档 AI 和 OCR 排名中领先

    MinerU 在 Olud Pulse 文档 AI 和 OCR 榜单中取得了第一名,得分 89 分(满分 100 分)。该分数比之前的表现略有下降。Olud Pulse 提供了对文档 AI 和 OCR 领域各种工具的比较分析。

  13. TOOL · CL_249254 ·

    OCR通过版面模型和表格检测增强业务文档处理能力

    光学字符识别(OCR)可以从文档中提取文本,但在处理复杂版面和确保数据准确性方面存在困难。版面模型和表格检测等高级技术对于将非结构化的业务文档转化为可靠的结构化数据至关重要。验证过程进一步增强了输出的可信度。

  14. COMMENTARY · CL_248384 ·

    2026年图像标注成本将因复杂性和类型而异

    2026年图像标注的成本将取决于几个因素,包括任务的复杂性、数据量、质量保证流程、所需专业知识和周转时间。边界框、关键点、分割、立方体和光学字符识别(OCR)等特定标注类型将各有不同的定价基准。为经济高效的AI训练数据集进行规划需要仔细考虑这些变量。

  15. TOOL · CL_245048 ·

    文档图像分类解释通过领域感知分割得到改进

    arXiv 上发表的一项新研究调查了分割选择对文档图像分类 LIME 解释可靠性的影响。研究人员发现,常用于自然图像的标准超像素分割与文本区域和布局块等文档结构对齐不佳。通过在 RVL-CDIP 数据集上比较 Quickshift 和 SLIC 与源自 OCR 边界框和规则网格的文档感知分割,该研究表明领域特定分割显著提高了解释的一致性、正确性和局部保真度。这些文档感知方法还揭示了与数据集偏差相关的捷径行为,而这些行为通常被超像素方法…

  16. TOOL · CL_245040 ·

    新的MDPO方法增强了基于LLM的历史实体链接

    研究人员开发了一种名为多负面直接偏好优化(MDPO)的新方法,以改进使用大型语言模型(LLM)的历史实体链接。与之前只考虑一个负面候选者的方法不同,MDPO利用给定提及的所有有效拒绝候选者,保留了更多信息。与标准微调和单一负面DPO相比,该技术在处理NIL提及、语义歧义、OCR错误和困难的历史名称等具有挑战性的情况下,表现出了更高的性能。

  17. TOOL · CL_245039 ·

    新型AI代理可将蓝图准确转换为模拟模型

    研究人员开发了BlueprintAgent (BPA),这是一种新颖的多模态代理,旨在将扫描的结构蓝图准确转换为可模拟模型。与依赖直接提示或固定管道的先前方法不同,BPA使用多模态大型语言模型 (MLLM) 作为其主要读取器,并辅以OCR和计算机视觉。该代理的关键创新在于其约束触发机制,该机制利用工程约束来启动MLLM对蓝图特定区域的定向重访,确保输出符合关键工程要求。BPA在真实蓝图数据上取得了卓越的性能,宏平均Beam F1得分达…

  18. TOOL · CL_244686 ·

    FlowCPO 提出统一的散度视角用于流模型的偏好对齐

    研究人员提出了 FlowCPO,一种使用离线前向 KL 目标来对齐流模型和扩散模型的新方法。该方法通过利用偏好样本和非偏好样本,并无需重新进行模型采样,从而统一了现有的在线强化学习和离线偏好优化技术。FlowCPO 提供了一种基于对比流匹配的可行替代损失函数,该函数是有界的且非负的,与一些现有方法可能无下界不同。在评估中,与 FlowDPO 等基线方法相比,FlowCPO 在域内 GenEval 和 OCR 任务上表现出更好的性能。

  19. COMMENTARY · CL_244207 ·

    LLM 改进发票提取,但无法实现应付账款自动化

    虽然大型语言模型(LLM)通过实现无模板处理和处理文档的混乱性,显著改进了发票提取,但它们并未完全实现应付账款的自动化。LLM 在初始读取阶段表现出色,但验证、实体解析、策略应用和异常处理等关键后续阶段仍需要人工干预。当前模型常常无法表达不确定性,返回似是而非但错误的数据,这会侵蚀财务团队的信任,并阻碍真正的直通式处理。

  20. RESEARCH · CL_233465 ·

    新的LeakageBench基准揭示文档脱敏中持续存在的个人身份信息(PII)风险

    一个名为LeakageBench的新基准已被开发出来,用于评估文档图像中个人身份信息(PII)泄露的风险。该基准包含500张带有超过11,000个GDPR对齐的PII注释的文档图像,评估了包括OCR管道和视觉语言模型在内的各种脱敏方法。虽然像Code Interpreter这样的工具在与GPT-5.5等模型结合使用时可以提高PII的定位精度,但该基准表明,页面级别的泄露风险仍然存在,凸显了对更强大的PII脱敏技术的需求。