实体
Dezhi Peng
Dezhi Peng
PulseAugur coverage of Dezhi Peng — every cluster mentioning Dezhi Peng across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
UPOCR模型利用Vision Transformer统一OCR任务
研究人员推出了一种新颖的通用模型UPOCR,旨在将各种光学字符识别(OCR)任务统一到一个单一的图像到图像转换框架中。该方法利用了基于Vision Transformer(ViT)的编码器-解码器架构,并增强了可学习的任务提示来指导特征表示。该模型经过训练,可以最小化跨不同任务的图像差异,并以单一的统一模型在文本移除、分割和篡改文本检测方面展示了最先进的性能。
-
新基准揭示MLLM在富文本图像推理方面存在困难
一个名为OCR-Reasoning的新基准已被开发出来,用于评估多模态大语言模型(MLLM)的富文本图像推理能力。该基准包含1,069个人工标注的示例,涵盖6项核心推理能力和18项实际任务,并提供详细的逐步推理过程和最终答案。使用OCR-Reasoning进行的初步评估显示,即使是先进的MLLM在这些任务上也面临显著困难,没有一个模型的准确率超过50%,这突显了该领域亟待改进的方面。