PulseAugur
实时 09:52:04
English(EN) Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation

新的GLoTran框架通过双重感知增强富文本图像翻译

研究人员推出了一种新颖的GLoTran框架,旨在提高高分辨率富文本图像的文本图像机器翻译(TIMT)的准确性和完整性。该方法采用双重感知策略,结合了图像的低分辨率全局视图和多尺度局部文本细节。为此,创建了一个名为GLoD的大规模数据集,包含超过510,000个图像-文本对。实验表明,与多模态大语言模型(MLLMs)结合使用时,GLoTran显著优于现有方法。 AI

影响 该框架可以提高需要理解和翻译图像中文本的AI系统的准确性,影响文档分析和辅助功能工具等应用。

排序理由 该集群描述了一篇在arXiv上发表的新研究论文,详细介绍了一种针对特定AI任务的新颖框架和数据集。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的GLoTran框架通过双重感知增强富文本图像翻译

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Junxin Lu, Tengfei Song, Zhanglin Wu, Pengfei Li, Xiaowei Liang, Hui Yang, Kun Chen, Ning Xie, Yunfei Lu, Jing Zhao, Shiliang Sun, Daimeng Wei ·

    面向高分辨率富文本图像翻译的MLLMs的全局-局部双重感知

    arXiv:2602.21956v2 Announce Type: replace Abstract: Text Image Machine Translation (TIMT) aims to translate text embedded in images in the source-language into target-language, requiring synergistic integration of visual perception and linguistic understanding. Existing TIMT meth…