研究人员推出了一种新颖的GLoTran框架,旨在提高高分辨率富文本图像的文本图像机器翻译(TIMT)的准确性和完整性。该方法采用双重感知策略,结合了图像的低分辨率全局视图和多尺度局部文本细节。为此,创建了一个名为GLoD的大规模数据集,包含超过510,000个图像-文本对。实验表明,与多模态大语言模型(MLLMs)结合使用时,GLoTran显著优于现有方法。 AI
影响 该框架可以提高需要理解和翻译图像中文本的AI系统的准确性,影响文档分析和辅助功能工具等应用。
排序理由 该集群描述了一篇在arXiv上发表的新研究论文,详细介绍了一种针对特定AI任务的新颖框架和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →