研究人员开发了GAD-RL,一种提高视觉语言模型中光学字符识别(OCR)保真度的新方法。该技术在训练后自适应地调节教师监督,根据学生模型的性能和响应分布进行调整。GAD-RL旨在防止模型将异常文本重写为合理但不正确的表达,从而提高转录准确性。该方法显示出显著的改进,当应用于Qwen3.5-2B模型时,在CHAOS-Bench上实现了59.92%的Micro Recall。 AI
影响 提高了视觉语言模型中OCR的准确性,这对于依赖于从图像中准确提取文本的应用至关重要。
排序理由 该集群包含一篇详细介绍新方法和基准测试结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →