研究人员开发了一个名为置信度感知策略内蒸馏(CA-OPD)的新框架,以改进自回归视觉语言模型。该方法通过利用教师置信度来纠正训练过程中不可靠的学生预测,从而解决累积误差问题。CA-OPD将知识转移与干预决策对齐,在纠正的位置提供直接监督,在保留的位置提供完整的预测分布。当应用于GUI定位和光学字符识别任务时,CA-OPD显著增强了Qwen3.5-0.8B基线模型,在ScreenSpot-Pro和OCRBench-v2 English等基准测试中取得了显著的提升。 AI
影响 增强了自回归视觉语言模型的性能,可能提高了GUI定位和OCR等任务的准确性。
排序理由 该集群描述了在arXiv上发表的学术论文中的一种新方法和框架。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- CA-OPD
- DagsHub
- Hugging Face
- OCRBench-v2 English
- On-Policy Distillation
- Qwen3.5-0.8B
- ScreenSpot-Pro
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →