研究人员开发了一种新颖的生成式视觉基础方法Hi-Token,通过分层标记坐标来提高边界框预测的准确性。该方法对百位、十位和个位数字进行编码,增加了结构并促进了视觉-语言模型中的标记重用。作为Hi-Token的补充,Hi-GAR在训练过程中使用基于几何的奖励来进一步提高定位精度。在多个视觉-语言模型骨干和基准上的实验表明,性能持续提升,其中Hi-R1与现有的专业方法相比取得了更优异的结果。 AI
影响 提高了AI模型在视觉基础任务中的定位准确性,可能增强需要通过文本描述精确识别对象的应用。
排序理由 该集群包含两篇arXiv论文,详细介绍了视觉基础领域的新研究和调查。
- arXiv
- Generative Visual Grounding
- Group Relative Policy Optimization
- GRPO
- Hi-GAR
- Hi-R1
- Hi-Token
- Linhui Xiao
- RefCOCO+
- vision-language model
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →