研究人员开发了一种无标签的精度精炼(LFPR)方法,以提高视觉语言模型生成的边界框的精度。该技术允许冻结模型通过执行额外的局部观察来精炼不精确的边界框,而无需在推理时进行目标标注。LFPR将预测的小区域路由到更高分辨率的通道,在上下文裁剪内重新定位表达,并在固定的几何约束下才接受候选。该方法在包括Ref-L4、RefCOCO、RefCOCO+、RefCOCOg和Flickr30K Entities在内的各种数据集上都显示出改进,并且可以与现有的定位专家组合使用。 AI
影响 提高了视觉语言模型中的边界框精度,可能增强需要精确对象定位的应用。
排序理由 这是一篇详细介绍一种新方法以提高模型在特定任务上性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →