PulseAugur
实时 06:47:22
English(EN) Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

新方法改进视觉语言模型边界框精度

研究人员开发了一种无标签的精度精炼(LFPR)方法,以提高视觉语言模型生成的边界框的精度。该技术允许冻结模型通过执行额外的局部观察来精炼不精确的边界框,而无需在推理时进行目标标注。LFPR将预测的小区域路由到更高分辨率的通道,在上下文裁剪内重新定位表达,并在固定的几何约束下才接受候选。该方法在包括Ref-L4、RefCOCO、RefCOCO+、RefCOCOg和Flickr30K Entities在内的各种数据集上都显示出改进,并且可以与现有的定位专家组合使用。 AI

影响 提高了视觉语言模型中的边界框精度,可能增强需要精确对象定位的应用。

排序理由 这是一篇详细介绍一种新方法以提高模型在特定任务上性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法改进视觉语言模型边界框精度

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Bo Ma ·

    IoU曲线上的定位准确性所在:无标签的推理时边界精炼

    arXiv:2608.19553v1 Announce Type: new Abstract: Vision--language models can identify the correct referent while returning an imprecise bounding box. We study whether a frozen direct-answer model can use its own prediction to allocate one additional localized observation without a…