PulseAugur
实时 12:01:09
English(EN) VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

VCap 通过精确的事实验证增强视觉字幕

研究人员推出 VCap,一种用于视觉字幕模型的新型奖励机制,旨在提高事实准确性和覆盖率。VCap 采用证人-仲裁者方法,将参考字幕与视觉信号配对以验证事实一致性。即使参考字幕不完美,该方法也能实现有效学习,从而在强化学习训练中实现弱到强的泛化。实验表明,使用 VCap 训练的 8B 模型在各种字幕基准测试中均优于最先进的模型,并展示了改进的感知能力。 AI

影响 VCap 的事实验证方法可能带来更可靠、更准确的图像和视频描述,影响依赖多模态理解的应用。

排序理由 该集群描述了一篇关于视觉字幕新方法的最新研究论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

VCap 通过精确的事实验证增强视觉字幕

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Tianke Zhang, Changyi Liu, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan ·

    VCap:用于弱到强视觉字幕的超几何奖励

    arXiv:2605.28023v1 Announce Type: cross Abstract: Visual captioning requires models to capture visual content faithfully while minimizing both omission and hallucination. As the dominant paradigm for captioning, MLLMs have achieved strong performance through scaling and high-qual…

  2. arXiv cs.CV TIER_1 English(EN) · Chun Yuan ·

    VCap:用于弱到强视觉字幕的超几何奖励

    Visual captioning requires models to capture visual content faithfully while minimizing both omission and hallucination. As the dominant paradigm for captioning, MLLMs have achieved strong performance through scaling and high-quality data. Recently, RL has emerged as a key route …