PulseAugur
中
实时 19:47:22
实体 COCO-LN500

COCO-LN500

PulseAugur coverage of COCO-LN500 — every cluster mentioning COCO-LN500 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_216000 ·

    Re$^3$Cap 使用检索引导的强化学习来改进图像字幕生成

    研究人员开发了 Re$^3$Cap,一种利用多模态检索引导的强化学习来改进图像字幕生成的新方法。该方法旨在克服标准强化学习在鼓励大型视觉语言模型(LVLMs)探索不同推理策略方面的局限性,从而缩小与监督微调的性能差距。Re$^3$Cap 能够识别并纠正字幕中的幻觉和遗漏,生成更准确、更详细的描述,并在 COCO-LN500 基准测试中展现出优于包括 GRPO 在内的现有方法的性能。

  2. TOOL · CL_93484 ·

    新的强化学习框架通过最小化信息丢失来增强LVLM的图像字幕生成能力

    研究人员开发了一个名为跨模态身份映射(CIM)的新型强化学习框架,以改进大型视觉语言模型(LVLM)的图像字幕生成能力。CIM通过测量使用生成字幕通过文本搜索检索到的图像与原始图像之间的相似性来量化信息丢失。该方法旨在最小化信息丢失,而无需额外的标注,从而生成更精确的描述。实验表明,CIM显著提高了图像字幕生成性能,在Qwen2.5-VL-7B模型上,于COCO-LN500基准测试中关系推理能力提升了20%。