PulseAugur
中
实时 03:40:04
实体 RefCOCOg

RefCOCOg

PulseAugur coverage of RefCOCOg — every cluster mentioning RefCOCOg across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_239591 ·

    新型WeakMCN网络改进指代表达任务

    研究人员开发了WeakMCN,一种新颖的多任务协同网络,旨在改进弱监督指代表达理解和分割。该双分支架构联合学习这两个任务,其中理解分支充当分割分支的教师。该网络结合了动态视觉特征增强以适应视觉知识,以及协同一致性模块以促进跨任务对齐。在RefCOCO、RefCOCO+和RefCOCOg等基准测试上的实验表明,WeakMCN的表现优于现有的单任务方法。

  2. RESEARCH · CL_217771 ·

    新的DRAgent框架使用MLLM进行精确物体分割

    研究人员开发了DRAgent,一个利用多模态大语言模型(MLLM)的指代表达分割(RES)新框架。与直接预测坐标的先前方法不同,DRAgent采用判别式推理方法。它首先识别一组潜在的物体候选,然后使用MLLM从这些候选中准确选择目标物体。然后,这个选定的物体用于指导分割模型生成精确的像素级掩码。该框架还包括一个用于微调MLLM推理能力的数据管道,在标准的RES数据集上取得了有竞争力的结果。

  3. RESEARCH · CL_212174 ·

    新方法在无标签情况下提升视觉语言模型的边界精度

    研究人员开发了一种名为无标签精度细化(LFPR)的新颖方法,以提高视觉语言模型识别对象及其精确边界的准确性。该技术允许冻结的模型在推理过程中无需访问目标标注即可优化边界框预测。LFPR通过将预测路由到更高分辨率的通道并应用几何约束,在Ref-L4、RefCOCO和Flickr30K Entities等各种数据集上展示了显著的改进。

  4. TOOL · CL_129478 ·

    新的SVCR框架增强了弱监督指代表达理解

    研究人员开发了一个名为结构化视觉组合表示(SVCR)的新框架,以改进弱监督设置下的指代表达理解(REC)。该框架显式地建模单个对象嵌入和成对关系嵌入,创建结构化视觉表示。然后,组合对齐机制将这些视觉表示与其对应的文本嵌入进行匹配,从而在弱监督下实现更准确的视觉-文本匹配。在RefCOCO等标准数据集上的实验表明,SVCR取得了最先进的性能,突显了显式结构化视觉表示对WREC的好处。

  5. TOOL · CL_118020 ·

    HKVLM 模型通过分离定位和语言来改进视觉推理

    研究人员开发了 HKVLM,一种新颖的视觉推理方法,它将定位与语言生成分离开来。该模型利用一个冻结的语言对齐检测器和一个冻结的语言模型,通过一个轻量级的对齐钩连接。该钩通过对比检索和二分匹配将语言查询绑定到区域建议,旨在提高视觉问答和目标检测任务的忠实度。该系统专为小数据设置而设计,并包含一个忠实度否决机制,以防止命名不支持的对象,从而显著降低幻觉率。

  6. RESEARCH · CL_106575 ·

    CoLA框架通过双路径LoRA增强多模态AI适配

    研究人员推出CoLA(Cross-Modal Low-rank Adaptation),一个旨在高效适配基础模型以用于多模态任务的新框架。与现有方法分别独立适配各模态不同,CoLA在标准的模态内适配路径之外,增加了一条模态间适配路径。这种双路径方法可以在不干扰模态特定学习和跨模态学习的情况下实现有效适配。在视觉语言和音频视觉基准上的评估显示,CoLA的性能分别比标准LoRA高出约3%和2%,同时保持了参数效率。

  7. RESEARCH · CL_55943 ·

    新框架利用大语言模型先验增强半监督分割

    研究人员推出了一种名为“学习标注”(L2L)的新型框架,旨在通过将伪标签生成视为一个可学习的过程来改进半监督指代表达分割(SS-RES)。L2L 利用多模态大语言模型提取语义空间先验,指导分层分割网络。该框架采用一种强化的伪标签选择机制,自适应地奖励有用的监督,从而在稀疏数据条件下实现分割模型和伪标签的联合优化,以提高可靠性。在标准数据集上的实验表明,L2L 的性能优于现有方法。