PulseAugur
实时 18:34:35
实体 RefCOCO+

RefCOCO+

PulseAugur coverage of RefCOCO+ — every cluster mentioning RefCOCO+ across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 11
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 10
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. RESEARCH · CL_217771 ·

    新的DRAgent框架使用MLLM进行精确物体分割

    研究人员开发了DRAgent,一个利用多模态大语言模型(MLLM)的指代表达分割(RES)新框架。与直接预测坐标的先前方法不同,DRAgent采用判别式推理方法。它首先识别一组潜在的物体候选,然后使用MLLM从这些候选中准确选择目标物体。然后,这个选定的物体用于指导分割模型生成精确的像素级掩码。该框架还包括一个用于微调MLLM推理能力的数据管道,在标准的RES数据集上取得了有竞争力的结果。

  2. RESEARCH · CL_212174 ·

    新方法在无标签情况下提升视觉语言模型的边界精度

    研究人员开发了一种名为无标签精度细化(LFPR)的新颖方法,以提高视觉语言模型识别对象及其精确边界的准确性。该技术允许冻结的模型在推理过程中无需访问目标标注即可优化边界框预测。LFPR通过将预测路由到更高分辨率的通道并应用几何约束,在Ref-L4、RefCOCO和Flickr30K Entities等各种数据集上展示了显著的改进。

  3. TOOL · CL_187491 ·

    新型对抗性攻击针对SAM3图像分割模型

    研究人员开发了通用概念扰动(UCD),这是一种专门针对SAM3图像分割模型的新型对抗性攻击。UCD学习一种单一的图像扰动,可以破坏模型在各种数据集中准确识别和分割概念的能力。这种攻击方法持续优于现有基线,显著降低了分割准确性和概念基础性能。学习到的扰动还表现出向SAM3新版本甚至视频推理的迁移能力,而无需重新优化。

  4. RESEARCH · CL_183434 ·

    新的Hi-Token方法提高了AI模型中的视觉基础准确性

    研究人员开发了一种新颖的生成式视觉基础方法Hi-Token,通过分层标记坐标来提高边界框预测的准确性。该方法对百位、十位和个位数字进行编码,增加了结构并促进了视觉-语言模型中的标记重用。作为Hi-Token的补充,Hi-GAR在训练过程中使用基于几何的奖励来进一步提高定位精度。在多个视觉-语言模型骨干和基准上的实验表明,性能持续提升,其中Hi-R1与现有的专业方法相比取得了更优异的结果。

  5. TOOL · CL_167766 ·

    StepX-Edge: 设备端 UI 视觉-语言模型实现高精度

    研究人员开发了 StepX-Edge,一个拥有 0.9 亿参数的视觉-语言模型,专为设备端 UI 理解而设计。该模型通过架构、训练和部署的协同设计方法,解决了移动设备上准确性和效率之间的权衡问题。StepX-Edge 在 ScreenQA 和 Chinese OCRBench v2 等基准测试中表现出色,甚至超越了更大的模型,并且可以在 Snapdragon 8 Gen5 等设备上高效运行。

  6. TOOL · CL_129478 ·

    新的SVCR框架增强了弱监督指代表达理解

    研究人员开发了一个名为结构化视觉组合表示(SVCR)的新框架,以改进弱监督设置下的指代表达理解(REC)。该框架显式地建模单个对象嵌入和成对关系嵌入,创建结构化视觉表示。然后,组合对齐机制将这些视觉表示与其对应的文本嵌入进行匹配,从而在弱监督下实现更准确的视觉-文本匹配。在RefCOCO等标准数据集上的实验表明,SVCR取得了最先进的性能,突显了显式结构化视觉表示对WREC的好处。

  7. TOOL · CL_118020 ·

    HKVLM 模型通过分离定位和语言来改进视觉推理

    研究人员开发了 HKVLM,一种新颖的视觉推理方法,它将定位与语言生成分离开来。该模型利用一个冻结的语言对齐检测器和一个冻结的语言模型,通过一个轻量级的对齐钩连接。该钩通过对比检索和二分匹配将语言查询绑定到区域建议,旨在提高视觉问答和目标检测任务的忠实度。该系统专为小数据设置而设计,并包含一个忠实度否决机制,以防止命名不支持的对象,从而显著降低幻觉率。

  8. RESEARCH · CL_106575 ·

    CoLA框架通过双路径LoRA增强多模态AI适配

    研究人员推出CoLA(Cross-Modal Low-rank Adaptation),一个旨在高效适配基础模型以用于多模态任务的新框架。与现有方法分别独立适配各模态不同,CoLA在标准的模态内适配路径之外,增加了一条模态间适配路径。这种双路径方法可以在不干扰模态特定学习和跨模态学习的情况下实现有效适配。在视觉语言和音频视觉基准上的评估显示,CoLA的性能分别比标准LoRA高出约3%和2%,同时保持了参数效率。

  9. TOOL · CL_76067 ·

    研究人员寻求arXiv推荐以支持其Locate-SAM2计算机视觉论文

    两位独立研究员正在为其关于名为Locate-SAM2的新型计算机视觉系统的论文寻求推荐。该系统通过一个轻量级适配器连接NVIDIA的LocateAnything-3B和Meta的SAM 2.1,旨在确定选择的定位器是否会影响模块化文本到掩码(text-to-mask)流程中的掩码质量。他们的工作在RefCOCO数据集上展示了具有竞争力的性能,达到了0.772 mIoU,并包含了详细的比较、消融研究以及失败案例分析。

  10. RESEARCH · CL_55943 ·

    新框架利用大语言模型先验增强半监督分割

    研究人员推出了一种名为“学习标注”(L2L)的新型框架,旨在通过将伪标签生成视为一个可学习的过程来改进半监督指代表达分割(SS-RES)。L2L 利用多模态大语言模型提取语义空间先验,指导分层分割网络。该框架采用一种强化的伪标签选择机制,自适应地奖励有用的监督,从而在稀疏数据条件下实现分割模型和伪标签的联合优化,以提高可靠性。在标准数据集上的实验表明,L2L 的性能优于现有方法。

  11. TOOL · CL_22437 ·

    Visual Para-Thinker 将并行推理引入多模态大语言模型

    研究人员推出了一种新颖的多模态大语言模型(MLLMs)并行推理框架——Visual Para-Thinker。该方法将推理深度的垂直扩展转变为并行策略,以避免探索瓶颈。该框架结合了视觉分区、Pa-Attention 和 LPRoPE,以保持路径独立性和多样化推理,并基于 vLLM 框架构建了多模态实现以实现高效处理。