PulseAugur
实时 12:07:21
实体 3D visual grounding

3D visual grounding

PulseAugur coverage of 3D visual grounding — every cluster mentioning 3D visual grounding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_185491 ·

    新数据集和框架增强自动驾驶中的三维视觉定位

    研究人员推出了Talk2Sensors,这是一个用于自动驾驶中三维视觉定位的新型数据集和框架,它利用了多种传感器模态。该数据集包含超过8000条语言指令和20000个指代对象,专门设计用于匹配来自摄像头、LiDAR和4D雷达的传感器特定物理线索。提出的TSFormer框架采用粗粒度到细粒度的属性感知融合策略,能够根据语言要求动态路由外观、几何和运动线索,从而实现最先进的性能。

  2. TOOL · CL_160796 ·

    新的VLM-IE3D框架提升了视觉语言模型中的3D空间理解能力

    研究人员推出了一种新颖的VLM-IE3D框架,旨在增强视觉语言模型(VLMs)的3D空间感知能力。该框架集成了从RGB视频中提取的隐式和显式3D几何信息,无需额外的3D输入数据。VLM-IE3D利用隐式几何令牌(IGTs)来获取高级几何先验知识,并利用显式几何令牌(EGTs)来捕捉详细的几何结构,通过一个3D感知的适配器进行融合。实验表明,VLM-IE3D在视频检测、视觉定位、密集字幕和空间推理等多种3D任务中均表现出色。

  3. TOOL · CL_131514 ·

    OpenGround框架通过规划和在线感知增强3D视觉定位

    研究人员推出OpenGround,一个专为开放世界3D视觉定位设计的新颖框架。该系统通过集成任务链规划(Task-Chain Planning)将复杂查询分解为可管理的子目标,并通过上下文引导感知(Context-Guided Perception)进行在线物体识别,从而解决了当前方法的局限性。OpenGround还包含一个名为OpenTarget的新数据集,以促进在开放世界场景下的评估。该框架表现强劲,在ScanRefer上取得了最…

  4. RESEARCH · CL_119507 ·

    PruneGround框架通过空间剪枝技术增强3D视觉定位

    研究人员推出PruneGround,一个旨在通过关注3D场景中与语言相关的区域来改进3D视觉定位的新型框架。该方法利用语言引导的空间剪枝(LGSP)技术,并结合冻结的视觉语言模型(VLM)来缩小搜索空间并降低计算成本。该框架还包含多视图条件描述重构(MCDR)以简化复杂表达式,以及一个LLM-Grounder来对剪枝区域内的点云和语言数据进行对齐。实验表明,PruneGround在ScanRefer、Nr3D和Sr3D+等基准测试中取…

  5. TOOL · CL_91404 ·

    新的强化学习框架提升视频3D场景理解能力

    研究人员推出3D-RFT,一个将带可验证奖励的强化学习(RLVR)应用于视频3D场景理解的新框架。与使用间接优化的传统监督微调(SFT)方法不同,3D-RFT通过组相对策略优化(GRPO)方法,使用3D IoU和F1-Score等特定任务指标直接优化模型。该方法已展示出最先进的性能,在3D视频检测、视觉定位和空间推理基准测试中优于更大的模型。

  6. RESEARCH · CL_50767 ·

    AgentGrounder 实现点云上的零样本 3D 视觉地面定位

    研究人员推出 AgentGrounder,一个新颖的零样本 3D 视觉地面定位框架,直接在彩色点云上运行。该方法通过采用两阶段设计,绕过了对特定任务 3D 训练的需求:一个离线阶段用于构建对象查找表,以及一个在线代理,用于选择性地检索候选对象并执行几何评分。AgentGrounder 旨在根据自然语言描述改进 3D 场景中的对象定位,并在 ScanRefer 和 Nr3D 等基准测试中取得了有希望的结果。