PulseAugur
中
实时 18:20:35
实体 3D Scene Understanding

3D Scene Understanding

PulseAugur coverage of 3D Scene Understanding — every cluster mentioning 3D Scene Understanding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_252218 ·

    新的基准和方法推动AI的3D场景理解能力 · 跟踪3 个来源

    三篇新研究论文介绍了用于改进AI中3D场景理解的新基准和方法。SceneBench 提供了一个具有详细注释的分层数据集,用于评估视觉语言模型在空间推理方面的能力。Spheriverse 提供了一个大规模的球形观测数据集,并引入了 SphereOcc 框架,以弥合球形和笛卡尔表示之间的差距,从而更好地进行语义占用预测。PointPiT 提出了一种用于3D点云基础模型的参数高效微调技术,可在显著降低计算成本的同时实现有效的场景级理解。

  2. TOOL · CL_219234 ·

    Volume Transformer 适配通用 Transformer 模型以实现 3D 场景理解

    研究人员开发了 Volume Transformer (Volt),这是一种将通用 Transformer 模型适配于 3D 场景理解任务的新型架构。Volt 将 3D 场景划分为体积块标记,并利用具有 3D 旋转位置嵌入的全局自注意力机制。初步实验表明,Volt 需要数据高效的训练策略,包括强数据增强、正则化以及从卷积教师模型进行蒸馏,才能取得有竞争力的结果。当增加监督信号进行扩展时,Volt 的表现优于特定领域的 3D 主干网络,…

  3. RESEARCH · CL_185516 ·

    SmartMage 动态编排模态以实现3D场景理解

    研究人员推出 SmartMage,这是一种新颖的多模态大语言模型,旨在增强3D场景理解能力。与使用固定模态组合的先前模型不同,SmartMage 根据查询相关性动态编排视觉、几何和其他感官输入。这种自适应方法旨在通过优先考虑信息模态和过滤语义噪声来减少计算浪费并提高推理准确性。该模型包含一个语义引导模态自适应路由(SMART)模块和一个模态感知门控专家(MAGE)模块来实现其动态编排能力。