PulseAugur
实时 07:16:21
实体 ScanNet200

ScanNet200

PulseAugur coverage of ScanNet200 — every cluster mentioning ScanNet200 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_252202 ·

    新研究探讨3D分割模型组合中的语义保留

    研究人员调查了在组合冻结的基础模型进行少样本3D分割时,语义信息是如何保留的。他们的研究题为“Beyond Argmax: A Mechanistic Study of Semantic Retention in Frozen Foundation-Model Composition for Generalized Few-Shot 3D Segmentation”,发现与折叠到单个类别相比,在交互前保留语义替代物的完整分布,性能显著…

  2. TOOL · CL_229565 ·

    新的AQ3D方法通过自适应查询推进3D实例分割

    研究人员推出了一种新颖的3D实例分割方法AQ3D,该方法旨在适应不同大小的场景。与使用固定数量查询的先前方法不同,AQ3D根据场景超点比例实例化查询,从而更灵活地处理小型和大型场景。该系统还采用3D RoPE,使用量化度量坐标进行位置编码,摒弃了学习到的、有界的查找表。实验表明,AQ3D在ScanNetV2、ScanNet200和ScanNet++V2数据集上取得了最先进的成果。

  3. TOOL · CL_204119 ·

    OpenBelief-Nav 系统通过保留证据的记忆增强了 3D 导航能力

    研究人员推出 OpenBelief-Nav,这是一个新颖的系统,专为 3D 环境中的开放词汇语言引导导航而设计。该系统保留了观察细节和可靠性线索,与依赖单一特征或标签的传统方法相比,实现了更灵活的语义记忆。OpenBelief-Nav 在各种数据集和模拟机器人场景中的物体检测和导航任务上均表现出性能提升。

  4. TOOL · CL_196053 ·

    新的PinpointQA基准测试MLLM在室内视频空间理解能力

    研究人员推出PinpointQA,一个旨在评估多模态大语言模型(MLLM)在处理室内视频时的空间理解能力的新基准。该基准建立在ScanNet++和ScanNet200之上,包含超过10,000个问题-答案对,分为四个难度级别,侧重于精确的物体定位和空间描述。初步评估显示,当前MLLM在这些任务上的性能显著下降,尤其是在结构化空间预测方面,尽管监督微调显示出改进的潜力。

  5. TOOL · CL_154309 ·

    新的OV-MAP方法为机器人实现开放词汇3D建图

    研究人员推出了一种名为OV-MAP的新方法,用于机器人的开放世界3D建图,该方法将开放词汇特征集成到3D地图中。该方法通过使用一个与类别无关的分割模型将2D掩码投影到3D空间,并结合补充的深度图像,来解决特征重叠的挑战。3D掩码投票机制进一步提高了准确性,无需监督式3D模型即可实现零样本3D实例分割。在ScanNet200和Replica等数据集上的实验以及实际测试表明,OV-MAP具有有效性、鲁棒性和适应性。

  6. TOOL · CL_152050 ·

    新的无训练流水线推动3D点云分割技术发展

    研究人员开发了一种新颖的无训练开放词汇3D点云分割流水线。该方法将冻结的3D视觉语言模型RegionPLC与冻结的可提示概念分割器SAM3配对。通过利用跨视图一致性,该流水线在ScanNet200基准测试上取得了显著的改进,而无需任何训练数据、3D标签,甚至少样本支持示例。与依赖广泛监督的最先进方法相比,该方法显著弥补了性能差距。

  7. RESEARCH · CL_128623 ·

    新框架RelGraphOV通过对象关系增强3D场景理解

    研究人员推出RelGraphOV,一个旨在通过整合对象关系来改进开放词汇3D场景理解的新型框架。该方法利用3D场景图来推断和完善语义理解,超越了将对象孤立处理的方法。该框架采用自适应门控双流上下文GAT来处理几何和语义特征,能够在不产生特征干扰的情况下实现更好的上下文聚合。在ScanNetV2和Replica等数据集上进行的实验显示出有希望的结果和泛化能力。

  8. TOOL · CL_121196 ·

    新框架利用深度数据增强隐私保护的三维语义分割

    研究人员开发了一个名为 UTTO(不确定性引导的测试时优化)的新框架,利用仅深度数据来增强隐私保护的三维语义分割。该方法通过利用仅深度几何来解决依赖可能损害隐私的 RGB 图像的挑战。UTTO 将预测中的不确定性转化为引导信号,利用基础模型的先验知识来优化不可靠的语义响应。在 ScanNet20、ScanNet40 和 ScanNet200 数据集上的实验表明,UTTO 在无需额外训练的情况下显著提高了仅深度开放词汇三维分割的性能。

  9. RESEARCH · CL_91011 ·

    Pano3D框架统一三维重建与全景分割

    研究人员开发了Pano3D,一个统一三维重建和三维全景分割的新框架。通过为现有的三维重建模型增加一个基于集合的掩码解码器并采用联合几何和语义损失,该方法增强了三维重建中的语义理解。该方法在多个数据集上取得了最先进的性能,展示了联合训练过程带来的互利改进。

  10. RESEARCH · CL_59051 ·

    ESAM++ 为边缘设备提供高效的3D感知

    研究人员开发了ESAM++,一种在边缘设备上进行实时3D场景感知的有效方法。这种新方法通过引入轻量级的3D稀疏特征金字塔网络,解决了ESAM等先前方法的计算需求。ESAM++在保持具有竞争力的准确性的同时,显著减少了推理时间和模型大小,使其适用于没有GPU加速的资源受限环境。