PulseAugur
中
实时 20:44:53
实体 ScanNetv2

ScanNetv2

PulseAugur coverage of ScanNetv2 — every cluster mentioning ScanNetv2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
9
90 天内 9
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. TOOL · CL_273594 ·

    新的PrePARE方法大幅降低多视图几何Transformer的内存使用量

    研究人员开发了PrePARE,一种通过在Token进入交替注意力(AA)堆栈之前对其进行剪枝来优化多视图几何Transformer的新颖方法。这种方法显著减少了内存使用量并提高了处理速度,使得像VGGT和MapAnything这样的复杂模型可以在性能较低的硬件上运行。PrePARE通过仅训练一个Token Scorer和一个Feature-guided Restoration模块来实现这一点,而核心AA堆栈保持冻结状态,在ScanNe…

  2. TOOL · CL_229565 ·

    新的AQ3D方法通过自适应查询推进3D实例分割

    研究人员推出了一种新颖的3D实例分割方法AQ3D,该方法旨在适应不同大小的场景。与使用固定数量查询的先前方法不同,AQ3D根据场景超点比例实例化查询,从而更灵活地处理小型和大型场景。该系统还采用3D RoPE,使用量化度量坐标进行位置编码,摒弃了学习到的、有界的查找表。实验表明,AQ3D在ScanNetV2、ScanNet200和ScanNet++V2数据集上取得了最先进的成果。

  3. TOOL · CL_212031 ·

    新框架通过LLM引导的对齐增强三维物体检测

    研究人员开发了一个新的开放词汇三维物体检测框架,旨在提高识别三维场景中未见物体准确性。所提出的方法通过一种利用几何一致性、物体性和语义确定性的共蒸馏策略来增强新物体发现。此外,它通过一种双重指导学习方案来加强模型训练,该方案结合了用于回归的场景感知和用于分类的LLM引导的对齐,从而减少了不精确边界框和语义模糊的影响。在SUN RGB-D和ScanNetV2数据集上的实验表明,与现有最先进方法相比,性能有了显著提高。

  4. TOOL · CL_183449 ·

    LiteMVS模型通过蒸馏知识增强实时三维感知能力

    研究人员开发了LiteMVS,一个轻量级的多视图立体模型,专为高效的实时三维感知而设计。该模型将几何推理与强大的单目语义和结构先验相结合,借鉴了基础模型和轻量级分割模型的知识。LiteMVS使用语义描述符增强成本量,并采用专家混合(Mixture-of-Experts)方法进行自适应几何聚合。在ScanNetv2和7-Scenes数据集上的实验表明,LiteMVS在具有竞争力的效率下实现了高质量的深度预测和三维重建。

  5. TOOL · CL_181118 ·

    新的UTok3D分词器将CLIP适配于3D理解任务

    研究人员开发了UTok3D,一个新颖的参数高效框架,旨在将CLIP(一种视觉-语言模型)适配于3D理解任务。该分词器解决了将CLIP(在2D图像块上训练)应用于不规则和稀疏的3D点云的挑战。UTok3D学习了一个尺度归一化的3D分词器,使冻结的CLIP视觉编码器能够解释3D数据,从而在ShapeNetPart、ScanNetV2、S3DIS、SemanticKITTI和nuScenes等多样化数据集上实现无标注3D分割。

  6. RESEARCH · CL_147867 ·

    New LDMR framework tackles model forgetting in 3D object detection

    研究人员开发了一个名为学习-动态驱动记忆与回顾(LDMR)的新框架,以解决增量式3D目标检测中模型遗忘的问题。该框架旨在改进检测器在顺序数据中学习新目标类别同时保留先前学习到的知识的方式。LDMR利用每类检测质量的信号来驱动机制,在不同阶段回顾被遗忘的目标,并演化一个用于阶段间知识迁移的记忆库。在SUN RGB-D和ScanNetV2基准上的实验表明,LDMR显著减少了模型遗忘,并且优于现有方法。

  7. RESEARCH · CL_128623 ·

    新框架RelGraphOV通过对象关系增强3D场景理解

    研究人员推出RelGraphOV,一个旨在通过整合对象关系来改进开放词汇3D场景理解的新型框架。该方法利用3D场景图来推断和完善语义理解,超越了将对象孤立处理的方法。该框架采用自适应门控双流上下文GAT来处理几何和语义特征,能够在不产生特征干扰的情况下实现更好的上下文聚合。在ScanNetV2和Replica等数据集上进行的实验显示出有希望的结果和泛化能力。

  8. TOOL · CL_110030 ·

    新的蒸馏方法提升3D语义分割性能

    研究人员开发了一种名为异构且熟练的快照蒸馏(HAS-KD)的新型知识蒸馏技术,以提高3D语义分割性能。该方法将来自多模态教师和多个模型专家的知识转移到基于点云的学生网络。HAS-KD利用面向信息的异构蒸馏(IHD)方法和面向信息的过滤(IOF)策略来选择信息丰富的图像用于多模态教师,从而增强其知识转移能力。此外,熟练的快照蒸馏(ASD)利用免费提供的模型快照作为专家,通过让每个专家仅在其擅长的领域监督学生来降低训练成本。HAS-KD在…

  9. RESEARCH · CL_53928 ·

    新的Gaussian-Voxel Duet改进了3D表面重建

    研究人员开发了一种名为Gaussian-Voxel Duet的新型混合表示方法,以改进单目表面重建。该方法将3D高斯泼溅与稀疏体素支架相结合,将高斯限制在由体素化符号距离场定义的表面区域内。该方法旨在平衡几何精度和优化效率,在保持快速训练和实时渲染的同时,提供最先进的重建质量和新视角合成。