SCANNET
PulseAugur coverage of SCANNET — every cluster mentioning SCANNET across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的相机姿态精炼方法绕过了三角测量误差
研究人员开发了一种新的相机姿态精炼方法,该方法避免了三角测量,这是可能引入错误的常见步骤。这种无三角测量的方法将结构表示为标量深度,从而保持了来自移动AR框架的初始粗略先验的准确性。该技术还结合了渐进式非凸性,使其能够处理比现有方法大得多的初始先验误差,即使在存在显著扰动的情况下也能获得稳健的结果。
-
新基准OV3D-Bench凸显3D检测中的语义挑战
研究人员推出OV3D-Bench,一个旨在评估开放词汇单目3D检测器在更现实部署条件下的新基准。该基准解决了现有评估协议中的不一致性,并将检测精度解耦为定位鲁棒性和语义鲁棒性。初步评估显示,尽管当前检测器在定位方面表现出色,但在准确的语义标注方面存在困难,并且性能对提示语的措辞高度敏感。研究还表明,使用视觉-语言编码器对冻结的闭词汇检测器的预测进行重新映射,可以与专门的开放词汇方法相媲美,这表明语义理解仍然是一个关键挑战。
-
STAR框架通过新颖的路由技术增强3D场景理解能力
研究人员开发了STAR,一个新颖的框架,旨在通过解决不同传感器模态之间拓扑差异带来的挑战来改进3D场景理解。STAR采用混合专家(MoE)架构,并增强了一个多属性自监督预训练分支,该分支能够捕捉拓扑和纹理变化。该框架结合了领域-空间引导路由(DSR)来处理局部拓扑变化,以及熵控制动态分配(EDA)来根据路由不确定性调整激活的专家数量。实验表明,STAR取得了优异的成果,在ScanNet验证集上达到了80.1%的mIoU,在S3DIS上…
-
新的PinpointQA基准测试MLLM在室内视频空间理解能力
研究人员推出PinpointQA,一个旨在评估多模态大语言模型(MLLM)在处理室内视频时的空间理解能力的新基准。该基准建立在ScanNet++和ScanNet200之上,包含超过10,000个问题-答案对,分为四个难度级别,侧重于精确的物体定位和空间描述。初步评估显示,当前MLLM在这些任务上的性能显著下降,尤其是在结构化空间预测方面,尽管监督微调显示出改进的潜力。
-
新的Self-Geometry管道增强了3D视觉模型的一致性
研究人员开发了Self-Geometry,一种新颖的测试时适应管道,旨在增强3D视觉基础模型的几何一致性。该方法通过利用2D像素对应作为伪地面真实来直接施加显式的多视图几何约束,克服了先前依赖隐式自一致性方法的局限性。Self-Geometry集成了几何解耦优化、特定的视图采样器以及通过LoRA进行的轻量级适应,从而在多个模型和基准测试中提高了姿态和几何估计的性能。
-
HKUST(GZ) 发布用于机器人的无训练3D映射系统
香港科技大学(广州)和穆罕默德·本·扎耶德人工智能大学的研究人员开发了FreeOcc,一个用于3D环境中语义占用预测的新颖系统。该系统独特之处在于它无需任何预先训练即可运行,仅使用单目或RGB-D图像序列实时构建全局一致的、开放词汇的3D占用图。FreeOcc解决了现有方法过度依赖大量标记数据且难以泛化到新环境的局限性,为具身AI代理带来了重大进展。
-
LLM代理为3D场景生成电影级相机路径
研究人员开发了CinemaTraj,一个利用LLM代理为3D场景生成电影级相机轨迹的新框架。该系统接收一组RGB-D图像和一个自然语言提示,将请求分解为原子化的电影运动。通过为LLM配备结构化的3D场景图,CinemaTraj确保生成的轨迹不仅富有表现力且无碰撞,而且还基于场景的几何和语义属性。该框架还生成同步的画外音和字幕,创建完全旁白的电影视频输出。
-
GeoStereo框架利用扩散先验统一立体几何估计
研究人员推出了一种新颖的框架GeoStereo,它统一了用于视差和表面法线预测的立体几何估计。该方法利用扩散先验来增强在低光照条件、反射表面和透明物体等具有挑战性的视觉场景中的性能。GeoStereo将前馈立体匹配管道与基于扩散的法线估计分支相结合,使扩散模型能够提供改进视差估计的结构先验,反之亦然。该框架在KITTI和NYUv2等基准测试中在视差估计方面取得了最先进的结果,并在iBims-1和ScanNet等室内数据集上在法线预测方…
-
新方法使用潜在空间流匹配增强3D场景生成
研究人员开发了一种名为潜在黎曼流匹配的新方法,以改进使用几何基础模型的3D场景生成。该技术在Visual Geometry Grounded Transformer (VGGT)等模型的潜在空间内运行,能够从稀疏输入生成更合理的几何形状。通过在超球体乘积流形上定义黎曼流匹配框架,该方法尊重VGGT的潜在几何特性,在RealEstate10K、ScanNet++和ETH3D等数据集上优于现有的场景生成基线。
-
新方法通过视图合成和遮挡感知推进全景分割 · 跟踪 2 个来源
研究人员正在开发全景分割的新方法,这项任务涉及识别和描绘图像中的每个对象实例和语义区域。一种方法利用大型视图合成模型将全景标签传播到新视图,而无需显式 3D 重建,在 ScanNet 和 Replica 等数据集上取得了有竞争力的结果。另一种方法 PEMOLA 为基于 Transformer 的分割引入了一个遮挡感知的模块,利用 COCO-OLAC 和 Cityscapes-OLAC 等数据集的遮挡线索来提高性能,尤其是在遮挡场景中。
-
新AI方法可从多视图图像和草图生成3D场景
研究人员开发了从有限视觉输入生成3D场景资产的新方法。其中一种方法Scene-SAM3D,将现有的单图像3D生成模型扩展到处理多个校准视图,在无需微调的情况下提高了一致性并减少了冗余。另一种方法解决了从徒手草图生成几何一致的多视图场景的挑战,这项任务由于草图输入的贫乏性而此前未被尝试过。后一种方法引入了一个新数据集,并使用专门的注意力适配器和新颖的监督损失,在真实感和几何一致性方面取得了显著改进。
-
新的无训练流水线推动3D点云分割技术发展
研究人员开发了一种新颖的无训练开放词汇3D点云分割流水线。该方法将冻结的3D视觉语言模型RegionPLC与冻结的可提示概念分割器SAM3配对。通过利用跨视图一致性,该流水线在ScanNet200基准测试上取得了显著的改进,而无需任何训练数据、3D标签,甚至少样本支持示例。与依赖广泛监督的最先进方法相比,该方法显著弥补了性能差距。
-
DINO-SLAM 增强了 SLAM 系统中的神经表示
研究人员开发了 DINO-SLAM,一种将 DINO 特征集成到同时定位与地图构建 (SLAM) 系统中的新方法。该方法旨在通过利用 DINO 的语义理解来改进隐式 (NeRF) 和显式 (Gaussian Splatting) 表示。为了解决 DINO 在 3D 几何理解方面的局限性,该系统采用场景几何编码器来创建具有几何感知的 DINO 特征,从而增强对空间关系的理解。与现有的最先进方法相比,DINO-SLAM 在 Replica…
-
G2SR 方法提供快速、内存高效的 3D 表面重建
研究人员开发了 G2SR,一种使用基于高斯的 3D 表面重建技术的新型快速且内存高效的方法。与需要大量计算资源现有的端到端神经网络方法不同,G2SR 利用轻量级神经网络前端进行 2D 样条检测和用于 3D 三角化的分析后端。这种混合方法在 ScanNet 和 Replica 等基准数据集上实现了与最先进方法相当的几何精度,同时大大减少了内存占用并提高了重建速度。
-
AI系统Holi-Spatial无需人工输入即可从2D视频生成3D标注
中国研究团队开发了Holi-Spatial,一个无需人工干预即可从普通2D视频自动生成3D空间数据标注的AI系统。该系统绕过了对激光雷达扫描仪等昂贵硬件的需求以及手动3D边界框标注的劳动密集型过程。Holi-Spatial利用一个包含几何优化、大型语言模型的图像级感知以及场景级精炼的三阶段流程来创建结构化3D数据,解决了该领域长达十年的瓶颈。
-
MAC-Splat 框架增强了稀疏视图的 3D 重建
研究人员推出 MAC-Splat,一个新颖的训练框架,旨在提高从稀疏相机视图进行 3D 场景重建的保真度。该方法解决了现有 3D Gaussian Splatting 技术中的局限性,这些技术由于 2D 光度监督不足而经常产生几何伪影。MAC-Splat 利用几何骨干网络和预训练的 DINOv3 编码器来提取语义丰富的 2D 对应关系,这些对应关系随后作为直接 3D 一致性监督的锚点。该框架强制执行多个 3D 属性(如位置、形状和外观…
-
新的WARM模块增强了少样本3D点云分割能力
研究人员开发了一种名为白化聚合与恢复模块(WARM)的新方法,以改进少样本3D点云语义分割。该技术解决了现有依赖最远点采样生成原型的方法存在的性能不稳定性问题。WARM利用注意力机制结合白化和着色变换,创建更鲁棒的原型,能够准确捕捉有限标记数据中的语义关系。该模块在S3DIS数据集上取得了最先进的结果,并在ScanNet上表现出竞争力。
-
REMIND追踪器在室内物体重新识别方面实现了90%的IDF1
研究人员开发了REMIND,这是一种新颖的在线追踪器,用于使用单目RGB图像对通用室内物体进行长期重新识别。该系统通过结合双银行外观记忆、空间上下文推理和模糊感知保护措施,克服了现有多种物体追踪和重新识别方法的局限性。REMIND在自定义室内数据集和ScanNet++上实现了最先进的性能,在身份一致性和对视角及光照变化的鲁棒性方面取得了显著改进。
-
REMIND系统通过记忆增强室内物体再识别
研究人员开发了REMIND,一个新颖的在线跟踪系统,用于使用单目RGB图像对通用室内物体进行长期再识别。REMIND通过集成双银行外观记忆、部件和背景级描述符以及邻域上下文推理模块,解决了显著的视角变化和光照变化等挑战。该系统实现了高性能,在自定义室内数据集上达到了90.35%的IDF1分数,并在ScanNet++上超越了现有基线,同时公开了其完整的系统、评估框架和数据集。
-
WanderDream 数据集使 AI 代理能够通过心智模拟进行推理
研究人员推出了 WanderDream,这是一个新颖的数据集和框架,旨在通过模拟仿真使 AI 代理能够进行情境推理。这种方法允许模型在不需要物理交互或现实世界探索的情况下,心智上探索未来轨迹并回答“假设”问题,而物理交互或现实世界探索可能受到安全或可行性的限制。该数据集包括全景视频和源自真实场景的问答对,证明了世界模型可以有效地进行心智探索,并且这种能力极大地有助于推理任务,有望迁移到现实世界的应用中。