MapAnything
PulseAugur coverage of MapAnything — every cluster mentioning MapAnything across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的PrePARE方法大幅降低多视图几何Transformer的内存使用量
研究人员开发了PrePARE,一种通过在Token进入交替注意力(AA)堆栈之前对其进行剪枝来优化多视图几何Transformer的新颖方法。这种方法显著减少了内存使用量并提高了处理速度,使得像VGGT和MapAnything这样的复杂模型可以在性能较低的硬件上运行。PrePARE通过仅训练一个Token Scorer和一个Feature-guided Restoration模块来实现这一点,而核心AA堆栈保持冻结状态,在ScanNe…
-
新的G-ray编码在异构相机下改进了多视图视觉Transformer
研究人员开发了G-ray,一种新颖的射线级相对几何位置编码,专为多视图视觉Transformer设计。该方法通过使用相机局部射线角度参数化旋转相位来解决相机异构性带来的挑战,例如视场角或投影模型的变化。G-ray确保了投影不变的位置一致性,并且可以在不增加额外学习参数的情况下与现有编码集成。在3D重建和新视角合成基准上的评估显示出显著的改进,包括在异构3D重建任务上平均点图相对误差降低了45.8%。
-
新的UAV3DCrop基准测试评估3D作物重建方法
引入了一个名为UAV3DCrop的新基准数据集,用于评估在农业环境中使用无人机进行的3D重建方法。该数据集包含来自91个不同作物场景的88,830张图像,以高分辨率和地面采样距离拍摄。它旨在测试神经辐射场和3D高斯溅射变体等场景优化方法,以及预训练的前馈模型,涵盖外观、深度和树冠高度恢复等不同指标。当前的3D重建技术在这些任务上的表现各不相同,表明没有一种方法对农学应用是普遍最优的,并且一些方法在度量尺度恢复方面存在困难。
-
MapAnything系统通过单张图像自动绘制城市资产地图
一篇新的研究论文介绍了一个名为MapAnything的系统,该系统旨在利用单目深度估计模型自动进行城市物体和事件的空间测绘。该框架通过计算物体的地理坐标,将估计的距离与几何原理和相机规格相结合,将二维图像数据转换为三维空间信息。该论文通过在城市环境中将其距离估计与高精度激光雷达点云进行比较,验证了MapAnything的准确性,展示了其在绘制交通标志和道路损坏等资产地图方面的实际应用,可用于自动城市库存系统。
-
新框架将3D重建模型适配到鱼眼镜头
研究人员开发了Fisheye3R,一个旨在适配现有3D重建基础模型以有效处理鱼眼镜头图像的新框架。这些模型通常在标准透视图像上训练,在遇到鱼眼镜头的高径向畸变时性能会下降。Fisheye3R使这些模型能够处理鱼眼输入,而不会影响在透视图像上的性能,即使鱼眼训练数据有限。实验表明,在VGGT-Ω、$\pi^3$和MapAnything等多个基础模型上,相机姿态、深度和点图估计均有所改进。
-
新的FlexDepth模型提供鲁棒、实时的驾驶深度估计 · 追踪4个来源
研究人员开发了FlexDepth,这是一系列新颖的自监督单目深度估计模型,专为复杂的驾驶环境设计。该方法解决了现有模型在单尺度输出和在挑战性条件下性能下降方面的局限性,同时又过于复杂而无法用于汽车边缘设备。FlexDepth采用两阶段训练策略来解耦静态和动态元素,并使用尺度驱动解码器根据尺度大小有效地融合特征,以最小的计算开销实现了最先进的结果。其最小的变体Flex-Nano在移动平台上运行速度为37.6 FPS,提供实时感知和强大的泛化能力。