monocular depth estimation
PulseAugur coverage of monocular depth estimation — every cluster mentioning monocular depth estimation across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
OpenAI 声称在 AI 新闻汇总中解决了纳维-斯托克斯方程 · 追踪 3 个来源
据报道,OpenAI 已找到纳维-斯托克斯方程(一个长期存在的数学难题)的解。这一进展在 AI 社区引发了广泛讨论和一些争议。此外,Hugging Face 发布了一篇关于 Marigold V2 的论文,这是一种用于单目深度估计的扩散 Transformer 模型,而 AWS 更新了其 SageMaker Feature Store,引入了用于特征级写入的 UpdateRecord API。
-
新的arXiv论文总结了深度估计的进展并引入了新颖的扩散模型
两篇新的arXiv论文探讨了单目深度估计的进展,这是一项基础的计算机视觉任务。第一篇论文对该领域进行了全面调查,追溯了其从早期方法到像DINOv3这样的基础模型的影响及其在机器人和自动驾驶等领域的应用。第二篇论文介绍了Lapis,一个利用线性注意力和像素空间扩散实现高效、高保真度深度估计的新颖框架,以显著缩短的推理时间实现了最先进的准确性。
-
GeoNeXt 使用视频模型进行高效几何估计 · 已追踪 2 个来源
研究人员开发了 GeoNeXt,一个新颖的框架,它将预训练的视频生成模型重新用于几何估计任务,如深度和表面法线预测。通过将问题表述为下一帧预测,GeoNeXt 可以从最少的标记数据中高效学习,利用视频模型中固有的知识。该方法在零样本单目深度和表面法线估计方面表现出色,甚至可以与使用更多训练数据的最先进的判别方法相媲美。
-
新数据集和轻量级模型推动单目深度估计发展
研究人员正在开发用于单目深度估计的新方法和数据集,这项技术对于增强现实和虚拟现实等应用至关重要。新的数据集(如MODEST)正在被创建,以提供高分辨率的真实世界图像,捕捉复杂的视觉效果,从而解决当前训练数据的局限性。同时,在轻量级神经网络架构和专为资源受限设备设计的主动学习框架方面也取得了进展,旨在提高在动态环境中的适应性和性能。
-
新方法增强了在挑战性场景中的单目深度估计
研究人员开发了新的方法来提高在具有挑战性的视觉场景中的单目深度估计(MDE)。一种方法 CapDepth,利用详细的长标题来指导深度解码,在非朗伯表面和恶劣天气下实现了显著的误差降低。另一种方法侧重于通过约束梯度域的预测和在训练期间采用随机色调映射增强来增强非朗伯表面的 MDE 鲁棒性。
-
新的GAINS框架使用基础模型进行稀疏视图正向渲染
研究人员开发了GAINS,一个新颖的两阶段正向渲染框架,它利用基础模型来改进从稀疏多视图捕获中估计的材质和几何。该方法通过整合单目深度、法线和用于几何精炼的扩散先验,然后进行分割、内在图像分解和用于材质恢复的扩散先验,来稳定过程。实验表明,GAINS显著提高了材质参数、重新照明和新视图合成的准确性,特别是在传统方法难以处理歧义的稀疏视图场景中。
-
合成雾管道减少了自动驾驶汽车物体检测的数据需求
研究人员开发了Clear2Fog (C2F),一个基于物理的管道,用于生成合成雾以训练物体检测模型。该方法旨在通过解决真实世界雾天数据稀缺的问题来提高自动驾驶汽车的安全性。C2F集成了单目深度估计和新颖的大气光估计,以创建物理上一致的合成雾,减少伪影和偏差。一项使用Waymo开放数据集进行的广泛研究表明,在较低规模下使用不同雾密度进行训练,可以达到在较大固定密度数据集上训练的模型的性能,从而将合成数据需求减少25%。
-
AsyncMDE 系统赋能机器人实时深度估计
研究人员开发了 AsyncMDE,一个专为边缘平台机器人感知设计的实时单目深度估计新系统。该系统利用一个冻结的基础模型进行高质量特征提取,以及一个轻量级的异步快速路径,通过重用这些特征来实现高推理速度。AsyncMDE 旨在通过将基础模型的处理分摊到一段时间内来降低深度估计的计算成本,从而能够高效地部署在 Jetson AGX Orin 等设备上。
-
新的蒸馏方法增强了车辆碰撞规避AI性能
研究人员开发了一种实例感知知识蒸馏框架,以改进碰撞规避系统的半监督学习。该方法通过结合教师模型的领域先验知识和基础模型的实例中心知识来生成伪标签,旨在降低边缘部署的标注成本和计算需求。由此产生的轻量级学生模型可以实时执行多种密集预测任务,例如实例分割和单目深度估计,在分割方面优于较大的教师模型,同时保持深度估计的性能。该系统已在乡村俱乐部环境中使用自定义数据集和低成本边缘设备进行了验证。
-
新型“SLASH”攻击利用镜头划痕进行对抗性视觉攻击
研究人员发现了一种新型物理对抗攻击,称为SLASH(Scratch-induced Lens Adversarial Streak Hijacking,划痕诱导镜头对抗条纹劫持)。该攻击利用相机镜头或保护盖上的微小划痕,在与光源相互作用时会产生结构化的条纹伪影,从而扭曲深度信息。由于损坏是固定的,因此攻击具有持久性;但由于其由特定场景条件触发,因此具有选择性,会导致单目深度估计和3D物体检测出现重大错误。
-
Depth2Pose基准使用相机姿态评估单目深度模型
研究人员推出了一种新的单目深度估计模型评估基准Depth2Pose。该框架基于相机姿态估计的准确性来评估深度质量,这对于视觉定位和SLAM等下游任务来说是一个更实用的指标。与需要昂贵的逐像素深度数据的传统方法不同,Depth2Pose利用了易于获得的相机姿态,从而可以在难以获取真实深度图的挑战性环境中进行评估。配套的D2P数据集包含现有训练数据典型分布之外的场景,突显了当前模型潜在的泛化问题。