depth estimation
PulseAugur coverage of depth estimation — every cluster mentioning depth estimation across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新数据集用极端镜面反射挑战AI视觉模型
发布了一个包含穿着高反射率镜面套装的机器人服装的新数据集,旨在挑战计算机视觉和深度估计算法。该数据集包含425张在户外环境中拍摄的RAW/JPEG图像,这些环境旨在因极端反射而导致边界框检测和分割失败。它包括专有的未压缩Camera-Master RAW文件、高分辨率JPEG文件以及法证清单,所有这些都可通过Mozilla Data Collective获取。
-
新的ROVR数据集旨在推进自动驾驶深度估计
研究人员推出ROVR,一个用于自动驾驶的新大规模深度数据集,旨在克服现有数据集(如KITTI和nuScenes)的局限性。ROVR包含200,000张高分辨率帧,涵盖北美、欧洲和亚洲的各种驾驶场景、天气条件和地理位置。该数据集的成本效益高的采集流程和公开支持工具旨在实现可扩展性和可重复性,从而能够对深度估计架构中的常见故障模式进行更稳健的模型训练和分析。
-
新框架 ReVISE 增强 MLLM 在视觉任务中的可靠性
研究人员开发了一个名为 ReVISE 的新框架,以提高多模态大型语言模型(MLLM)在使用外部工具进行视觉任务时的可靠性。该框架使 MLLM 能够验证对象检测和深度估计等工具的输出,并动态纠正错误。ReVISE 包括一个用于训练反思行为的精选数据集,并使用强化学习来鼓励内部反思并惩罚不匹配,从而在基准测试中取得持续改进。
-
GeoNeXt 使用视频模型进行高效几何估计 · 已追踪 2 个来源
研究人员开发了 GeoNeXt,一个新颖的框架,它将预训练的视频生成模型重新用于几何估计任务,如深度和表面法线预测。通过将问题表述为下一帧预测,GeoNeXt 可以从最少的标记数据中高效学习,利用视频模型中固有的知识。该方法在零样本单目深度和表面法线估计方面表现出色,甚至可以与使用更多训练数据的最先进的判别方法相媲美。
-
新方法整合深度学习中的偶然性和认知不确定性
研究人员开发了一种用于深度学习模型不确定性量化(UQ)的新方法,特别适用于高维输出空间。该方法联合建模偶然性不确定性(解释数据噪声)和认知不确定性(反映模型置信度)。通过用低秩加对角协方差结构近似联合不确定性,该方法在没有完整协方差矩阵的计算开销的情况下捕获了重要的输出相关性。这种统一的二阶分布支持稳健的下游分析,并在图像修复、着色、光流和深度估计等任务中展示了卓越的 UQ 性能。
-
新框架将RGB基础模型重新用于热深度估计
研究人员开发了RGB-HS,一个旨在通过利用基于RGB的基础模型来改进热图像深度估计的新框架。该方法利用分层监督,在RGB教师分支和热学生分支之间对多层表示进行对齐。该框架还包含一个验证步骤,通过根据图像质量对RGB token进行加权来优化对齐,从而在基准测试中取得有竞争力的性能。