PulseAugur
中
实时 17:44:00
实体 depth map

depth map

PulseAugur coverage of depth map — every cluster mentioning depth map across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_239530 ·

    新的DART预训练方法通过深度数据增强外科视觉模型

    研究人员开发了DART,一种新的外科视觉基础模型预训练方法,该方法在标准RGB图像之外还整合了深度图信息。这种方法建立在DINOv2架构之上,在预训练过程中使用像素空间的深度重建目标。DART方法在八个外科基准测试中表现出改进的性能,优于仅在RGB数据上训练的模型。

  2. TOOL · CL_216164 ·

    新的VisTa3D数据集旨在解决薄物体3D重建的挑战

    研究人员推出了VisTa3D,这是一个旨在改进薄物体3D重建的新型数据集和基准。目前的3D重建模型由于其有限的视觉和点云表示,在处理薄物体时面临困难。VisTa3D集成了同步的RGB图像、深度图和触觉响应图,以及来自激光扫描的惯性测量和地面真实数据。在VisTa3D上的初步基准测试显示现有模型保真度较低,而视觉-范围-触觉重建模型的引入则证明了触觉数据在提高重建精度方面的潜力。

  3. TOOL · CL_154644 ·

    MixDiffusion框架实现多条件文本到图像合成

    研究人员推出了MixDiffusion,一个新颖的框架,旨在通过允许同时集成多个控制条件来增强文本到图像生成。与通常仅限于单个条件(如边界框或关键点)的现有方法不同,MixDiffusion通过组合预训练的单条件扩散模型,理论上可以容纳任意数量的条件,包括草图、深度图和参考图像。这种无需训练的方法易于部署和扩展,并通过理论支持的集成公式从各个单条件模型的预测噪声分布中得出其预测噪声分布。

  4. RESEARCH · CL_131395 ·

    ProxyPose 使用视频到视频翻译进行 6-DoF 位姿跟踪

    研究人员开发了 ProxyPose,一种从单目视频跟踪物体和表面六自由度 (6-DoF) 位姿的新颖方法。该方法将问题重新定义为视频到视频翻译任务,利用微调的视频扩散模型生成合成代理视频。通过分析此代理视频中已知物体的运动,ProxyPose 可以准确恢复原始表面的 6-DoF 轨迹。该技术无需 3D 模型或深度图等额外输入,展示了最先进的性能,并可扩展到面部跟踪和相机位姿估计等应用。

  5. RESEARCH · CL_99810 ·

    SpatialSV框架通过可解释的视觉监督增强MLLMs的3D空间感知能力

    研究人员推出SpatialSV,一个旨在增强多模态大语言模型(MLLMs)3D空间感知能力的新框架。与依赖外部工具或不透明特征蒸馏的现有方法不同,SpatialSV将此能力直接内化到模型中。它通过面向任务的视觉监督来实现这一点,指导MLLMs将2D视觉特征转换为显式的3D表示,如深度图、相机姿态和点云。此过程不仅提高了空间智能,还通过可视化和诊断模型内部空间知识提供了可解释性。

  6. RESEARCH · CL_36074 ·

    新框架解决开放词汇三维场景图生成问题

    两篇新的研究论文介绍了一种用于生成开放词汇三维场景图的新框架。第一篇RelWitness通过使用视觉-几何线索来验证对象之间的关系,解决了不完全监督的问题。第二种方法采用层级化、整体化的方法,从二维视觉证据锚定功能性边缘,并通过室内空间的时间图处理进行优化。这两种方法都旨在提高机器人和场景分析应用中三维场景理解的准确性和完整性。