PulseAugur
实时 20:39:17
实体 depth map

depth map

PulseAugur coverage of depth map — every cluster mentioning depth map across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_154644 ·

    MixDiffusion框架实现多条件文本到图像合成

    研究人员推出了MixDiffusion,一个新颖的框架,旨在通过允许同时集成多个控制条件来增强文本到图像生成。与通常仅限于单个条件(如边界框或关键点)的现有方法不同,MixDiffusion通过组合预训练的单条件扩散模型,理论上可以容纳任意数量的条件,包括草图、深度图和参考图像。这种无需训练的方法易于部署和扩展,并通过理论支持的集成公式从各个单条件模型的预测噪声分布中得出其预测噪声分布。

  2. RESEARCH · CL_131395 ·

    ProxyPose 使用视频到视频翻译进行 6-DoF 位姿跟踪

    研究人员开发了 ProxyPose,一种从单目视频跟踪物体和表面六自由度 (6-DoF) 位姿的新颖方法。该方法将问题重新定义为视频到视频翻译任务,利用微调的视频扩散模型生成合成代理视频。通过分析此代理视频中已知物体的运动,ProxyPose 可以准确恢复原始表面的 6-DoF 轨迹。该技术无需 3D 模型或深度图等额外输入,展示了最先进的性能,并可扩展到面部跟踪和相机位姿估计等应用。

  3. RESEARCH · CL_99810 ·

    SpatialSV框架通过可解释的视觉监督增强MLLMs的3D空间感知能力

    研究人员推出SpatialSV,一个旨在增强多模态大语言模型(MLLMs)3D空间感知能力的新框架。与依赖外部工具或不透明特征蒸馏的现有方法不同,SpatialSV将此能力直接内化到模型中。它通过面向任务的视觉监督来实现这一点,指导MLLMs将2D视觉特征转换为显式的3D表示,如深度图、相机姿态和点云。此过程不仅提高了空间智能,还通过可视化和诊断模型内部空间知识提供了可解释性。

  4. RESEARCH · CL_36074 ·

    新框架解决开放词汇三维场景图生成问题

    两篇新的研究论文介绍了一种用于生成开放词汇三维场景图的新框架。第一篇RelWitness通过使用视觉-几何线索来验证对象之间的关系,解决了不完全监督的问题。第二种方法采用层级化、整体化的方法,从二维视觉证据锚定功能性边缘,并通过室内空间的时间图处理进行优化。这两种方法都旨在提高机器人和场景分析应用中三维场景理解的准确性和完整性。