PulseAugur
实时 07:47:55
实体 Visual Geometry Grounded Transformer

Visual Geometry Grounded Transformer

PulseAugur coverage of Visual Geometry Grounded Transformer — every cluster mentioning Visual Geometry Grounded Transformer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 12
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. TOOL · CL_223363 ·

    新方法基于3D视觉几何进行玻璃表面检测

    研究人员开发了一种新的玻璃表面检测(GSD)方法,将其置于3D视觉几何的框架下,超越了传统的2D外观线索。该方法利用视觉几何基础Transformer(VGGT)提取3D信息,并采用了一种新颖的玻璃检测头,其中包含用于光谱特征识别的频率自注意力模块(FSAM)和用于3D特征基础的几何基础块(GeGB)。所提出的方法在七个GSD基准测试中展示了最先进的性能,并显示出对视频和多模态数据的泛化能力有所提高。

  2. TOOL · CL_219040 ·

    新的机器人控制框架整合视觉与本体感觉

    研究人员开发了 VGGT-DP,一个集成了来自3D感知模型的几何先验知识与本体感觉反馈的新型机器人视觉运动策略框架。该方法旨在提高机器人操作技能的空间理解能力和泛化能力。VGGT-DP 利用视觉几何基础Transformer (VGGT),并引入了由本体感觉引导的学习策略,以使感知与机器人内部状态对齐,从而增强闭环控制。该框架还采用了逐帧标记重用和随机标记剪枝技术,以降低推理延迟并提高策略的鲁棒性。

  3. TOOL · CL_216165 ·

    新的多视图对抗攻击目标是3D视觉模型

    研究人员开发了MVAP-G,一种用于生成多视图对抗性扰动的新方法,专门用于攻击基于视觉几何的Transformer (VGGT)。这项新技术允许在单次前馈传递中跨多个图像视图创建一致的、不易察觉的扰动,克服了先前对抗攻击方法的局限性。实验表明,MVAP-G在推理过程中无需迭代优化即可显著降低VGGT的3D重建性能,凸显了3D视觉基础模型中存在的关键安全漏洞。

  4. TOOL · CL_187498 ·

    新研究利用多视图几何先验增强3D重建

    一篇新研究论文探讨了如何通过整合几何先验来提高3D高斯溅射(3DGS)的3D重建质量。该研究调查了将几何先验(特别是预测的法线图和深度图)整合到3DGS框架中。研究发现,来自Visual Geometry Grounded Transformer (VGGT)等模型的**多视图**预测优于**单视图**替代方案,尤其是在与能够适当加权预测的置信度图结合使用时。在标准基准测试上的实验表明,重建质量得到了一致的改进,尤其是在具有镜面反射物…

  5. TOOL · CL_167772 ·

    新框架实现无标定3D多摄像头人员跟踪

    研究人员开发了一种新颖的、面向室内环境的无标定3D多摄像头人员跟踪框架。该系统集成了多个深度学习模型,包括用于检测的YOLOX、用于跟踪的BoT-SORT、用于外观嵌入的OsNet以及用于几何重建的Visual Geometry Grounded Transformer。通过直接从视觉数据推断3D结构并采用姿态引导的3D提升策略,该框架消除了对精确摄像头标定的需求,而这在以往的方法中是一个主要的瓶颈。在AI City Challeng…

  6. RESEARCH · CL_156614 ·

    新方法使用潜在空间流匹配增强3D场景生成

    研究人员开发了一种名为潜在黎曼流匹配的新方法,以改进使用几何基础模型的3D场景生成。该技术在Visual Geometry Grounded Transformer (VGGT)等模型的潜在空间内运行,能够从稀疏输入生成更合理的几何形状。通过在超球体乘积流形上定义黎曼流匹配框架,该方法尊重VGGT的潜在几何特性,在RealEstate10K、ScanNet++和ETH3D等数据集上优于现有的场景生成基线。

  7. TOOL · CL_133660 ·

    EventVGGT框架通过跨模态蒸馏增强深度估计

    研究人员开发了EventVGGT,一个新颖的用于事件单目深度估计的框架,该框架解决了密集深度标注稀缺的问题。该方法通过将事件流视为连贯的视频序列,利用来自视觉基础模型(VFMs)的跨模态蒸馏,从而捕获时间连续性和先验知识。该框架采用三级蒸馏策略,包括跨模态特征混合、时空特征蒸馏和时间一致性蒸馏,以提高深度预测的准确性和时间一致性。实验表明,EventVGGT的性能显著优于现有方法,在EventScape数据集上将30米处的绝对平均深度…

  8. TOOL · CL_104009 ·

    RegimeVGGT通过分层压缩加速3D场景重建

    研究人员开发了RegimeVGGT,一种提高视觉几何基础Transformer(VGGT)在3D场景重建中效率的方法。与之前应用统一计算缩减的方法不同,RegimeVGGT使用针对不同网络层特定需求的量身定制的分层压缩。这种方法可以保护显著的token并保留姿态估计的关键信息,从而在不牺牲重建质量的情况下显著提高速度。

  9. TOOL · CL_97682 ·

    RegimeVGGT 通过逐层压缩加速三维场景重建

    研究人员开发了 RegimeVGGT,一种加速视觉几何基础 Transformer (VGGT) 进行三维场景重建的新方法。通过分析逐层的计算需求,RegimeVGGT 应用了有针对性的压缩技术,包括显著性引导合并和选择性下采样,以在不牺牲重建质量的情况下减少冗余。该方法比原始 VGGT 实现了 6.7 倍的加速,使得密集三维场景结构恢复更具可扩展性。

  10. RESEARCH · CL_93076 ·

    新的MVM-IOD数据集评估工业环境中的三维重建

    研究人员推出了机器视觉计量工业对象数据集(MVM-IOD),这是一个旨在评估工业环境中三维重建和相机位姿估计方法的新基准。该数据集使用机器人安装的相机对工业对象进行系统性图像捕获,为18个场景提供参考相机位姿和三维点云。使用MVM-IOD进行的初步评估表明,当前的前馈方法在处理分布外图像时可能产生次优结果,这提示在某些工业任务中应用这些方法时应谨慎。

  11. TOOL · CL_49030 ·

    新的FGQ方法大幅缩小了视觉几何Transformer模型尺寸

    研究人员开发了一种新的训练后量化方法,称为Fisher引导量化(FGQ),以减少视觉几何基础Transformer(VGGT)的内存和计算开销。这些模型用于3D视觉任务,如深度估计和相机姿态预测,拥有数十亿个参数,阻碍了在设备上部署。FGQ通过使用Fisher信息矩阵来指导量化过程并保留关键组件,解决了模型不同部分在不同任务上对量化误差的敏感度差异问题。

  12. RESEARCH · CL_11350 ·

    超越高斯瓶颈:视觉 Transformer 特征空间的拓扑对齐编码

    研究人员开发了一种名为 S$^2$VAE 的新潜在学习框架,旨在改进视觉世界模型中 3D 几何和相机动力学的表示。该方法采用几何优先视角,专注于压缩场景的潜在 3D 状态(包括相机运动和深度),而不仅仅是外观。通过采用一种在瓶颈中具有超球体结构的新型变分自编码器,S$^2$VAE 旨在高压缩率下保留方向和几何语义,在深度估计和姿态恢复等任务中表现优于传统高斯瓶颈。