VGGT-Ω
PulseAugur coverage of VGGT-Ω — every cluster mentioning VGGT-Ω across labs, papers, and developer communities, ranked by signal.
- developed Gotit.pub 90%
- developed Visual Geometry Grounded Transformer 90%
- used by Gotit.pub 70%
- instance of Visual Geometry Grounded Transformer 70%
- used by Visual Geometry Grounded Transformer 70%
- used by MASt3R 70%
- developed by Visual Geometry Grounded Transformer 70%
- instance of $\pi^3$ 70%
- instance of MASt3R 70%
- developed $\pi^3$ 70%
- developed MASt3R 50%
- affiliated with MASt3R 50%
- 2026-05-14 research_milestone Researchers introduced VGGT-Ω, a new model that improves scene reconstruction accuracy and efficiency. 来源
8 天有情绪数据
-
新方法基于3D视觉几何进行玻璃表面检测
研究人员开发了一种新的玻璃表面检测(GSD)方法,将其置于3D视觉几何的框架下,超越了传统的2D外观线索。该方法利用视觉几何基础Transformer(VGGT)提取3D信息,并采用了一种新颖的玻璃检测头,其中包含用于光谱特征识别的频率自注意力模块(FSAM)和用于3D特征基础的几何基础块(GeGB)。所提出的方法在七个GSD基准测试中展示了最先进的性能,并显示出对视频和多模态数据的泛化能力有所提高。
-
新的机器人控制框架整合视觉与本体感觉
研究人员开发了 VGGT-DP,一个集成了来自3D感知模型的几何先验知识与本体感觉反馈的新型机器人视觉运动策略框架。该方法旨在提高机器人操作技能的空间理解能力和泛化能力。VGGT-DP 利用视觉几何基础Transformer (VGGT),并引入了由本体感觉引导的学习策略,以使感知与机器人内部状态对齐,从而增强闭环控制。该框架还采用了逐帧标记重用和随机标记剪枝技术,以降低推理延迟并提高策略的鲁棒性。
-
新的多视图对抗攻击目标是3D视觉模型
研究人员开发了MVAP-G,一种用于生成多视图对抗性扰动的新方法,专门用于攻击基于视觉几何的Transformer (VGGT)。这项新技术允许在单次前馈传递中跨多个图像视图创建一致的、不易察觉的扰动,克服了先前对抗攻击方法的局限性。实验表明,MVAP-G在推理过程中无需迭代优化即可显著降低VGGT的3D重建性能,凸显了3D视觉基础模型中存在的关键安全漏洞。
-
新的 HTTM 方法将 3D 重建 Transformer 加速 7 倍
研究人员开发了面部时间令牌合并 (HTTM) 技术,这是一种旨在加速视觉几何基础 Transformer (VGGT) 模型的新颖技术。VGGT 是一个开创性的 3D 场景重建模型,能够单次通过推断相机姿态、深度和几何。然而,其全局注意力机制为大规模重建带来了延迟瓶颈。HTTM 通过基于单个注意力头合并令牌来解决此问题,保留特征独特性并利用时空相关性,在对性能影响最小的情况下将推理速度提高了七倍。
-
New GeoUP framework unifies 3D perception for autonomous driving
研究人员推出了一种新颖的统一3D感知框架GeoUP,用于自动驾驶,该框架利用摄像头数据。与以往常将3D几何视为下游任务的方法不同,GeoUP将度量3D结构直接整合到其共享表示中。这是通过跨图像注意力机制和感知标定的raymap编码实现的,使模型能够捕获显式的度量几何和一致的3D场景结构。GeoUP在多个基准数据集的深度估计、3D对象检测和语义占用预测方面均展现了最先进的性能。
-
新方法使用VGGT进行几何约束的密集语义匹配
研究人员开发了一种新的计算机视觉密集语义匹配方法,解决了现有方法在几何歧义和依赖最近邻规则方面的局限性。所提出的方法利用VGGT(一种几何约束特征模型)来改进同一类别实例之间的像素级对应关系。通过对VGGT进行微调、添加语义头以及采用具有合成数据增强的循环一致性训练策略,该方法展示了增强的几何感知能力和匹配可靠性。
-
GeoLink框架通过3D感知增强跨视图地理定位能力
研究人员开发了GeoLink,一个新颖的3D感知框架,旨在提高跨视图地理定位系统的泛化能力。该框架解决了由视角变化引起的严重语义不一致以及领域迁移下性能不佳的核心挑战,这些问题是现有2D对应方法经常遇到的。GeoLink利用离线重建的3D点云作为稳定的结构先验,通过一个几何感知语义细化模块和一个统一视图关系蒸馏模块来增强2D表示学习。实验表明,GeoLink在跨视图地理定位方面持续超越最先进的方法,尤其是在未见过的领域和多样的天气条件下。
-
新的Self-Geometry管道增强了3D视觉模型的一致性
研究人员开发了Self-Geometry,一种新颖的测试时适应管道,旨在增强3D视觉基础模型的几何一致性。该方法通过利用2D像素对应作为伪地面真实来直接施加显式的多视图几何约束,克服了先前依赖隐式自一致性方法的局限性。Self-Geometry集成了几何解耦优化、特定的视图采样器以及通过LoRA进行的轻量级适应,从而在多个模型和基准测试中提高了姿态和几何估计的性能。
-
新研究利用多视图几何先验增强3D重建
一篇新研究论文探讨了如何通过整合几何先验来提高3D高斯溅射(3DGS)的3D重建质量。该研究调查了将几何先验(特别是预测的法线图和深度图)整合到3DGS框架中。研究发现,来自Visual Geometry Grounded Transformer (VGGT)等模型的**多视图**预测优于**单视图**替代方案,尤其是在与能够适当加权预测的置信度图结合使用时。在标准基准测试上的实验表明,重建质量得到了一致的改进,尤其是在具有镜面反射物…
-
新模型使用自监督学习解开视频运动 · 跟踪到2个来源
研究人员开发了结构化动力学模型(SDM),这是一种通过解开相机运动和物体运动来理解视频中运动的新方法。这种自监督学习方法利用了预训练图像视觉变换器的冻结特征,并采用未来特征预测来区分主导的时间变化和残余动力学。SDM在新的ProbeMotion套件上进行了评估,与基线方法相比表现更优,表明预训练图像模型可以有效地适应结构化视频动力学表示。
-
UVFaceFusion 实现快速、拓扑一致的人脸重建
研究人员开发了UVFaceFusion,一个用于从多张图像中重建具有一致拓扑的高保真面部几何结构的新颖框架。该方法在规范UV空间中利用可学习的神经融合方法,取代了传统的拓扑优化。该系统在各种基准测试和真实场景捕获中实现了最先进的精度并具有良好的泛化能力,在RTX 4090上重建网格仅需不到三秒钟。
-
新方法使用潜在空间流匹配增强3D场景生成
研究人员开发了一种名为潜在黎曼流匹配的新方法,以改进使用几何基础模型的3D场景生成。该技术在Visual Geometry Grounded Transformer (VGGT)等模型的潜在空间内运行,能够从稀疏输入生成更合理的几何形状。通过在超球体乘积流形上定义黎曼流匹配框架,该方法尊重VGGT的潜在几何特性,在RealEstate10K、ScanNet++和ETH3D等数据集上优于现有的场景生成基线。
-
MuViSeg 推动多视图分割匹配,改进导航
研究人员开发了 MuViSeg,这是一种用于匹配多个图像视图中的分割的新方法,改进了依赖于成对比较的现有方法。该系统集成了学习到的匹配头,包括一种类似 LightGlue 的注意力机制以及一种支持同时对来自多个图像的分割进行联合自注意力的多视图扩展。当集成到 RoboHop 拓扑导航管道中时,MuViSeg 表现出显著的改进,成功率从 50% 提高到 70%,SPL 指标从 45.7 提高到 59.1,而无需重新训练。
-
VGGT 模型隐式学习共可见性以进行 3D 重建
研究人员开发了 Co-VGGT,一种利用 VGGT 几何基础模型来确定图像对之间共可见性的新方法。VGGT 在其内部表示中隐式编码共可见性,早期层构建场景表示,后期层充当共可见性推理器。Co-VGGT 冻结 VGGT 模型,并仅使用 RGB 输入训练一个小型、轻量级的头部来对共可见性进行分类,将每个 VGGT 层视为专业专家。这种方法显著提高了 Co-VisiON 基准的性能,优于先前的方法甚至人工标注基线。
-
新的 Co-VGGT 方法通过隐式共可见性检测增强 3D 重建 · 跟踪到 2 个来源
研究人员开发了 Co-VGGT,这是一种用于 3D 重建和机器人定位中确定共可见性的新方法。该方法利用 VGGT 基础模型,表明其内部表示在没有显式监督的情况下隐式编码了共可见性。Co-VGGT 利用在冻结的 VGGT 层之上训练的轻量级专家混合头,在 Co-VisiON 基准测试上取得了比先前工作显著的改进,并超越了人类标注基线。
-
新的运动恢复结构方法结合基础模型和深度先验以改进3D重建 · 跟踪到4个来源
两篇新的研究论文介绍了先进的运动恢复结构(SfM)重建方法。Glob3R利用3D基础模型并优化前馈几何预测,以实现鲁棒且准确的场景重建。DGSfM通过整合单目深度图作为先验来增强全局SfM,通过深度感知求解器和一致性检查来提高鲁棒性和姿态准确性。
-
EventVGGT框架通过跨模态蒸馏增强深度估计
研究人员开发了EventVGGT,一个新颖的用于事件单目深度估计的框架,该框架解决了密集深度标注稀缺的问题。该方法通过将事件流视为连贯的视频序列,利用来自视觉基础模型(VFMs)的跨模态蒸馏,从而捕获时间连续性和先验知识。该框架采用三级蒸馏策略,包括跨模态特征混合、时空特征蒸馏和时间一致性蒸馏,以提高深度预测的准确性和时间一致性。实验表明,EventVGGT的性能显著优于现有方法,在EventScape数据集上将30米处的绝对平均深度…
-
新的MECo-WAM模型通过4D几何先验增强机器人操作能力
研究人员开发了MECo-WAM,这是一种新颖的世界动作模型,旨在通过整合4D几何先验来增强机器人操作能力。该模型在不增加推理成本的情况下,将与动作相关的几何信息注入到视频-动作表示中。MECo-WAM采用多专家协同训练方法,包括一个轻量级的4D专家,并采用衰减的4D读掩码注意力和动作感知时间几何蒸馏等技术,以提高在LIBERO和RoboTwin 2.0等任务以及现实世界操作中的性能。
-
RayTun3R 将 3D 基础模型适配鱼眼相机
研究人员开发了 RayTun3R,一种将现有 3D 基础模型适配于鱼眼相机图像的新颖方法。这些模型通常在标准针孔相机上表现良好,但在处理鱼眼镜头提供的更宽视场时性能会显著下降。RayTun3R 通过对预训练模型中的轻量级组件(特别是与位置编码和预测网格坐标相关的组件)进行最小的调整来解决这个问题,同时保持核心网络不变。这种参数高效的方法,仅需要 10,752 个可训练参数,即可快速学习并应用于后续帧,而不会增加推理时间,从而显著降低了旋转误差。
-
新的视觉定位系统RIC-Loc绕过了场景训练
研究人员开发了RIC-Loc,一种新颖的视觉定位系统,不需要场景特定的训练或预先计算的3D地图点。该系统利用冻结的VGGT模型来预测相机姿态和轨迹,从参考点生成姿态假设。然后,这些假设被用来稳健地估计查询姿态并导出可靠性分数,从而有效地检测各种环境中的失败,包括低纹理区域。