LingBot-Vision
PulseAugur coverage of LingBot-Vision — every cluster mentioning LingBot-Vision across labs, papers, and developer communities, ranked by signal.
- 2026-07-07 product_launch Ant Group's AI lab has open-sourced LingBot-Vision and LingBot-Depth 2.0, foundational models for embodied AI to improve robot spatial perception. 来源
-
蚂蚁集团开源LingBot-Vision,助力机器人更好地感知世界
蚂蚁集团AI实验室开源了专为具身AI设计的视觉大模型LingBot-Vision,以及基于它构建的空间感知模型LingBot-Depth 2.0。这些模型旨在显著提升机器人感知和理解物理环境的能力,尤其是在处理透明或反光物体、小目标或远距离目标以及复杂室内场景等挑战性环境中。LingBot-Vision的独特之处在于其预训练阶段专注于学习物体边界和空间结构,使其在参数量相对较少的情况下,仍能实现比其他大型视觉模型更高的准确率。
-
LingBot-Vision 使用掩码边界建模进行自监督预训练
研究人员推出了一种新的自监督预训练方法LingBot-Vision,该方法专注于掩码边界建模。这种方法通过迫使模型重建特定的边界区域而不是随机斑块来提高性能。在评估中,LingBot-Vision 在NYUv2线性探测中取得了0.296的RMSE,优于DINOv3-7B,但在ImageNet分类和ADE20K分割任务上表现落后。该方法提供的权重有四种尺寸,采用Apache-2.0许可证。
-
蚂蚁集团凌波发布具身AI模型套件,包括世界动作和视频生成
蚂蚁集团凌波科技发布了一系列旨在推进具身AI和机器人技术的新模型。LingBot-VA 2.0被呈现为首个具身原生世界动作模型,从根本上为物理世界交互而设计,而非改编数字世界模型。与之相辅的是LingBot-World 2.0,一个能够进行长达一小时生成的实时交互式世界模型,并整合了AI代理机制以实现动态交互。此外,LingBot-Video,一个基于MoE的视频生成模型,针对具身AI任务进行了优化,在机器人基准测试中表现优于现有模型…
-
蚂蚁集团子公司灵玢科技发布先进空间感知模型
蚂蚁集团旗下的具身智能公司灵玢科技发布了LingBot-Depth 2.0,这是一个基于1.5亿个数据点训练的空间感知模型。新模型在边缘清晰度、小物体识别、远距离深度估计和复杂场景鲁棒性方面都有显著提升。灵玢科技还推出了视觉基础模型LingBot-Vision,以补充LingBot-Depth 2.0,旨在增强机器人感知、精准识别和适应复杂环境的能力。
-
新的视觉预训练框架增强了密集空间感知和深度估计 · 跟踪3个来源
研究人员推出了一种新颖的、专注于边界建模以实现密集空间感知的自监督预训练框架 LingBot-Vision。该方法通过学习亚像素边界表示来增强深度估计,这是具身AI的关键组成部分。该框架已成功推动 LingBot-Depth 1.0 到 LingBot-Depth 2.0 的进步,并在各种下游视觉任务上展示了其可扩展性和有效性,以 DINOv3 作为基线。