PulseAugur
实时 22:10:31
中文(ZH) 机器人视觉迎来新突破!蚂蚁灵波空间感知模型LingBot-Depth 2.0正式发布

蚂蚁集团凌波发布具身AI模型套件,包括世界动作和视频生成

蚂蚁集团凌波科技发布了一系列旨在推进具身AI和机器人技术的新模型。LingBot-VA 2.0被呈现为首个具身原生世界动作模型,从根本上为物理世界交互而设计,而非改编数字世界模型。与之相辅的是LingBot-World 2.0,一个能够进行长达一小时生成的实时交互式世界模型,并整合了AI代理机制以实现动态交互。此外,LingBot-Video,一个基于MoE的视频生成模型,针对具身AI任务进行了优化,在机器人基准测试中表现优于现有模型。该公司还推出了LingBot-Depth 2.0和LingBot-Vision,以增强机器人的空间感知和视觉表示能力。 AI

影响 这些发布推进了具身AI的能力,有可能加速更复杂、能够进行现实世界交互和任务执行的机器人的开发和部署。

排序理由 蚂蚁集团凌波科技发布多个前沿实验室模型(世界动作、世界模型、视频生成、空间感知)。

在 量子位 (QbitAI) 阅读 →

AI 生成摘要 · Google Gemini · 来自 24 个来源。 我们如何撰写摘要 →

蚂蚁集团凌波发布具身AI模型套件,包括世界动作和视频生成

报道来源 [24]

  1. 量子位 (QbitAI) TIER_1 中文(ZH) · 量子位的朋友们 ·

    业界首个具身原生世界动作模型来了!蚂蚁灵境发布灵境灵智-VA 2.0

  2. 量子位 (QbitAI) TIER_1 中文(ZH) · 量子位的朋友们 ·

    世界模型首次实现“小时级”生成!蚂蚁灵玎开源灵玎-世界2.0,支持AI原生多人交互

  3. 量子位 (QbitAI) TIER_1 中文(ZH) · 量子位的朋友们 ·

    蚂蚁灵境开源 LingBot-Video,全球首个具身视频大模型来了!

  4. 量子位 (QbitAI) TIER_1 中文(ZH) · 量子位的朋友们 ·

    机器人视觉迎来新突破!地地柏柏空间感知模型 LingBot-Depth 2.0 正式发布

  5. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    业界首个具身原生世界动作模型来了!蚂蚁灵境发布灵境灵机-VA 2.0

    <p>7 月 10 日,蚂蚁灵波发布业界首个具身原生世界动作模型 LingBot-VA 2.0。该模型的发布,标志着机器人基础模型正式从“基于数字世界模型构建”到“面向物理世界原生设计”的关键转变。它代表了具身智能发展的一种关键路线选择:机器人“大脑”不再依托数字世界模型能力的“嫁接”,而是从动态建模、因果预测、实时执行等与环境交互的原始需求出发,进行原生设计。</p><p>&nbsp;</p><p>得益于具身原生架构,LingBot-VA 2.0在真机测试中表现出了出色的执行速度和泛化能力。以下面这个视频为例,在不依赖任何外部拍摄设备的情况下,机器人就…

  6. 36氪 (36Kr) TIER_1 中文(ZH) ·

    蚂蚁集团发布LingBot-VA 2.0

    36氪获悉,7月10日,蚂蚁灵波发布业界首个具身原生世界动作模型LingBot-VA 2.0。它代表了具身智能发展的一种关键路线选择:机器人“大脑”不再依托数字世界模型能力的“嫁接”,而是从动态建模、因果预测、实时执行等与环境交互的原始需求出发,进行原生设计。

  7. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    中国机器人大脑扬帆出海,蚂蚁灵翺全栈2.0模型定义具身智能“新大脑”

    <p>7月9日,中国AI创新力量再次引发全球关注。</p><p>中国具身智能公司——蚂蚁灵波科技升级全栈大脑2.0,一口气发布了涵盖视觉、动作、操作以及物理预测等方向的具身智能大模型,在海外开发者社区掀起热潮,发布即登上海外社交媒体热榜。</p><p style="text-align: center;"><img src="https://static.leiphone.com/uploads/new/images/20260709/6a4f3b437431c.png?imageView2/2/w/740" /></p><p style="text-a…

  8. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    蚂蚁灵翺开源 LingBot-Video,全球首个具身视频大模型来了!

    <p>&nbsp;</p><p>7 月 9 日,蚂蚁灵波开源&nbsp;LingBot-Video,这是全球首个基于 Mixture-of-Experts(MoE)架构、面向具身智能的开源视频生成基础模型。该模型围绕机器人和具身智能的核心需求重新设计视频预训练范式,在推理效率、物理合理性、动作理解和任务完成度等方面取得系统性提升,为视频基础模型从数字内容创作走向具身智能提供了新的开源底座。</p><p>&nbsp;</p><p>在北京大学联合字节跳动发布的基准&nbsp;RBench&nbsp;上,LingBot-Video 的总分是 0.620,超越了…

  9. 36氪 (36Kr) TIER_1 中文(ZH) ·

    蚂蚁灵境科技开源实时交互世界模型 LingBot-World 2.0

    36氪获悉,蚂蚁灵波科技宣布开源新一代实时交互世界模型LingBot-World 2.0。该模型全面升级世界预测与交互能力,支持小时级实时生成、720p/60fps高清实时输出以及更丰富的交互动作与事件,并在业界首次将Agent机制引入世界模型。LingBot-World 2.0不仅可广泛应用于游戏内容生成、影视预演、虚拟仿真、数字孪生等场景,同时支持机器人与具身智能训练场景。

  10. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    官宣!蚂蚁“凌波”大模型2.0登场,小时级生成+Agent驱动定义AI交互新范式

    <p>7&nbsp;月&nbsp;9&nbsp;日,蚂蚁灵波科技开源新一代实时交互世界模型&nbsp;LingBot-World 2.0(又称&nbsp;LingBot-World-Infinity)。该模型全面升级世界预测与交互能力,支持小时级实时生成、720p/60fps&nbsp;高清实时输出以及更丰富的交互动作与事件,并在业界首次将&nbsp;Agent&nbsp;机制引入世界模型,让生成的世界从“可观看、可操控”,进一步走向“可持续互动、可动态变化”。&nbsp;</p><p style="text-align: center;"><img s…

  11. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    蚂蚁灵翺开源 LingBot-Video,全球首个具身视频大模型来了!

    <p>7&nbsp;月&nbsp;9&nbsp;日,蚂蚁灵波开源&nbsp;LingBot-Video,这是全球首个基于&nbsp;Mixture-of-Experts(MoE)架构、面向具身智能的开源视频生成基础模型。该模型围绕机器人和具身智能的核心需求重新设计视频预训练范式,在推理效率、物理合理性、动作理解和任务完成度等方面取得系统性提升,为视频基础模型从数字内容创作走向具身智能提供了新的开源底座。</p><p>在北京大学联合字节跳动发布的基准&nbsp;RBench&nbsp;上,LingBot-Video&nbsp;的总分是&nbsp;0.620…

  12. 36氪 (36Kr) TIER_1 中文(ZH) ·

    蚂蚁灵境具身基础模型LingBot-VLA 2.0开源

    7月8日,蚂蚁灵波科技宣布升级并开源新一代具身基座模型LingBot-VLA 2.0。作为今年1月开源版本LingBot-VLA 1.0的全面升级,LingBot-VLA 2.0在预训练阶段融入6万小时高质量真实物理数据,覆盖17个主流机器人品牌的20种机器人构型,并扩展对头部、腰部、末端执行器及移动底盘等自由度的支持。在构型泛化、自由度支持和落地效率等方面实现显著提升。

  13. 雷峰网 (Leiphone) TIER_1 中文(ZH) ·

    Robotic Vision 迎来新突破!蚂蚁凌波空间感知模型 LingBot-Depth 2.0 正式发布

    <p>7月7日,蚂蚁集团旗下具身智能公司灵波科技发布空间感知模型 LingBot-Depth 2.0。该模型基于 1.5 亿规模数据进行训练,在边缘清晰度、细小物体识别、远距离深度估计以及复杂场景鲁棒性等方面实现全面升级。</p><p>LingBot-Depth是灵波自研的空间感知模型,相当于机器人在物理世界的眼睛,1.0版解决了机器人看清透明、反光等复杂场景的空间感知难题。相比于LingBot-Depth 1.0,LingBot-Depth 2.0的训练数据从300万扩充至1.5亿规模,性能全面升级:在深度补全基准的16项测评中获得12 项第一;在最难…

  14. 36氪 (36Kr) TIER_1 中文(ZH) ·

    蚂蚁集团发布空间感知模型LingBot-Depth 2.0

    7月7日,蚂蚁集团旗下具身智能公司灵波科技发布空间感知模型LingBot-Depth 2.0。该模型基于1.5亿规模数据进行训练,在边缘清晰度、细小物体识别、远距离深度估计以及复杂场景鲁棒性等方面实现全面升级。此外,灵波还同步推出了LingBot-Depth 2.0的视觉基座模型——LingBot-Vision,构建起机器人从“看懂”到“看准”的能力链路,旨在应对机器人视觉在空间感知、精细识别和复杂环境适应等方面的核心挑战。

  15. Pandaily TIER_1 English(EN) · [email protected] (Pandaily) ·

    蚂蚁集团机器人子公司灵勃机器人另辟蹊径打造机器人大脑

    Ant Group robotics unit Lingbo develops robot intelligence platform leveraging Ant's massive payment ecosystem data, taking an unconventional approach to embodied AI development.

  16. MarkTechPost TIER_1 English(EN) · Asif Razzaq ·

    蚂蚁集团的Robbyant发布LingBot-VA 2.0:一款原生为物理AI构建的因果视频-动作模型

    <p>Ant Group's Robbyant has released the LingBot-VA 2.0 technical report — a Physical AI video-action foundation model built from scratch for embodiment rather than fine-tuned from a video generator. It predicts future states ahead of execution through Foresight Reasoning, re-gro…

  17. MarkTechPost TIER_1 English(EN) · Asif Razzaq ·

    Robbyant 发布 LingBot-VLA 2.0:一款开源 6B 视觉-语言-动作 (VLA) 模型,用于跨实体机器人操作

    <p>Ant Group's Robbyant has released LingBot-VLA 2.0, an Apache-2.0 vision-language-action model for cross-embodiment robot manipulation. The 6B checkpoint is pretrained on roughly 60,000 hours of data, spanning 50,000 hours of robot trajectories across 20 robot configurations an…

  18. MarkTechPost TIER_1 English(EN) · Asif Razzaq ·

    Robbyant 发布 LingBot-VLA 2.0:一个开源的 6B 视觉-语言-动作 (VLA) 模型,用于跨具身机器人操作

    <p>Ant Group's Robbyant has released LingBot-VLA 2.0, an Apache-2.0 vision-language-action model for cross-embodiment robot manipulation. The 6B checkpoint is pretrained on roughly 60,000 hours of data, spanning 50,000 hours of robot trajectories across 20 robot configurations an…

  19. MarkTechPost TIER_1 English(EN) · Asif Razzaq ·

    蚂蚁集团的Robbyant开源LingBot-Vision:一个1B参数的边界中心视觉基础模型,用于密集空间感知

    <p>Ant Group's Robbyant open-sourced LingBot-Vision, a self-supervised ViT family for dense spatial perception. Masked boundary modeling makes image boundaries a native training signal. The 1B backbone matches or surpasses larger models, and initializes LingBot-Depth 2.0.</p> <p>…

  20. Pandaily TIER_1 English(EN) · [email protected] (Pandaily) ·

    蚂蚁集团 LingBot-Vision 声称实现 12 项世界第一:11 亿参数模型超越 7B DINOv3

    Ant Group's LingBot-Depth 2.0 spatial perception model achieves 12 world-first benchmarks, with its 1.1B parameter LingBot-Vision foundation model surpassing Meta's 7B DINOv3.

  21. Mastodon — fosstodon.org TIER_1 English(EN) · [email protected] ·

    蚂蚁集团发布LingBot-VA 2.0,一款专为机器人原生构建的物理AI视频动作基础模型。该模型实现了225赫兹异步控制

    Ant Group has unveiled LingBot-VA 2.0, a Physical AI video-action foundation model built natively for robotics. The model achieves 225 Hz asynchronous control and 93.6% average success rate on robot manipulation tasks. https://www. marktechpost.com/2026/07/11/an t-groups-robbyant…

  22. Mastodon — fosstodon.org TIER_1 English(EN) · [email protected] ·

    蚂蚁集团AI部门Robbyant发布LingBot-World-Infinity,一个开放的因果世界模型,带有代理工具。该14B模型使用了混合...

    Robbyant, Ant Group's AI unit, has released LingBot-World-Infinity - an open causal world model with an agentic harness. The 14B model uses a mixture of bidirectional and autoregressive attention to solve long-horizon drift. A 1.3B variant runs on a single GPU. https://www. markt…

  23. Mastodon — fosstodon.org TIER_1 English(EN) · [email protected] ·

    蚂蚁集团开源LingBot-Vision,一款10亿参数的机器人视觉模型,将物体边界视为原生训练信号,性能媲美或超越了现有模型

    Ant Group has open-sourced LingBot-Vision, a 1B vision model for robotics that treats object boundaries as a native training signal. It matches or surpasses models 7x larger on spatial perception tasks. Available on Hugging Face under Apache-2.0. https://www. marktechpost.com/202…

  24. r/LocalLLaMA TIER_1 English(EN) · /u/Simple_Response8041 ·

    蚂蚁集团发布 LingBot-Vision:四种尺寸的 DINO 系列视觉骨干网络,0.3B 的 ViT-L 在 NYUv2 深度任务上媲美 DINOv3-7B,参数量减少约 23 倍

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1up47qv/ant_group_released_lingbotvision_dinofamily/"> <img alt="Ant Group released LingBot-Vision: DINO-family vision backbones in 4 sizes, and the 0.3B ViT-L matches DINOv3-7B on NYUv2 depth with ~23x fewer …