LingBot-VA
PulseAugur coverage of LingBot-VA — every cluster mentioning LingBot-VA across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
RIFT 方法通过移除迭代视频推出,将机器人动作延迟削减
研究人员开发了 RIFT(Rollout-free Imagination via Future Tokens),一种用于世界动作模型(WAMs)的新颖方法,通过消除迭代视频推出显著降低了延迟。通过使用学习到的预期令牌在单次传递中构建未来的键/值缓存,RIFT 在机器人任务上保持了高成功率。这种方法在实现与传统的基于推出(rollout-based)的方法相当的性能的同时,大幅缩短了动作块(action-chunk)的延迟,并在 LI…
-
新的FBFM机制通过实时纠错增强机器人控制
研究人员推出了一种新颖的无训练机制FBFM,旨在提高世界-动作模型(WAMs)在长时程机器人控制任务中的可靠性。这种异步反馈方法将重新接地集成到主动生成的动作块中,而不仅仅是在块边界。通过使用先前的动作和后续的真实世界观察来指导下一个动作和帧的生成,FBFM在更精细的时间粒度上纠正错误,增强了对意外事件的响应能力,并减少了预测漂移。在LIBERO和RoboTwin2.0任务上对DreamZero和LingBot-VA WAMs的评估显…
-
新的QuantWAMs框架优化世界动作模型以实现高效部署
研究人员开发了QuantWAMs,一个用于量化世界动作模型(WAMs)的新颖框架,以提高其部署效率。与以前的方法不同,QuantWAMs根据模型的结构、部署分布和任务目标来校准量化决策。这种方法引入了共享基数异常值校准、联合训练目标显著性以及固定干预部署审计的策略。在包括真实机器人操作任务在内的各种基准测试上的评估表明,QuantWAMs在保持接近全精度模型的性能的同时,显著减少了内存使用并提高了速度。
-
HiFi-UMI系统为操纵策略生成高保真无机器人数据
研究人员开发了HiFi-UMI,一个用于生成高保真无机器人数据以训练操纵策略的新颖系统。该系统旨在通过提高用户生成数据的质量,消除训练后阶段对真实机器人遥操作的需求。实验表明,仅在HiFi-UMI数据上训练的策略,其性能与在真实机器人数据上训练的策略相当,在精确任务上取得了高成功率。该项目还发布了HiFi-UMI-2K,一个用于机器人研究社区的大型同步超宽视场演示数据集。
-
中国研究人员主导 RSS 2026 机器人会议的各个环节
第22届机器人学习会议(RSS 2026)在澳大利亚悉尼拉开帷幕,中国研究人员表现强劲。首日会议聚焦于操作和世界模型方面的口头报告,突出了机器人在数据效率、触觉感知和内存增强系统方面的进展。值得注意的是,这些会议上展示的论文中有相当一部分作者是中国人,这凸显了中国在具身智能和机器人领域研究日益增长的影响力。
-
新方法利用可解释性增强世界动作模型的鲁棒性
研究人员开发了一种新方法来提高世界动作模型(WAMs)在分布变化下的鲁棒性。通过采用机制可解释性,他们发现一些WAM架构对关键特征表现出线性可分性,从而能够进行无需训练的引导。这种方法催生了世界动作线性二次调节器(WA-LQR),这是一种能够提高对视觉噪声以及相机或夹具配置变化等各种扰动鲁棒性的控制器。WA-LQR在Cosmos-Policy和DiT4DiT等模型上展示了改进的性能,同时预测LingBot-VA的引导能力较弱。
-
LingBot-VA 2.0:面向通用机器人控制的新基础模型
研究人员推出 LingBot-VA 2.0,这是一款专为物理环境中的机器人控制设计的新型视频-动作基础模型。与从数字内容生成改编而来的模型不同,LingBot-VA 2.0 采用语义视觉-动作分词器,以提高指令遵循和动作精度。它还利用因果预训练范式来防止灾难性遗忘,并采用稀疏专家混合(MoE)骨干网络以实现高效高频推理。该模型在现实世界部署中验证了其实时闭环控制能力,在复杂操作任务中展示了强大的少样本泛化能力。
-
LeRobot v0.6.0 增加了世界模型、新的 VLA 和改进的数据集
LeRobot v0.6.0 已发布,在机器人 AI 领域取得了重大进展。此次更新引入了 VLA-JEPA、FastWAM 和 LingBot-VA 等新的世界模型策略,使机器人能够“想象”未来的场景。它还通过 GR00T N1.7 和 MolmoAct2 等多个新的视觉-语言-动作 (VLA) 模型扩展了模型库,并引入了用于奖励模型的新 API。数据集管道的增强功能包括更快的加载和深度支持,以及新的模拟基准和改进的训练能力。
-
新研究推进自动驾驶和机器人领域的世界行动模型
两篇新研究论文介绍了世界行动模型(WAMs)的先进方法,这对于模拟未来环境变化和规划行动至关重要,尤其是在自动驾驶和机器人领域。第一篇论文 ReWorld 专注于通过直接优化中间表示来改进 WAMs 中的表示学习,以实现更好的视频生成和规划。第二篇论文 DIM-WAM 通过整合多样化的历史事件记忆来增强 WAMs,以处理长时任务,显著提高了机器人操作场景下的性能。
-
Next Forcing 框架提升视频生成速度和准确性
研究人员推出了一种名为“Next Forcing”的新型多块预测框架,旨在增强自回归视频生成。该方法通过提供关于未来动态的明确信号来解决当前模型的局限性,从而实现更快的训练收敛和更高的准确性,尤其是在高帧率下。该框架还加速了推理,并展示了在生成的视频中更好地遵守物理定律。
-
Flash-WAM 为世界动作模型实现 23 倍的推理加速
研究人员开发了 Flash-WAM,一个显著加快推理时间的世界动作模型新框架。传统模型需要许多去噪步骤,使得实时控制变得困难。Flash-WAM 采用模态感知步长蒸馏技术,适应视频和动作流独特的噪声特性。这使得单步推理过程成为可能,在 NVIDIA L40S 硬件上将延迟从 8 秒以上降低到 350 毫秒以下,提高了 23 倍。
-
蚂蚁集团 LingBot-VA 机器人控制模型被 RSS 2026 录用
蚂蚁集团的 LingBot-VA,一个用于机器人控制的因果世界建模框架,已被顶级的 Robotics: Science and Systems (RSS) 2026 会议录用。该框架使机器人在行动前就能预测环境变化,模仿人类的观察、判断和行动。LingBot-VA 采用了 Mixture-of-Transformers 架构,并在模拟和真实机器人任务中展现了高成功率,显示出强大的数据效率和泛化能力。该研究旨在推动机器人从简单的指令执行…