World-Action Models
PulseAugur coverage of World-Action Models — every cluster mentioning World-Action Models across labs, papers, and developer communities, ranked by signal.
12 天有情绪数据
-
新的SCVC方法在无需摄像头数据的情况下增强了机器人视点鲁棒性
研究人员开发了一种名为选择性跨视图一致性(SCVC)的新方法,以提高世界动作模型(WAMs)在处理摄像头视点变化时的鲁棒性。传统的WAMs在处理视点扰动时会遇到困难,而SCVC通过仅将一致性损失应用于动作和本体感觉等视点不变的元素,而不是像预测场景等视点共变的元素来解决这个问题。这种方法在训练或测试期间不需要摄像头信息,在未见过的轨道视点上显示出闭环成功率的显著提高。
-
新的自动驾驶模型预测未来世界状态和动作 · 已追踪 2 个来源
研究人员开发了新的自动驾驶模型,专注于预测未来的世界状态和动作。WA-JEPA 模型(在一篇论文中提出)通过使用混合未来掩码预训练和条件流匹配来进行潜在未来预测,从而改进了视频联合嵌入预测架构(V-JEPA),并在 NAVSIM 和 HUGSIM 基准测试中取得了优异成绩。另一个模型 GeoWAM 强调使用点云等几何表示而非基于像素的方法,认为几何形状更能自然地捕捉驾驶动态并与动作执行保持一致,在开放循环和闭环评估中均表现出卓越的性能。
-
新方法通过高效想象增强机器人和自动驾驶模型 · 跟踪4个来源
研究人员开发了新方法,以提高机器人和自动驾驶领域中世界动作模型(WAMs)的效率和有效性。LAWA(潜在动作即意图)使用紧凑的潜在动作来保留未来想象能力,而无需生成完整的观测,从而降低延迟并提高在RoboCasa基准测试等任务上的泛化能力。RISE(通过选择性回滚优化想象)自适应地决定何时继续或停止想象回滚,平衡预期的规划收益与计算成本,并在NAVSIM和nuScenes数据集上表现强劲。GlanceWAM通过异步生成未来帧将想象与控…
-
RIFT 方法通过移除迭代视频推出,将机器人动作延迟削减
研究人员开发了 RIFT(Rollout-free Imagination via Future Tokens),一种用于世界动作模型(WAMs)的新颖方法,通过消除迭代视频推出显著降低了延迟。通过使用学习到的预期令牌在单次传递中构建未来的键/值缓存,RIFT 在机器人任务上保持了高成功率。这种方法在实现与传统的基于推出(rollout-based)的方法相当的性能的同时,大幅缩短了动作块(action-chunk)的延迟,并在 LI…
-
新的ForeWAM模型在无需未来视频解码的情况下预测机器人动作
研究人员开发了ForeWAM,一种新颖的世界动作模型(WAM),它通过以预测的未来状态为条件来增强机器人动作生成,而无需显式进行未来视频解码。该方法利用了Future-KV机制,该机制处理当前的视觉信息和未来的随机槽以生成层级键值状态。这些状态在整个动作去噪过程中被重复使用,使模型能够捕捉由交互引起的过渡,如物体运动和任务进展。ForeWAM在LIBERO和LIBERO-Plus等机器人基准测试中取得了高成功率,证明了其在动态环境中的…
-
新的FACT模型从失败动作中学习机器人技术
研究人员开发了FACT,这是一种新颖的因果世界-动作模型,旨在通过从成功和失败的动作中学习来改进机器人技术。与以前主要基于成功演示进行训练的模型不同,FACT明确预测不良动作的后果,并将其作为有效的训练目标。这种故障感知方法增强了模型的进度预测器,并在模拟和现实世界的操作任务中展示了卓越的性能,尤其是在整合故障数据时。
-
新的SG-WAM方法通过语言引导改进机器人操作
研究人员推出了一种名为SG-WAM的新方法,旨在提高机器人领域中世界-动作模型(WAM)的准确性。现有的WAM由于主要依赖视觉线索而非显式的语言基础,常常难以将预测的动作和未来视频与语言指令对齐。SG-WAM通过整合一个视觉-语言模型(VLM)作为语义规划器来解决这个问题。该VLM预测文本驱动和空间感知的语义远见,这有助于识别正确的对象并理解场景几何以进行精确操作。然后,这种远见被用来指导WAM,确保生成的内容和预测的动作紧密遵循给定…
-
新框架PILOT增强机器人操作模型
研究人员开发了一个名为PILOT(Physical Inference for Latent Optimized Trajectories)的新框架,以改进世界动作模型(WAMs)。PILOT的核心表示推导(RD)组件旨在将高级物理状态演化与低级动作轨迹生成分离开来。这种方法集成了运动思维链引导,使模型能够显式预测状态转换令牌。实验表明,RD在机器人操作任务中提高了WAMs的成功率、泛化能力和物理可解释性,同时还作为一种有效的少样本微调策略。
-
新研究通过混合人工智能和世界模型解决自动驾驶安全问题 · 跟踪 8 个来源
研究人员正在开发先进的方法来提高自动驾驶系统的安全性和效率。一种方法是将神经符号安全护栏与现有的端到端驾驶代理集成,以强制执行明确的安全规则并防止重大碰撞。另一种策略是将机器学习与基于优化的监督相结合,创建混合规划架构,以解释复杂场景并确保可驾驶性。此外,正在探索新的强化学习框架,通过在潜在世界模型中学习来提高样本效率并减少对昂贵现实世界交互的依赖。工作还集中于创建系统的行为分类法和自适应推理框架,这些框架利用空间物理证据和规划关键因…
-
新的 CoWAM 系统改进了双臂任务中的机器人策略协调
研究人员开发了 CoWAM,这是世界动作模型 (WAM) 的一种新的干预层,可增强机器人策略协调。CoWAM 使用协调合同,包括可接受性检查和干预门控,以确保替代动作不仅合理,而且能提高性能并避免风险。在双臂任务的模拟中,CoWAM 在协调有效选择和闭环成功率方面表现出显著提高,同时最大限度地减少了有害干预。
-
Faster-WAM 通过高效、通用的世界动作模型推进机器人操作 · 跟踪 3 个来源
研究人员开发了 Faster-WAM,一种新颖的世界动作模型(WAMs)方法,显著提高了机器人操作任务的推理速度和泛化能力。该方法在多篇 arXiv 论文中进行了详细介绍,引入了 Transformer 停靠(DoT)和稀疏未来条件框架等架构创新。这些进步使得 WAMs 即使在处理分布变化时,也能通过在没有高昂计算成本的情况下高效重用未来表示来保持性能和鲁棒性。实验表明,Faster-WAM 在 LIBERO 和 RoboTwin 2…
-
新的FBFM机制通过实时纠错增强机器人控制
研究人员推出了一种新颖的无训练机制FBFM,旨在提高世界-动作模型(WAMs)在长时程机器人控制任务中的可靠性。这种异步反馈方法将重新接地集成到主动生成的动作块中,而不仅仅是在块边界。通过使用先前的动作和后续的真实世界观察来指导下一个动作和帧的生成,FBFM在更精细的时间粒度上纠正错误,增强了对意外事件的响应能力,并减少了预测漂移。在LIBERO和RoboTwin2.0任务上对DreamZero和LingBot-VA WAMs的评估显…
-
SG-WAM 框架学习用于机器人技术的几何感知动力学
研究人员开发了 SG-WAM,一个新颖的自导框架,用于在策略派生表示空间内直接学习几何感知、动作条件动力学。该方法将动作生成与未来状态预测相结合,解决了现有世界动作模型 (WAMs) 在平衡动作相关性与几何感知方面存在的局限性。SG-WAM 利用可学习的动力学令牌和自导世界预测器来预测未来的潜在状态,在 LIBERO 和 LIBERO-Plus 等机器人基准测试中取得了很高的成功率,而无需进行广泛的具身预训练。
-
新的QuantWAMs框架优化世界动作模型以实现高效部署
研究人员开发了QuantWAMs,一个用于量化世界动作模型(WAMs)的新颖框架,以提高其部署效率。与以前的方法不同,QuantWAMs根据模型的结构、部署分布和任务目标来校准量化决策。这种方法引入了共享基数异常值校准、联合训练目标显著性以及固定干预部署审计的策略。在包括真实机器人操作任务在内的各种基准测试上的评估表明,QuantWAMs在保持接近全精度模型的性能的同时,显著减少了内存使用并提高了速度。
-
具身数据金字塔组织人工智能训练数据源
一篇新论文介绍了具身数据金字塔(Embodied Data Pyramid),这是一个用于组织训练具身人工智能系统所使用的各种数据源的框架。该金字塔将数据分为五个层次:真实机器人数据、UMI风格数据、自身中心/外部中心数据、模拟数据以及通用视觉语言数据。该分类有助于分析当前的具身基础模型(包括具身大脑模型、视觉语言动作模型和世界动作模型)如何组合这些数据源来发展感知、推理和动作生成能力。作者们还强调了具身人工智能数据收集和利用方面的六…
-
新方法利用可解释性增强世界动作模型的鲁棒性
研究人员开发了一种新方法来提高世界动作模型(WAMs)在分布变化下的鲁棒性。通过采用机制可解释性,他们发现一些WAM架构对关键特征表现出线性可分性,从而能够进行无需训练的引导。这种方法催生了世界动作线性二次调节器(WA-LQR),这是一种能够提高对视觉噪声以及相机或夹具配置变化等各种扰动鲁棒性的控制器。WA-LQR在Cosmos-Policy和DiT4DiT等模型上展示了改进的性能,同时预测LingBot-VA的引导能力较弱。
-
新的BadWAM框架揭示了世界动作模型中的漏洞
研究人员引入了BadWAM,这是一个用于评估世界动作模型(WAMs)对抗性攻击的框架。这些攻击利用微小的视觉扰动来破坏WAMs的预期未来与其执行动作之间的一致性。该框架包含两种类型的攻击:一种优先考虑任务失败,另一种则在诱导有害动作的同时保持一个看似合理的预期未来,这表明任务成功率显著下降。
-
GigaWorld-Policy-0.5通过更快的推理能力增强机器人控制
研究人员开发了GigaWorld-Policy-0.5,这是一种增强型世界动作模型(WAM),旨在实现更高效的机器人控制。该模型通过在训练时使用未来的视觉动力学,并在推理时采用仅动作解码方法,解决了传统WAM的计算开销问题。GigaWorld-Policy-0.5通过混合Transformer架构和用于优化训练配置的AutoResearch管道,在RTX 4090设置上实现了85毫秒的推理延迟。
-
FlowWAM论文提出将光流作为WAMs的统一动作表示
研究人员推出FlowWAM,一个利用光流作为世界动作模型(WAMs)统一动作表示的新框架。这种双流扩散方法将编码丰富的每像素位移的光流与RGB视频集成在一个共享的预训练视频生成器中。FlowWAM可以在策略模式下进行动作预测,或在世界模型模式下使用目标流序列指导未来的视频生成。该方法利用大规模、无动作标签的视频数据集进行预训练,在操作任务和世界建模基准测试中表现出改进的性能。
-
新模型和框架推动具身AI能力发展
研究人员正在开发先进的模型和框架,以实现更具能力的具身人工智能。一种方法是Athena-Brain-8B,一个为设备端机器人大脑设计的8B LLM,展现出强大的通用智能和具身交互能力,并能给出简洁的响应。另一篇论文探讨了Edmund Berkeley和David L. Heiserman的历史工作,将其视为一个未被充分探索的具身智能架构,将逻辑与硬件和时间扩展行为联系起来。此外,一个1.5B的开源VLA模型MiniCPM-Robot,…