PulseAugur
中
实时 22:57:26
实体 World-Action Models

World-Action Models

PulseAugur coverage of World-Action Models — every cluster mentioning World-Action Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
48
90 天内 48
发布 · 30天
0
90 天内 0
论文 · 30天
45
90 天内 45
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 49 条
  1. TOOL · CL_293399 ·

    机器人领域迎来潜在的 GPT-2 时刻,得益于 World-Action Models

    一种名为 World-Action Models (WAMs) 的新方法被比作 GPT-2 对自然语言处理产生的重大影响,预示着其在机器人领域具有类似的变革潜力。该方法旨在为机器人理解和与其环境交互提供一个更强大、更通用的框架。这种比较突显了 WAMs 通过实现更复杂、更适应性强的人工智能系统来推动机器人领域发展的潜力。

  2. TOOL · CL_287215 ·

    新的 VPP2 模型增强了机器人动作预测和泛化能力

    研究人员推出了视频预测策略 2 (VPP2),这是世界动作模型 (WAMs) 的一项进展,旨在提高在开放式环境中机器人运动预测和动作生成的准确性。VPP2 通过使用大规模、多样化的操作视频数据集进行预训练,并为其动作模块采用混合 Transformer 架构,解决了现有 WAMs 的局限性。实验表明,VPP2 在视频预测方面显著优于 Cosmos3-64B 等模型,并在现实世界的 ALOHA 操作任务以及 LIBERO-Pro、LIB…

  3. TOOL · CL_285570 ·

    Magic-W0:新的基础模型通过结构化的世界-动作动力学增强机器人策略

    研究人员推出了一种新颖的世界-动作基础模型 Magic-W0,旨在通过整合动作条件环境动力学来增强机器人策略。与以往的方法不同,Magic-W0 采用了物理状态演变的结构化表示,结合了当前状态、用于转换的 3D 运动以及用于结果的未来语义。该模型在包含人类操作和真实机器人数据的多样化数据集上进行了预训练,并在 RoboDojo-Sim 基准测试中表现出色,在同类模型中得分最高。

  4. RESEARCH · CL_270778 ·

    新研究推动机器人世界模型以实现高效规划和控制 · 已追踪 10 个来源

    近期研究探索了用于机器人和智能体规划的世界动作模型(WAMs)的进展。WAM-Cache 和 WAMJET 通过优化键值重用和采用智能体约束来识别和优化瓶颈,专注于加速推理,在不影响动作质量的情况下实现了显著的加速。MobileWorldBench 为 GUI 智能体的语义世界模型引入了一个基准和数据集,超越了像素预测,实现了自然语言状态转换。Tempo 和 COSTGRAD 为潜在世界模型提供了新的规划目标和令牌选择方法,提高了长时…

  5. RESEARCH · CL_267611 ·

    新研究增强了机器人和AI的世界动作模型

    近期研究探索了用于机器人和AI的世界动作模型(WAMs)的进展,重点是提高预测精度、动作生成和推理效率。几篇论文介绍了新的方法,如完成感知引导(CAG)以确保任务完成,回顾性世界建模以实现向后推理,以及动作经验字典(AED)以实现技能重用。其他工作通过诸如动作引导稀疏想象(Sparse-WAM)和带有阶梯策略的流式推理等技术来解决计算成本问题。这些创新旨在提高机器人控制、泛化能力和在复杂环境中的鲁棒性。

  6. TOOL · CL_257230 ·

    综述梳理机器人智能的世界-动作模型

    这篇综述论文全面回顾了用于机器人学习与控制的世界-动作模型(WAMs)。它将现有方法组织成一个统一的分类体系,涵盖了表示、转移建模、动作接口、架构、训练流程、数据模态和扩展策略。论文还探讨了WAM在操作、导航和自动驾驶中的应用,并讨论了诸如动作对齐、空间一致性和长时记忆等关键挑战。目标是为整合预测性世界建模与动作生成奠定技术基础,以增强具身机器人的智能。

  7. RESEARCH · CL_257133 ·

    新研究通过时间上下文和视觉前瞻性增强机器人操控能力 · 跟踪4个来源

    研究人员正在开发新方法,通过结合时间上下文和视觉前瞻性来改进机器人操控。PACT-WAM 使用紧凑的时间编码来预测动作轨迹和视觉结果,在各种任务上实现了高成功率,尤其是在增强了提案审查组件后。同样,TEMPO 通过增加运动摘要和本体感受历史来增强现有模型,以解决运动模糊和状态别名问题,从而解决了动态操控的局限性。另一种方法“Acting in Meters”引入了一个度量交互框架,该框架在物理空间中对物体和场景交互进行建模,以优化动作…

  8. RESEARCH · CL_249556 ·

    新框架通过流匹配和安全约束增强机器人策略 · 跟踪 4 个来源

    研究人员开发了几个新的框架来改进强化学习中的基于流的策略,特别是在机器人领域。这些方法旨在解决多模态动作分布和需要安全、符合约束的动作等挑战。诸如基于精炼的流策略优化 (RFPO) 和 OptiFlow 等技术利用值引导和最优传输来更好地表示复杂的动作空间并避免模式崩溃。另一种方法,值引导流匹配 (VGFM),将值引导直接集成到流匹配过程中,而无需复杂反向传播。此外,ActSafeGuard 引入了一个可微分的安全卫士层,以确保机器人…

  9. RESEARCH · CL_247112 ·

    新框架Valerant使用世界模型自动生成3D游戏地图

    研究人员开发了Valerant,一个利用动作条件世界模型自动生成可导航3D游戏地图的新颖框架。该系统通过结合预测性视觉展开、同步定位与地图构建(SLAM)技术以及驱动式探索动作选择,将单个图像转化为持久的3D游戏环境。Valerant旨在减少3D游戏地图创建中涉及的手动工作量,并将世界动作模型的应用扩展到2D视觉模拟之外。

  10. TOOL · CL_233630 ·

    新的SA-WAM模型将3D数据整合到机器人策略学习中

    研究人员开发了一个空间感知世界动作模型(SA-WAM),该模型将3D几何信息整合到用于机器人策略学习的大规模预训练视频扩散模型中。该模型重新利用现有的视频扩散骨干网络来同时预测动作、RGB和深度,从而无需大量微调即可实现3D感知世界建模。SA-WAM在RoboCasa和LIBERO-Plus等基准测试中表现出最先进的性能,并在UR5机械臂上显示出强大的实际改进。

  11. TOOL · CL_233602 ·

    新框架通过验证世界动作模型预测来增强机器人控制能力

    研究人员推出了一种名为世界相干解码(WCD)的新型框架,旨在提高机器人领域中世界动作模型(WAMs)的可靠性。WCD通过将WAM的滚动预测视为可测试的假设,采样多种未来场景,并在执行前根据视觉合理性和动作稳定性进行排序。这种自验证过程利用内部生成信号来预测可靠性,从而在RoboTwin 2.0基准测试等任务上取得改进的性能。

  12. RESEARCH · CL_231670 ·

    ZimaBlue框架通过视频数据学习可泛化的机器人动作

    研究人员开发了ZimaBlue框架,旨在从大规模视频数据中学习可泛化的世界动作模型(WAMs)。该方法采用三阶段课程学习:首先是因果具身视频预训练,然后是中间训练以将视觉动力学与机器人轨迹相结合,最后是模型专业化以进行部署。该系统采用双慢快架构实现实时动作预测,在机器人操作任务中取得了显著改进,当具身视频数据规模扩大时,成功率从36.1%提高到77.8%。

  13. TOOL · CL_223300 ·

    新的LEON架构为世界动作模型建模潜在状态演化

    研究人员引入了潜在演化算子网络(LEON),这是一种用于世界动作模型(WAMs)的新型架构,它显式地对潜在状态演化进行建模。与专注于令牌交互的基于Transformer的预测器不同,LEON使用上下文调制的基于算子的传播和加性强制来捕捉时间动态。这种方法以Koopman生成器理论为基础,围绕共享的演化算子结构组织了上下文相关的变化。在WAMs上的实验表明,LEON提高了闭环性能和鲁棒性,突显了转换实现作为潜在WAMs中架构选择的重要性。

  14. TOOL · CL_218331 ·

    新的SCVC方法在无需摄像头数据的情况下增强了机器人视点鲁棒性

    研究人员开发了一种名为选择性跨视图一致性(SCVC)的新方法,以提高世界动作模型(WAMs)在处理摄像头视点变化时的鲁棒性。传统的WAMs在处理视点扰动时会遇到困难,而SCVC通过仅将一致性损失应用于动作和本体感觉等视点不变的元素,而不是像预测场景等视点共变的元素来解决这个问题。这种方法在训练或测试期间不需要摄像头信息,在未见过的轨道视点上显示出闭环成功率的显著提高。

  15. RESEARCH · CL_215980 ·

    新的自动驾驶模型预测未来世界状态和动作 · 已追踪 2 个来源

    研究人员开发了新的自动驾驶模型,专注于预测未来的世界状态和动作。WA-JEPA 模型(在一篇论文中提出)通过使用混合未来掩码预训练和条件流匹配来进行潜在未来预测,从而改进了视频联合嵌入预测架构(V-JEPA),并在 NAVSIM 和 HUGSIM 基准测试中取得了优异成绩。另一个模型 GeoWAM 强调使用点云等几何表示而非基于像素的方法,认为几何形状更能自然地捕捉驾驶动态并与动作执行保持一致,在开放循环和闭环评估中均表现出卓越的性能。

  16. RESEARCH · CL_216147 ·

    新的世界动作模型增强了游戏和机器人中的AI代理

    研究人员正在开发新颖的世界动作模型(WAM),以提高AI代理在视频游戏和机器人中的性能。例如,GameWAM统一了视觉预测和动作生成,以实现原生的游戏控制,并以更少的动作展示了具有竞争力的结果。其他进展包括LAWA,它使用潜在动作在机器人中进行高效的未来想象;RISE,一个优化规划想象展开的自适应框架;4DGS-WAM利用4D高斯溅射进行以对象为中心的建模;以及GlanceWAM,它将想象与控制分离以实现实时推理。

  17. TOOL · CL_198060 ·

    RIFT 方法通过移除迭代视频推出,将机器人动作延迟削减

    研究人员开发了 RIFT(Rollout-free Imagination via Future Tokens),一种用于世界动作模型(WAMs)的新颖方法,通过消除迭代视频推出显著降低了延迟。通过使用学习到的预期令牌在单次传递中构建未来的键/值缓存,RIFT 在机器人任务上保持了高成功率。这种方法在实现与传统的基于推出(rollout-based)的方法相当的性能的同时,大幅缩短了动作块(action-chunk)的延迟,并在 LI…

  18. TOOL · CL_198012 ·

    新的ForeWAM模型在无需未来视频解码的情况下预测机器人动作

    研究人员开发了ForeWAM,一种新颖的世界动作模型(WAM),它通过以预测的未来状态为条件来增强机器人动作生成,而无需显式进行未来视频解码。该方法利用了Future-KV机制,该机制处理当前的视觉信息和未来的随机槽以生成层级键值状态。这些状态在整个动作去噪过程中被重复使用,使模型能够捕捉由交互引起的过渡,如物体运动和任务进展。ForeWAM在LIBERO和LIBERO-Plus等机器人基准测试中取得了高成功率,证明了其在动态环境中的…

  19. TOOL · CL_195966 ·

    新的FACT模型从失败动作中学习机器人技术

    研究人员开发了FACT,这是一种新颖的因果世界-动作模型,旨在通过从成功和失败的动作中学习来改进机器人技术。与以前主要基于成功演示进行训练的模型不同,FACT明确预测不良动作的后果,并将其作为有效的训练目标。这种故障感知方法增强了模型的进度预测器,并在模拟和现实世界的操作任务中展示了卓越的性能,尤其是在整合故障数据时。

  20. TOOL · CL_194127 ·

    新的SG-WAM方法通过语言引导改进机器人操作

    研究人员推出了一种名为SG-WAM的新方法,旨在提高机器人领域中世界-动作模型(WAM)的准确性。现有的WAM由于主要依赖视觉线索而非显式的语言基础,常常难以将预测的动作和未来视频与语言指令对齐。SG-WAM通过整合一个视觉-语言模型(VLM)作为语义规划器来解决这个问题。该VLM预测文本驱动和空间感知的语义远见,这有助于识别正确的对象并理解场景几何以进行精确操作。然后,这种远见被用来指导WAM,确保生成的内容和预测的动作紧密遵循给定…