PulseAugur
中
实时 07:48:55
实体 Meta-World Physics

Meta-World Physics

PulseAugur coverage of Meta-World Physics — every cluster mentioning Meta-World Physics across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 8
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_200306 ·

    SpatialVAM模型提高机器人策略数据效率

    研究人员推出了一种新颖的3D视频动作模型SpatialVAM,旨在提高机器人操作中的数据效率。与以往常常忽略空间或时间理解的先前方法不同,SpatialVAM同时预测空间感知的多视图热图视频和RGB视频。该方法将3D信息整合到视频基础模型中,对齐表示格式以实现更好的动作微调。实验表明,SpatialVAM在数据高效操作方面取得了最先进的性能,以显著更少的演示轨迹优于其他模型。

  2. TOOL · CL_193776 ·

    V-Simba架构提升视觉控制中RL的样本效率

    研究人员推出了一种新颖的强化学习(RL)架构V-Simba,旨在提高视觉连续控制任务中的样本效率。受基于状态的RL中使用的Simba架构的启发,V-Simba结合了归一化层和逐点卷积,以稳定训练并降低计算成本。与DrQ-v2相比,新架构在DMC、Adroit和Meta-World等基准测试中表现出与现有最先进方法相当或更优的性能,同时计算效率更高。

  3. TOOL · CL_193452 ·

    SpikeWorld 模型为冻结的世界模型实现快速状态适应

    研究人员开发了 SpikeWorld,这是一种新颖的、拥有 145 万个参数的稀疏脉冲模型,专为冻结的世界模型中的高效状态适应而设计。该模型联合优化了异构感官预测、语义、图像-文本绑定和动作条件动力学。通过冻结训练好的参数并使用外部路径进行适应,SpikeWorld 在动作下一状态均方误差方面实现了 17.10% 的改进,同时增强了多模态预测和语义准确性。在 Meta-World 轨迹测试中,SpikeWorld 在冻结策略奖励方面显…

  4. RESEARCH · CL_107746 ·

    LaGO 框架使用 LLM 改进在线强化学习 · 跟踪 2 个来源

    研究人员开发了 LaGO,一个利用大型语言模型 (LLM) 作为在线强化学习的潜在动作先验的框架。LaGO 不将 LLM 用作直接控制器,而是软性地指导策略优化。在 CLEVR-Robot 和 Meta-World 基准上的实验表明,与 Vanilla PPO 相比,LaGO 在 CLEVR-Robot 上的成功率从 15.1% 提高到 27.2%,在 Meta-World 上的成功率从 2.7% 提高到 15.2%。研究还表明,更强…

  5. RESEARCH · CL_106805 ·

    新研究增强了用于机器人和视觉推理的VLA模型

    近期研究探索了增强用于机器人操作和通用视觉推理的视觉-语言-动作(VLA)模型。研究通过域随机化和照片级真实感渲染来研究模拟到现实的泛化能力,并提出诸如 Faithful Warm-Start 等方法,通过在强化学习前确保视觉保真度来提高VLM推理的稳定性。其他工作引入了置信度驱动的测试时强化学习,无需外部奖励即可实现自我改进,以及状态感知分词器,以更好地从离散代码中解码动作。此外,研究还检查了VLA模型中的架构冗余,发现语言骨干对于…

  6. RESEARCH · CL_56916 ·

    机器人通过新的KAN-We-Flow和EFM策略提高效率

    研究人员开发了KAN-We-Flow,一种新颖的机器人操作策略,利用RWKV和KAN显著减小模型尺寸和推理延迟,同时保持或提高成功率。该方法在Adroit和Meta-World等基准测试中取得了最先进的性能,参数减少了86.8%,并具备实时控制能力。此外,引入了一个名为EFM-10的新基准,通过专注于探索性和专注性操作策略来解决人形双臂操作中的挑战,特别是视觉遮挡问题。该基准以及BAPData数据集和BAP策略旨在使机器人能够主动获取…

  7. TOOL · CL_44719 ·

    TimeRewarder 从被动视频中学习密集奖励,用于强化学习

    研究人员开发了 TimeRewarder,一种从被动视频中学习密集奖励信号的新颖方法。该技术通过对帧对之间的时间距离进行建模来估计任务进度,然后可以指导强化学习代理。在十个 Meta-World 任务上的实验表明,TimeRewarder 显著提高了成功率和样本效率,优于手动设计的奖励和以前的方法。该方法还展示了利用真实世界的人类视频进行可扩展奖励信号生成的潜力。

  8. RESEARCH · CL_41771 ·

    机器人策略生成方法DISC将语言与控制解耦

    研究人员开发了一种名为DISC(Decoupling Instruction from State-Conditioned Control)的新方法,以改进机器人中的语言条件操作策略。DISC在结构上将指令处理与状态条件控制分开,防止策略学习绕过语言基础的捷径。它通过使用超网络直接从指令生成特定任务的视觉运动策略来实现这一点,确保任务意识仅来自语言。