PointMaze
PulseAugur coverage of PointMaze — every cluster mentioning PointMaze across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新方法在AI世界模型中保留不稳定的模式,以实现更好的机器人控制
研究人员开发了一种方法,通过增强联合嵌入预测架构(JEPA)所学习的表示来改进机器人系统的控制。所提出的方法通过增加逆动力学损失来增强标准训练,该损失鼓励模型保留对控制至关重要的不稳定的模式。这种技术确保在表示学习过程中不会丢弃关键状态信息,从而在CartPole、Walker2D和PointMaze等非线性视觉控制任务中获得更好的性能。
-
新方法通过强大的视觉表示增强AI代理规划
研究人员开发了新方法,以提高AI代理中使用的潜在世界模型的鲁棒性和规划能力。第一种方法JEPA-Bisim引入了一个双模拟编码器,以强制执行与控制相关的状态等价性,这有助于代理忽略不相关的视觉变化,如背景变化和干扰物。该方法已显示出改进的鲁棒性,并且可以使用比以前的模型小10倍的潜在空间,同时仍与各种预训练的视觉编码器兼容。第二种方法AnisoWM与\u039BReg解决了表示几何与规划中的任务对齐之间的不匹配问题。它用可学习的对角协…
-
新AI方法识别目标条件控制的“拓扑必要性”
研究人员通过识别“拓扑必要性”开发了一种新的目标条件强化学习方法。这些被定义为任何成功的智能体都必须跨越的、不可避免的阶段或子目标,无论其具体的控制机制如何。该方法利用成功轨迹在0维和1维上的同调性来创建可枚举的门集,形成一个递归的拓扑门层级结构。该方法已证明能有效地将学习到的门跨具身进行迁移,例如从PointMaze数据迁移到Ant和Humanoid智能体,在复杂任务上取得了高性能。
-
新的ARC-Bench协议揭示了冻结JEPA世界模型的关键缺陷
研究人员开发了ARC-Bench,一个旨在评估冻结潜在世界模型动作排序能力的新评估协议。研究发现,这些通过根据预测的未来嵌入对候选动作进行评分来进行规划的模型,常常无法正确排序动作。由于闭环重规划机制,这一缺陷在很大程度上未被发现,导致次优的动作选择,并夸大了潜在表征的真实性能。即使使用不同的视觉骨干网络,包括V-JEPA 1和V-JEPA 2,研究结果也保持一致。
-
新研究应对离线目标条件强化学习挑战 · 跟踪到2个来源
两篇新研究论文探讨了离线目标条件强化学习(GCRL)中的挑战。第一篇论文介绍了PathBridger,一种通过构建状态空间桥梁来明确连接子目标选择与短视界执行的方法。第二篇论文提出了SegBench-GC,一个旨在测试多步离线GCRL中分割不变性的基准,并强调了人为边界如何对性能产生负面影响。
-
研究论文批评AI策略搜索中的对比批评者
一篇题为“Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search”的新研究论文探讨了AI策略搜索中对比批评者的局限性。该论文表明,虽然好的动作排名不能保证安全性,但无界的双线性分数会膨胀非支持值。研究表明,余弦边界不能解决这个问题,分解将遗憾归因于范数漂移。研究发现,在多个OGBench导航任务中,对比批评者在最…
-
Rank-Then-Act框架在没有环境奖励的情况下学习控制策略
研究人员开发了一个名为Rank-Then-Act (RTA) 的新颖框架,使强化学习代理能够在没有显式环境奖励的情况下从视频演示中学习控制策略。RTA利用视觉语言模型作为序数评分器,预测视频序列中的进展。然后,该评分器用于生成基于相关性的强化学习奖励信号,该信号在各种任务和环境中表现出稳定的性能,包括离散控制基准和连续控制任务。