实体
DeepMind Control
DeepMind Control
PulseAugur coverage of DeepMind Control — every cluster mentioning DeepMind Control across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
StarWM 引入自监督注意力路由,用于鲁棒的 AI 世界模型
研究人员推出了 StarWM,一种用于 AI 世界模型的新型自监督学习方法。StarWM 采用交叉注意力模块,选择性地将重建应用于相关的环境动态,从而避免了纯粹基于重建的模型中出现的表征能力错配。该方法能有效区分任务相关信息和无关干扰项,在 DeepMind Control 基准测试中表现出色,尤其是在具有动态视频背景和顺序干扰项的挑战性条件下。
-
新的TrojanWorld框架通过想象力引导后门化强化学习代理
研究人员开发了一个名为TrojanWorld的新框架,旨在后门化强化学习中使用的世界模型代理。该框架通过引导代理的内部模拟或“想象力”来利用这些代理的预测核心,使其执行攻击者指定的行为。TrojanWorld使用物理对象作为触发器,通过代理的观察管道激活攻击,而无需直接的数字操作。实验表明,TrojanWorld可以在保持接近原始性能的同时诱导恶意行为,甚至可以在触发器移除后使代理陷入这些诱导的行为中。
-
新的强化学习算法将无模型效率与基于模型的表示相结合
一篇研究论文介绍了一种名为统一潜在动力学(ULD)的新型强化学习算法,旨在结合无模型方法的效率和基于模型方法的表示能力。ULD通过将状态-动作对嵌入到一个潜在空间中来实现这一点,在该空间中,价值函数近似线性,从而避免了规划的计算开销。该算法在连续控制和Atari游戏等各种领域都表现出强大的性能,以更少的参数和最少的调整匹配或超越了专门的基线。