PulseAugur
实时 04:19:40
实体 DreamerV3

DreamerV3

PulseAugur coverage of DreamerV3 — every cluster mentioning DreamerV3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 14
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_217931 ·

    世界模型学习物理不变性但在预测中违反它们

    研究人员发现世界模型存在一种故障模式,即在视频上训练的模型可以学习物理不变性,但在预测性回滚期间会违反它们。通过将潜在状态投影回其初始水平集,他们减少了保守模型中的回滚误差。这项工作区分了动态有意义的不变性与仅仅是相关性,突出了当前世界模型能力的特定局限性。

  2. TOOL · CL_215990 ·

    新的CIVA攻击方法针对视觉世界模型代理

    研究人员开发了一种名为批评诱导值子空间攻击(CIVA)的新方法,用于攻击视觉世界模型代理。这些代理(如DreamerV3)通过循环潜在状态运行,使其能够抵御传统的逐帧攻击。CIVA利用代理自身的批评者来识别扰动最有效的低维子空间。通过在该子空间内进行优化并平滑扰动,CIVA在DMC walker walk、Pong和Crafter等环境中实现了显著的奖励下降,优于现有攻击方法。

  3. TOOL · CL_165060 ·

    多视界一致性影响视频预测几何

    研究人员调查了多视界潜在一致性(视频预测和世界模型中的训练参数)对转移几何的影响。他们的研究以Moving-MNIST作为主要测试案例,发现增加该参数lambda可以显著减少预测误差并改善潜在一致性。然而,这种效果受限于特定领域,在Pendulum-v1或CartPole-v1等条件动作任务或KTH Actions视频数据上并未观察到一致的效果。研究结果表明,虽然软一致性可以促使被动视频模型进入收缩状态,但其有效性取决于具体领域。

  4. TOOL · CL_158577 ·

    梦境排练解决了持续强化学习智能体的遗忘问题

    研究人员发现,在基于模型的强化学习中,导致遗忘任务的不是“世界模型”,而是“演员”组件。对DreamerV3系列智能体的实验表明,虽然世界模型保留了过去任务的信息,但演员的行为却退化了。通过一种称为“梦境排练”的技术,即在世界模型生成的梦境上进行监督式自我模仿,智能体能够在无需直接与环境交互的情况下保留技能,其表现优于传统的经验回放缓冲区和真实片段克隆。

  5. RESEARCH · CL_158733 ·

    Dreamer-CPC 通过历史消息学习增强 MARL · 追踪 2 个来源

    研究人员推出了一种新颖的去中心化多智能体强化学习(MARL)方法 Dreamer-CPC,该方法通过将集体预测编码(CPC)与 DreamerV3 世界模型相结合来增强通信。这种方法使智能体能够学习和交换反映历史观察和动作的消息,而不仅仅是当前的消息。在 Observer 和 CatchApple 环境中的评估表明,Dreamer-CPC 在现有方法中表现更优,尤其是在 CatchApple 环境中,其回合回报提高了 4 到 5 倍,…

  6. RESEARCH · CL_191104 ·

    新的AI框架应对世界模型挑战和智能体研究

    研究人员开发了TaskSense,一个用于AI世界模型的新框架,它侧重于与任务相关的信息,而不是重建整个视觉输入。该方法使用可微分的空间注意力机制来识别和优先处理重要区域,忽略干扰。另外,还创建了一个名为AutoWorldModel-Bench的独立基准,用于评估AI编码智能体在开放式世界模型研究中的表现,使它们能够在各种游戏环境中自主改进入门模型。

  7. RESEARCH · CL_147423 ·

    新的CGSReg技术改进了Atari Pong世界模型 · 跟踪2个来源

    一项新的研究论文介绍了概念引导空间正则化(CGSReg),以提高Atari Pong游戏中世界模型的性能。该研究评估了包括DreamerV3在内的五个现有世界模型,发现在这些模型单独评估时存在显著的性能下降。CGSReg是一种专注于任务关键概念(如球)的辅助损失函数,旨在解决这些局限性。实验表明,CGSReg增强了所测试模型的闭环回滚和零样本强化学习。

  8. TOOL · CL_133512 ·

    新研究定义了世界模型中的“价值等价性”

    研究人员引入了“价值等价性”的概念来解释世界模型学习了任务结构的多大程度。他们提出,模型捕获的结构量不是由其容量或观察决定,而是由其训练目标的目标维度决定。使用 DreamerV3 堆栈进行的实验表明,用完整的 objective 替换标量值信号将可恢复的结构从 0.10 大幅提高到 0.76。该研究表明,价值等价性是维度化的,单一奖励目标代表其 Rank-One 角,模型学习结构的比例与目标的复杂性成正比。

  9. TOOL · CL_134007 ·

    世界模型因运动学想象缺陷而在长视界任务中失败

    研究人员发现世界模型在长视界任务中失败的一个关键原因:它们倾向于进行运动学想象,而不是动力学想象。这一区别至关重要,因为虽然运动学想象可能保持一致,但在物理条件发生变化(例如跨越摩擦边界)时,它可能导致策略奖励崩溃。该研究提出了一种新的诊断方法,即想象的运动学一致性误差(iKCE),来衡量这种现象。在 DreamerV3 检查点上进行测试时,尽管奖励显著下降,但该模型仍表现出平坦的 iKCE,表明其未能根据变化的物理现实动态调整其预测。

  10. TOOL · CL_56479 ·

    Mind Dreamer 框架通过因果干预增强了强化学习的想象力

    研究人员推出了一种名为 Mind Dreamer (MD) 的新颖框架,旨在通过克服想象力中历史束缚的局限性来增强基于模型的强化学习。MD 采用主动因果干预,允许模型探索超出观测数据范围的状态,并从对抗性生成器初始化想象力,以发现非连续的潜在跳跃。该方法旨在解决世界模型发现和策略优化之间的学习不对称性,理论上建立了不确定性传播的二次折扣,并在基准任务上实现了显著的加速。

  11. TOOL · CL_48905 ·

    新框架可自动搜索世界模型代理的对抗性攻击

    研究人员开发了 WMAttack,一个新颖的自动化框架,旨在严格评估世界模型代理的对抗鲁棒性。该系统解决了在不过度估计代理韧性的情况下有效寻找攻击的挑战。WMAttack 采用自我纠正攻击搜索 (SCAS) 和表示引导攻击检索 (RGAR) 等技术,以发现更强的攻击并提高各种任务的搜索效率。

  12. TOOL · CL_48739 ·

    新的 GPLD 方法提高了潜在世界模型的样本效率

    研究人员推出了一种新的潜在世界模型正则化器——梯度惩罚潜在动力学 (GPLD),适用于 DreamerV3 等模型。GPLD 通过对后验潜在分布应用雅可比惩罚,强制学习到的转移动力学具有局部平滑性。该方法在复杂运动和四足任务中表现出更高的样本效率和更一致的学习效果。

  13. TOOL · CL_36600 ·

    Mind Dreamer 框架通过主动想象增强强化学习

    研究人员推出了一种名为 Mind Dreamer (MD) 的新颖框架,旨在通过使想象力超越观察到的状态来增强基于模型的强化学习。MD 采用主动潜在干预 (ALI) 来合成合理但具有挑战性的初始状态,超越了历史束缚。该方法利用学习到的生成器和对抗过程来探索认知盲点,并推导出了中继价值函数 (RVF) 和中继不确定性函数 (RUF) 来处理这些合成状态的信用分配。经验表明,MD 在现有方法上实现了显著的加速,平均学习速度提高了 1.67…

  14. RESEARCH · CL_20444 ·

    ELVIS: Ensemble-Calibrated Latent Imagination for Long-Horizon Visual MPC

    研究人员开发了ELVIS,一种用于强化学习中长时域视觉规划的新方法,该方法使用高斯混合模型预测控制器在扩展的rollout中维护多个假设。该方法在一个新论文中进行了详细介绍,还包含了一个不确定性感知的回报机制来稳定想象并限制复合误差。ELVIS在视觉控制任务上展示了最先进的性能,并有望在有遮挡的现实世界应用中发挥作用。另外,另一篇论文介绍了TRAP,一种通过操纵想象轨迹的排名来针对世界模型的后门攻击,该攻击已被证明会降低Dreamer…