PulseAugur
实时 09:44:17
English(EN) Enhancing Q-Value Updates in Deep Q-Learning via Successor-State Prediction

新的SADQ方法增强了深度Q学习中的Q值更新

研究人员开发了后继状态聚合深度Q网络(SADQ),这是一种增强深度Q学习(DQN)中Q值更新的新方法。SADQ通过显式地使用随机转移模型来建模环境动态并整合后继状态分布,解决了DQN更新中因依赖来自潜在次优过去策略的下一状态而导致的高方差问题。SADQ旨在提供更稳定且与策略一致的值更新。该方法在各种强化学习基准测试和现实世界的控制任务中,在稳定性和学习效率方面均持续优于标准的DQN变体。 AI

影响 这项研究可能导致更稳定、更高效的强化学习智能体训练,从而提高在复杂控制任务中的性能。

排序理由 该集群包含一篇详细介绍强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SADQ方法增强了深度Q学习中的Q值更新

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Lipeng Zu, Hansong Zhou, Xiaonan Zhang ·

    Enhancing Q-Value Updates in Deep Q-Learning via Successor-State Prediction

    arXiv:2511.03836v2 Announce Type: replace Abstract: Deep Q-Networks (DQNs) estimate future returns by learning from transitions sampled from a replay buffer. However, the target updates in DQN often rely on next states generated by actions from past, potentially suboptimal, polic…