PulseAugur
实时 09:44:36

新的SADQ方法增强了深度Q网络中Q学习的稳定性

研究人员引入了后继者回溯聚合深度Q网络(SADQ),这是一种新颖的Q学习修改,旨在提高深度Q网络(DQN)的训练稳定性。SADQ通过使用从学习到的动力学模型进行的一次性回溯预测来解决DQN对估计噪声过于敏感的问题。这种方法指导未来回报的聚合,减少了最大化算子偏向不可靠估计所引起的误差放大。理论分析和在各种控制任务及Atari基准上的实证结果表明,与现有的DQN变体相比,SADQ在减轻高估和增强训练稳定性方面是有效的。 AI

影响 这项研究可能导致在复杂环境中强化学习代理的训练更加稳定和可靠。

排序理由 该集群包含一篇详细介绍Q学习新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SADQ方法增强了深度Q网络中Q学习的稳定性

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Lipeng Zu, Xiaonan Zhang ·

    Revisiting TD Target Aggregation under Uncertainty in Q-Learning

    arXiv:2608.03069v1 Announce Type: new Abstract: Deep Q-Networks (DQNs) learn value functions through bootstrapped temporal-difference updates, where future returns are approximated using a greedy maximization over next-state action values. While effective, this aggregation rule i…