PulseAugur
实时 08:39:39
English(EN) Generalized Gaussian Temporal Difference Error for Uncertainty-aware Reinforcement Learning

新的强化学习方法使用广义高斯分布进行不确定性感知

研究人员通过采用基于广义高斯分布(GGD)的状态条件形状头,引入了一种新颖的不确定性感知强化学习方法。该方法旨在更好地模拟由自举和探索可能产生的重尾和异方差残差,而这些通常会被传统的零均值高斯假设所忽略。所提出的技术使用数值修改的 GGD 损失和加权启发式方法,以及批量逆误差方差(BIEV)正则化,以提高在各种控制基准上的性能,尽管收益取决于具体任务。 AI

影响 引入了一种更鲁棒的方法来处理强化学习中的不确定性,有可能提高复杂控制任务的性能。

排序理由 关于强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的强化学习方法使用广义高斯分布进行不确定性感知

报道来源 [1]

  1. arXiv stat.ML TIER_1 English(EN) · Seyeon Kim, Joonhun Lee, Namhoon Cho, Sungjun Han, Wooseop Hwang ·

    Generalized Gaussian Temporal Difference Error for Uncertainty-aware Reinforcement Learning

    arXiv:2408.02295v4 Announce Type: replace-cross Abstract: Conventional uncertainty-aware temporal difference (TD) learning often models TD errors as zero-mean Gaussian. This assumption can miss the heavy-tailed and heteroscedastic residuals induced by bootstrapping and exploratio…