研究人员通过采用基于广义高斯分布(GGD)的状态条件形状头,引入了一种新颖的不确定性感知强化学习方法。该方法旨在更好地模拟由自举和探索可能产生的重尾和异方差残差,而这些通常会被传统的零均值高斯假设所忽略。所提出的技术使用数值修改的 GGD 损失和加权启发式方法,以及批量逆误差方差(BIEV)正则化,以提高在各种控制基准上的性能,尽管收益取决于具体任务。 AI
影响 引入了一种更鲁棒的方法来处理强化学习中的不确定性,有可能提高复杂控制任务的性能。
排序理由 关于强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →