实体
Q-value iteration
Q-value iteration
PulseAugur coverage of Q-value iteration — every cluster mentioning Q-value iteration across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的强化学习方法实现了近乎最优的样本复杂度
研究人员开发了一种新的强化学习方法,该方法显著提高了递归熵风险偏好的样本复杂度。该论文对基于模型的风险敏感Q值迭代进行了精炼分析,实现了近乎最优的样本复杂度保证。这项工作缩小了有限折扣马尔可夫决策过程中现有上下界之间的差距,特别是在风险参数和有效视界方面。
-
新的Q值迭代分析采用切换几何方法
本文介绍了一种分析马尔可夫决策过程中Q值迭代的新框架,重点关注一种称为秩一降秩的技术。作者通过切换系统的几何学来解释算法的行为,提供了一种新颖的基于JSR的收敛性分析。他们的研究结果表明,降秩通过移除冗余分量,在不改变基本决策问题或由此产生的策略序列的情况下,提供了对收敛速度更精确的表征。