Policy Evaluation
PulseAugur coverage of Policy Evaluation — every cluster mentioning Policy Evaluation across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新算法解决了强化学习策略评估中的高方差问题
研究人员开发了一种新的双循环基于梯度的算法,以解决强化学习策略评估中的高方差问题。该方法专门处理转移函数中的不确定性,而这些不确定性通常会导致在模拟中训练的策略在现实世界环境中表现不佳。该算法推导出了新颖的转移方差梯度表达式,并建立了全局收敛保证,与现有方法相比,在应对转移扰动方面表现出更强的鲁棒性。
-
DoTime生成器增强了时间序列因果推断基准
研究人员开发了DoTime,这是一种新的合成基准生成器,旨在解决现有工具在评估时间序列数据因果推断方面的局限性。这个开源Python包旨在改进干预和反事实估计的评估,这对于医疗保健、政策评估和气候学等领域至关重要。DoTime引入了连续时间干预窗口、反事实采样模式和状态切换结构因果模型等高级功能,为生成复杂的时间因果模型提供了一种更强大、更可扩展的方法。
-
用于外生上下文MDP学习的新minimax PAC界限
研究人员为外生上下文马尔可夫决策过程(MDP)中的学习开发了新的minimax PAC界限。该研究侧重于具有外生、独立同分布(i.i.d.)上下文的表格折扣MDP,这些上下文会影响奖励和转移。所提出的算法在策略评估、最佳值估计和最佳策略提取方面提供了改进的样本复杂度,其速率独立于上下文空间大小且是minimax最优的。
-
一项新的研究探讨了强化学习中用于控制任务的贝尔曼残差最小化方法
本文介绍了将贝尔曼残差最小化应用于马尔可夫决策问题策略优化的基础性研究成果。虽然动态规划更为常见,但贝尔曼残差最小化在函数逼近方面具有稳定的收敛性等优势。该研究侧重于将此方法扩展到控制任务,而控制任务的探索程度不如策略评估。