PulseAugur
中
实时 11:07:57
实体 GRASP-MDP

GRASP-MDP

PulseAugur coverage of GRASP-MDP — every cluster mentioning GRASP-MDP across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_191052 ·

    新框架推进马尔可夫决策过程在强化学习中的应用 · 跟踪2个来源

    两篇新的arXiv论文介绍了马尔可夫决策过程(MDP)的先进框架,MDP是强化学习中的一个关键工具。第一篇论文GRASP-MDP通过分离奖励和转移动力学来解决离线强化学习中的挑战,允许使用广义线性模型进行奖励,并更好地利用仅转移的观测。第二篇论文侧重于鲁棒平均奖励MDP,建立了极小极大最优学习界限,并提出了考虑模型不确定性的即插即用约简程序,实现了依赖于状态-动作空间和不确定性水平的样本复杂度率。