PulseAugur
实时 14:32:08
实体 Markov decision processes: a tool for sequential decision making under uncertainty

Markov decision processes: a tool for sequential decision making under uncertainty

PulseAugur coverage of Markov decision processes: a tool for sequential decision making under uncertainty — every cluster mentioning Markov decision processes: a tool for sequential decision making under uncertainty across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 53
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 52
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/3 页 · 共 53 条
  1. RESEARCH · CL_208385 ·

    新方法应对多智能体决策中的复杂性

    研究人员提出了一种新颖的方法来解决多智能体系统中去中心化部分可观察马尔可夫决策过程(DecPOMDPs)的指数级复杂性问题。该论文提出将焦点从计数智能体转移到计数策略,一种称为“策略计数DecPOMDPs”的方法,从而在智能体数量上实现可处理性。这个新框架利用策略计数动态规划来有效地解决这些复杂问题。

  2. TOOL · CL_205850 ·

    为受限平均奖励 MDP 建立了新的界限

    研究人员在生成模型下,为受限平均奖励马尔可夫决策过程(CAMDPs)建立了近最优样本复杂度界限。所提出的基于模型的算法在宽松可行性方面实现了 $\tilde{O}(\frac{S A (B+H)}{ \epsilon^2})$ 的样本复杂度,在严格可行性方面实现了 $\tilde{O}(\frac{S A (B+H)}{ \epsilon^2 \zeta^2})$ 的样本复杂度。还证明了严格可行性情况下的匹配下界 $\tilde{\O…

  3. TOOL · CL_200150 ·

    新算法应对去中心化多玩家强化学习

    研究人员开发了用于信息不对称的去中心化多玩家强化学习在片段式马尔可夫决策过程(MDP)中的新算法。提出的方法 mQ-learning、mQ-learning-intervals、mEXC 和 mEXC-Bellman 解决了未观察到的动作以及独立或共同奖励的情况。与集中式学习相比,这些算法实现了具有竞争力的遗憾界限,尤其是在玩家数量较少或动作集有限的情况下。

  4. TOOL · CL_191329 ·

    新的亚二次方法改进了 MDP 的双模拟度量计算

    研究人员开发了一种新颖的亚二次方法来计算马尔可夫决策过程(MDP)中的双模拟度量。这种新方法利用近似最近邻(ANN)索引来有效地选择状态对进行更新,与传统的二次方法相比,大大降低了计算成本。该技术提供了覆盖增强的保证,确保即使并非所有状态对都得到更新,全局误差也能得到控制,并提供了可计算的双边证书来验证度量的准确性。

  5. RESEARCH · CL_191052 ·

    新框架推进马尔可夫决策过程在强化学习中的应用 · 跟踪2个来源

    两篇新的arXiv论文介绍了马尔可夫决策过程(MDP)的先进框架,MDP是强化学习中的一个关键工具。第一篇论文GRASP-MDP通过分离奖励和转移动力学来解决离线强化学习中的挑战,允许使用广义线性模型进行奖励,并更好地利用仅转移的观测。第二篇论文侧重于鲁棒平均奖励MDP,建立了极小极大最优学习界限,并提出了考虑模型不确定性的即插即用约简程序,实现了依赖于状态-动作空间和不确定性水平的样本复杂度率。

  6. TOOL · CL_183141 ·

    新框架优化随机决策中的反事实策略

    研究人员开发了一种新方法,用于优化涉及固有随机性的顺序决策场景中的反事实策略。该方法在非确定性因果模型下形式化了反事实策略优化,区分了潜在混淆和不可约随机性。所提出的框架包括一个敏感性分析,用于识别鲁棒的反事实策略,并通过使用糖尿病状况作为隐藏混淆因素的败血症治疗模拟器证明了其有效性。

  7. TOOL · CL_182999 ·

    新的量子算法增强了生成模型中的强化学习

    研究人员开发了新的量子算法,旨在提高生成模型中强化学习的效率。这些算法利用量子子程序,如量子均值估计和量子最大值查找,并结合了样本最优经典算法中的技术。所提出的方法旨在计算有限 horizonte 和无限 horizonte 折扣马尔可夫决策过程的近似最优策略,显示出接近已建立的量子下界的改进查询复杂度。

  8. TOOL · CL_174014 ·

    新的因果抽象技术提高了 MDP 的可扩展性

    研究人员开发了一种新的面向属性的因果抽象技术,用于马尔可夫决策过程(MDP),以解决可扩展性挑战。该方法利用状态变量谓词上的因果关系来识别具有相似原因来满足或违反抽象属性的状态。该方法已在各种 MDP 模型(包括区间 MDP 和随机博弈)上进行了理论和经验评估,证明了其创建更小抽象的潜力,这些抽象能够计算原始 MDP 的近优策略,并推广到相关的大规模模型。

  9. TOOL · CL_169634 ·

    新方法简化了马尔可夫决策过程的决策树

    研究人员开发了一种名为 dtControl2+$\\varepsilon$ 的新方法,用于为马尔可夫决策过程中的控制器创建更小、更易于理解的决策树。该方法通过引入可控的精度 $\\varepsilon$,实现了控制器可调的简化,确保了 $\\varepsilon$-最优性,同时与现有方法相比显著减小了决策树的大小。该工具旨在通过省略可控数量的细节,使复杂的控制器更易于人类理解。

  10. TOOL · CL_177166 ·

    新的dtControl2+$\\varepsilon$方法简化了马尔可夫决策过程的决策树

    研究人员开发了一种名为dtControl2+$\varepsilon$的新方法,用于为马尔可夫决策过程创建更小、更具可解释性的决策树。该技术通过引入可控的不精确度($\varepsilon$),实现了控制器可调的简化,从而生成比当前最先进方法小几个数量级的决策树,同时保持$\varepsilon$-最优性。

  11. TOOL · CL_167608 ·

    新算法增强了MDP中风险感知强化学习

    研究人员开发了用于马尔可夫决策过程(MDP)中策略评估的新在线学习算法,该算法纳入了动态基于效用的损失风险(UBSR)度量。提出的UBSR-TD算法及其变体设计用于与线性函数逼近高效使用,并建立了几乎必然收敛的条件。这些方法通过修改具有特定损失函数的时序差分误差来调整现有的风险中性策略评估算法,并通过实验证明了其在实践中的效用,包括在保质期不确定性下的易腐库存管理中的应用。

  12. TOOL · CL_167113 ·

    新研究为自然策略梯度算法提供有限时间收敛保证

    一篇新发表在arXiv上的研究论文首次为有限时间马尔可夫决策过程中的自然策略梯度(NPG)算法提供了有限时间收敛保证。该研究在恒定步长和递增步长两种情况下分析了NPG,证明了恒定步长下的次线性收敛率和递增步长下的线性收敛率。这些发现对强化学习具有重要意义,因为NPG是Trust Region Policy Optimization和Proximal Policy Optimization等流行方法的基础。

  13. RESEARCH · CL_147426 ·

    研究论文质疑离线强化学习在治疗推荐中的稳健性

    一篇新发表在arXiv上的研究论文,探讨了长时限马尔可夫决策过程(Markov decision processes)中协变量平衡性诊断的有效性,特别是在治疗推荐的离线强化学习(offline reinforcement learning)背景下。研究表明,当前的离线强化学习研究可能存在很高的偏倚风险,或者现有的平衡性指标不足以进行稳健的评估。作者建议进一步研究,以在该领域开发更具方法学严谨性的离线强化学习应用。

  14. RESEARCH · CL_147446 ·

    新的 PAC 学习方法用于具有私有信息的随机博弈

    研究人员开发了一种新的方法,用于在具有可达性目标的轮流随机博弈 (TBSGs) 中进行 PAC 学习。这项工作引入了一种允许去中心化学习(玩家不共享相同的学习算法)和私有信息学习(不与其他玩家共享)的方法。该研究还提出了期望条件距离 (ECD) 参数的一种博弈论推广,用于衡量到达目标集的时间期望,并建立了多项式样本复杂度界限。

  15. RESEARCH · CL_139209 ·

    新框架正式化马尔可夫过程中的风险感知决策

    研究人员引入了风险感知通用效用马尔可夫决策过程(GUMDPs),以允许智能体优化目标值的风险度量,从而在预期性能和风险规避之间进行权衡。所提出的框架侧重于熵风险度量(ERM),并展示了如何使用在线规划技术(特别是蒙特卡洛树搜索(MCTS))来解决这些风险感知GUMDPs。实验结果表明,该方法在各种任务中都有效,包括标准的MDP、探索、模仿学习和多目标MDP。

  16. RESEARCH · CL_135131 ·

    新算法增强了自主代理的鲁棒奖励学习能力

    研究人员开发了一种新的机器学习算法,旨在提高自主代理奖励学习的鲁棒性。该算法跨越多个马尔可夫决策过程(MDP),并选择信息丰富的环境来暴露互补的奖励约束。然后,它在这些选定的环境中策略性地查询低成本反馈。这种多环境、多模态的方法与统一教学方法相比,表现出显著更低的遗憾和对未见环境的更好泛化能力,突显了其在学习动态鲁棒奖励函数方面的重要性。

  17. RESEARCH · CL_135158 ·

    研究人员为对决 Q-Learning 提供谱分析和收敛性保证

    本文对对决 Q-Learning 进行了谱分析,对决 Q-Learning 是强化学习中使用的 Q-Learning 算法的扩展。该研究侧重于为该算法的无正则化表格版本提供理论理解和收敛性保证。作者推导了确定性对决 Q-Learning 的线性系统表示,并为随机版本建立了有限时间误差界限,阐明了值和优势更新如何影响 Q 函数分量。

  18. TOOL · CL_131563 ·

    新框架通过在线贝叶斯学习增强数字孪生

    研究人员开发了一个新的自适应数字孪生框架,该框架增强了其在土木工程应用中的价值。该方法利用动态贝叶斯网络来模拟物理系统和虚拟系统之间的交互,通过贝叶斯更新实现状态转移动力学的在线学习。该框架允许比当前方法更广泛的分布范围,并采用强化学习来解决参数马尔可夫决策过程,以制定精确的动态策略。这导致了更个性化、更鲁棒、更具成本效益的数字孪生,正如在铁路桥梁结构健康监测和维护规划的案例研究中所证明的那样。

  19. TOOL · CL_131508 ·

    新框架从轨迹中学习状态表示,无需奖励

    研究人员为马尔可夫决策过程(MDP)开发了一个新颖的状态表示框架,该框架直接从状态轨迹中学习,无需奖励信号或显式动作数据。该方法侧重于学习状态之间的最小动作距离(MAD),它量化了在它们之间移动所需的最少动作。通过创建一个距离反映MAD的嵌入空间,这种方法有助于目标条件强化学习和奖励塑造等下游任务,在各种环境中展示了优于现有状态表示技术的性能。

  20. TOOL · CL_119723 ·

    量子贝叶斯网络加速复杂环境中的强化学习

    研究人员开发了量子贝叶斯强化学习(QBRL),这是一种混合量子-经典算法,旨在增强部分可观察环境中的决策能力。这种新方法利用量子拒绝采样和幅度放大来加速基于模型的强化学习中的信念更新。QBRL算法在表示稀疏贝叶斯网络的稀疏环境中的规划方面显示出亚二次加速的潜力,但对于完全可观察的环境或具有密集贝叶斯网络的稀疏环境没有优势。