Markov decision processes: a tool for sequential decision making under uncertainty
PulseAugur coverage of Markov decision processes: a tool for sequential decision making under uncertainty — every cluster mentioning Markov decision processes: a tool for sequential decision making under uncertainty across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
新的强化学习方法实现了近乎最优的样本复杂度
研究人员开发了一种新的强化学习方法,该方法显著提高了递归熵风险偏好的样本复杂度。该论文对基于模型的风险敏感Q值迭代进行了精炼分析,实现了近乎最优的样本复杂度保证。这项工作缩小了有限折扣马尔可夫决策过程中现有上下界之间的差距,特别是在风险参数和有效视界方面。
-
鲁棒马尔可夫决策过程的新线性规划表示和算法
本文为鲁棒马尔可夫决策过程(RMDP)引入了新的线性规划(LP)表示和强多项式算法。研究侧重于奖励和转移不确定性的RMDP,特别是在有理多面体状态-动作矩形不确定性范围内。通过编码鲁棒策略迭代步骤,该研究构建了一个单一的LP,可以恢复最优鲁棒值和策略。本文还对鲁棒策略迭代进行了通用复杂度分析,从而改进了各种RMDP类型的复杂度界限,并为一般的区间、加权 $\ell_1$ 和 Wasserstein RMDPs 以及回合制随机博弈建立了…
-
新的强化学习算子解决了最优策略改进的近似评估问题
研究人员开发了一种用于强化学习(RL)中最优策略改进的新型算子,该算子解决了近似评估的挑战。这个新算子将不确定性下的贪婪化问题表述为概率决策问题。实证结果表明,该算子及其基于梯度的近似方法在各种RL算法和实验设置中都提高了性能,包括离散和连续动作,以及基于模型和无模型的方法。
-
新研究论文详述用于强化学习和GW问题的先进优化算法
两篇新研究论文探讨了机器学习优化算法的进展。第一篇论文介绍了一种用于强化学习的“快速正则化策略镜像下降”方法,在无需重置轨迹的情况下提供了改进的收敛保证和样本复杂度。第二篇论文提出了用于熵化Gromov-Wasserstein问题的“平均镜像下降”和对偶梯度方法,证明了比以往更广泛成本函数的收敛性,并在某些场景下优于经典方法。
-
新方法统一了强化学习在奖励和动力学上的泛化能力
研究人员引入了鲁棒后继特征,这是一种新颖的方法,它统一了强化学习在奖励函数和转移核上的泛化能力。该方法在线性马尔可夫决策过程中特别有效,尤其是在转移核不确定的情况下。这项工作为广义策略改进提供了理论界限,量化了由于转移核不匹配导致的性能下降,并在动力学一致时恢复了现有的后继特征保证。这些鲁棒后继特征的有效性已在基于网格的基准测试中得到证明,其性能优于先前仅处理奖励或转移泛化问题的方法。
-
新的几何理论分析结构化MDP中的决策边界
本文介绍了一种分析结构化马尔可夫决策过程(MDP)中最优策略的新几何理论。它提出,决策边界的几何形状,而非状态空间的大小,决定了策略重构和表示的复杂性。该研究建立了边界和决策复杂度的内在度量,推导了决策压缩的信息论界限,并为使用黑盒查询进行边界估计和策略重构提供了统计保证。数值实验支持该框架的理论预测。
-
揭示了随机多智能体系统社会法则的新框架
本文介绍了一个用于在随机环境中运行的多智能体系统的社会法则的新框架。它将先前从确定性环境中的工作扩展到基于奖励的场景,提出了一种定义和验证这些法则鲁棒性的方法。该研究引入了一个称为“alpha-鲁棒性”的概念,以量化遵守社会法则的智能体在追求其最优策略时保证的效用。作者提出了一种将问题简化为求解多个马尔可夫决策过程的验证方法,并通过实证评估展示了其潜力。
-
新的基于线性规划的算法为子模态MDP提供了更强的策略
研究人员开发了一种新的算法来解决子模态马尔可夫决策过程(MDP),这是一种具有广义奖励函数的序贯决策问题。该算法基于线性规划(LP)技术和Sherali-Adams层级思想,为子模态定向和子模态MDP提供了强大的近似保证。这项工作改进了先前的近似比,特别是对于子模态MDP,其先前的保证与时间范围成线性关系。
-
新的Windowed A-K-MDP算法改进了保护决策制定
研究人员推出了一种改进的马尔可夫决策过程(MDP)算法Windowed A-K-MDP,旨在改进生物多样性保护等领域的决策制定。该新方法通过系统地探索一系列离散化除数来寻找最优抽象状态,从而解决了先前A-K-MDP算法的局限性,避免了跳过更好解决方案的问题。在对33个K-MDP实例的评估中,Windowed A-K-MDP在25个案例中表现出改进,并在另外8个案例中表现相当,为复杂序列决策问题提供了更稳健的创建可解释MDP的方法。
-
新的贝尔曼方程针对强化学习中的塑性问题
研究人员引入了一个新的贝尔曼最优方程,专门用于优化持续强化学习中的塑性。这项工作建立在先前的一个形式化基础上,该形式化将稳定性-塑性权衡重新定义为赋能-塑性权衡,其中塑性由从观测到动作的有向信息定义,赋能由从动作到观测的有向信息定义。虽然赋能问题已被广泛研究,但本文首次尝试在马尔可夫决策过程中,在这一新定义下解决塑性优化问题。
-
新算法可在不可逆环境中实现安全学习
研究人员开发了一种新颖的学习算法,专为在具有不可逆动力学的环境中运行的智能体设计,在这些环境中错误无法撤销。该算法允许智能体向导师请求帮助,并在相似状态之间转移知识,从而实现安全运行和有效学习。所提出的方法即使在没有重置可能性的复杂、无界和高风险场景中,也能随着时间的推移实现亚线性遗憾和有限次数的导师查询。
-
开源ZGCM-1模型在数学和智能体搜索方面实现高效率
研究人员推出ZGCM-1,一个为数学推理和智能体搜索设计的7B参数基础模型。该模型利用了一种高效的训练方法,结合了交错注意力等架构创新、稳定的FP8 Muon优化器以及渐进式课程学习。ZGCM-1在特定任务上展现出与更大规模前沿模型相媲美的性能,并在训练时间上提供了显著的效率提升。
-
新算法 \Algname 增强了蒙特卡洛树搜索在随机环境中的性能
研究人员开发了一种新的蒙特卡洛树搜索(MCTS)算法,名为 \Algname,专门用于连续和随机马尔可夫决策过程(MDP)。这种新颖的方法整合了幂均值作为值备份算子和多项式探索奖励,以处理连续动作空间和非平稳性的复杂性。理论分析表明,\Algname 实现了多项式收敛速率,将先前的保证扩展到了随机环境。相关任务的实验结果证实了该算法在这些具有挑战性领域中的有效性。
-
用于机器人导航的新型风险规避Q学习方法
研究人员开发了一种新颖的风险规避强化学习方法,用于复杂的决策任务。该方法称为Mini-Batch Risk-Averse Deep Q-Learning,通过将转移风险映射应用于多个样本的经验测量来解决其估计的挑战。该技术被集成到Double Deep Q-Network中,以创建一种风险规避的Q学习算法。
-
新的RCSD方法优化通信受限下的多智能体协调
研究人员开发了一种名为可达性认证子团队分解(RCSD)的新方法,用于在通信受限下运行的多智能体系统。该技术旨在通过同时考虑邻近性和未来交互的可能性来优化协调,解决了当前仅依赖物理距离的方法的局限性。RCSD结合了速度限制计算和奖励包络,创建了一个状态亲和度度量,有助于形成最小化奖励删除错误的划分。在五智能体系统上的实验表明,与更简单的划分策略相比,RCSD-Exact将归一化执行遗憾降低了高达56.0%。
-
新的联邦强化学习算法最小化通信成本
研究人员推出了一种新颖的联邦算法 Fed-LSVI,专为具有线性函数逼近的在线强化学习而设计。该算法通过允许智能体仅共享压缩的充分统计量而非原始轨迹,来解决联邦设置中固有的通信和隐私挑战。Fed-LSVI 实现了与现有多个智能体方法相当的遗憾界限,同时将通信成本显著降低到与训练轮数对数相关的程度。
-
新基准测试应对医疗领域大语言模型代理的复杂性
两篇新研究论文提出了针对医疗环境中大语言模型(LLM)代理的先进基准测试协议。第一篇论文介绍了一种片段级评估协议,该协议将证据分离到模型、代理和模拟工作流程行为中,侧重于状态连续性、证据可追溯性和升级决策。第二篇论文提出了GPAgentBench-2K,这是一个用于初级保健临床决策的约束马尔可夫决策过程(CMDP)基准测试,它模拟了完整的临床行动范围,并纳入了安全知情的弃权。两项研究都强调了当前大语言模型代理在处理复杂的临床工作流程时…
-
新方法使用模型检查来测试LLM解释
研究人员开发了一种新颖的方法,用于自动测试大型语言模型(LLM)在用于解释顺序决策策略时生成的解释的准确性。该方法利用概率模型检查作为Oracle,以验证LLM生成的解释与底层环境的忠实度。通过根据策略行为构建测试输入并优先处理困难案例,该系统成功地区分了三个开源LLM,其中一个推理模型达到了85%的准确率,一个中型模型达到了70%,而一个1B模型则表现低于随机概率。
-
GFlowNets 应用于解决复杂的组合优化问题
研究人员开发了一种使用 GFlowNets 的新方法来解决复杂的组合优化问题,这些问题通常对于传统算法来说过于困难。该方法包括为各种问题设计特定的马尔可夫决策过程,并训练条件 GFlowNets 以生成多样化的高质量解决方案。大量实验表明,这种基于 GFlowNet 的策略在高效找到一系列任务的最优或接近最优的解决方案方面非常有效。
-
新型分类器自动机提高了 AI 数据分箱效率
研究人员引入了一种新型自动机,称为分类器自动机,专为 AI 系统将连续数据分类到离散箱中而设计。这种新型自动机泛化了比较器自动机,并提供了一个更有效的状态空间,其状态空间与箱的数量成线性关系,而先前方法的复杂度呈指数级增长。分类器自动机可应用于马尔可夫决策过程,以合成策略来优化具有不连续效用函数的折扣总收益的预期效用。