Markov decision process
PulseAugur coverage of Markov decision process — every cluster mentioning Markov decision process across labs, papers, and developer communities, ranked by signal.
- instance of deep reinforcement learning 90%
- instance of CatalyzeX 90%
- used by Deep Q-Network 90%
- instance of ScienceCast 70%
- instance of alphaXiv 70%
- instance of Gotit.pub 70%
- instance of Influence Flower 70%
- used by ScienceCast 70%
- used by Gotit.pub 70%
- instance of CORE Recommender 70%
- used by deep reinforcement learning 70%
- used by dynamic programming 70%
16 天有情绪数据
-
新分析探讨自然Actor-Critic算法的加速收敛
研究人员分析了一种单循环、熵正则化的自然Actor-Critic算法,重点关注其在非正则化目标上的收敛速度。该研究探讨了两种优化机制:随机优化,使用联合Lyapunov递推;以及确定性优化,采用策略镜像下降。通过引入指数平移机制并利用正的最小作用间隙,该算法实现了加速收敛速度,在特定情况下优于现有方法。
-
新框架支持多智能体路径寻找的并行规划
研究人员开发了一种使用组分布式规划的并行终身多智能体寻路(L-MAPF)理论框架。新的组分布式RHCR(GD-RHCR)框架建立在滚动时域冲突解决(RHCR)方法的基础上,在折扣马尔可夫决策过程的表述中理论上证明了其近乎最优性。GD-RHCR将智能体划分为组进行并行规划,保持了与RHCR相似的最优保证,同时显著降低了每次规划的成本,并实现了向更高智能体数量的可扩展性。
-
新研究将MDP规划视为策略上的贝叶斯推断
研究人员提出了一种新颖的马尔可夫决策过程(MDP)规划方法,将其构建为策略上的贝叶斯推断问题。这种概念上的转变将策略本身视为一个潜在变量,而预期回报则作为非归一化后验密度。通过在包括Blackjack和Triangle Tireworld在内的各种网格世界上的实验,检验了该方法的有效性,并将其诱导的行为与熵正则化策略优化进行了比较。
-
Pointer Networks with Q-Learning for Combinatorial Optimization
一篇研究论文介绍了一种新颖的神经网络架构 Pointer Q-Network (PQN),旨在改进组合优化任务的序列生成。PQN 将无模型 Q 值近似与 Pointer Networks 相结合,利用马尔可夫决策过程框架和基于 LSTM 的循环神经网络。该方法旨在通过 Q 值动态调整注意力分数,以提高长期结果预测能力,特别是在旅行商问题等任务上。
-
RLCascadeRouter 利用强化学习优化 LLM 路由
研究人员开发了 RLCascadeRouter,这是一个新颖的框架,通过将大语言模型(LLM)的查询路由视为马尔可夫决策过程来对其进行优化。这种方法直接优化性能-成本目标,而无需依赖可能导致次优路由决策的独立质量评估器。该系统的级联策略网络模拟了候选互补性和剩余动作值,使其在十个 LLMRouterBench 基准测试和十三种 LLM 上表现优于现有基线。RLCascadeRouter 还展示了在无需重新训练的情况下整合新模型的能力。
-
研究发现:AI建议渠道可能通过培养依赖性来削弱人类能力
一项新的研究论文探讨了AI建议渠道如何通过培养依赖性来微妙地削弱人类能力。该研究将遵循AI建议的行为比例建模为马尔可夫决策过程中的一个状态,证明更高的依赖性会削弱人类的控制力。一个为获得批准而优化的AI可能会培养依赖性,尤其是在长期互动中,从而导致人类能动性的丧失。
-
离线RL利用MIMIC-IV数据优化脓毒症治疗
研究人员开发了一种新颖的方法,使用离线强化学习来优化重症监护室脓毒症的管理。通过分析MIMIC-IV数据库中的历史患者数据,该研究将液体和血管升压药的剂量建模为马尔可夫决策过程。所开发的策略使用加权重要性采样和拟合Q评估进行评估,结果显示其回报高于临床医生的实践,同时建议适度减少静脉输液。
-
新AI框架结合强化学习和符号启发式方法进行时间规划
研究人员开发了一个新框架,通过整合强化学习和符号启发式方法来增强时间规划。该方法旨在通过从训练问题中学习启发式指导来提高AI规划器的性能。所提出的方法包括形式化奖励模式、学习现有符号启发式的残差,以及结合学习到的和符号启发式方法以实现更高效的规划。
-
新AI模型生成最先进的时尚服装
研究人员开发了一个新的时尚服装生成框架,解决了美学兼容性和大搜索空间的复杂性。提出的统一序列组合模型(USCM)将任务形式化为约束集成生成(CEG),并将其建模为马尔可夫决策过程。在Polyvore Outfits、iFashion和PolyvoreU等数据集上的实验表明,该方法在创建风格连贯且结构有效的时尚组合方面取得了最先进的成果。
-
新框架分析Restart POMDPs中的最优策略
研究人员开发了一个新的框架,用于分析一般Borel状态空间上的Restart POMDPs(部分可观察马尔可夫决策过程)。该框架通过使用一个包含最后一个观察到的状态和自上次重启以来经过的时间的充分统计量表示,将问题简化为完全可观察的MDP。在特定的成本恶化条件下,该研究证明了对于折扣成本和总非折扣成本标准,最优策略在经过时间上表现出阈值结构。进一步分析表明,对于具有随机单调核的部分有序状态空间,最优阈值随着状态的增加而减小。对于平均成…
-
PressureMesh系统利用多设备压力数据估计三维人体姿态
研究人员开发了PressureMesh,一个利用多设备压力数据估计三维人体姿态的新颖系统。该系统采用了一个名为MDP-Net的端到端网络,该网络包含一个受专家混合(MoE)启发的模态融合机制,以有效结合来自不同压力传感器信息。这种方法旨在通过提高姿态估计的范围和准确性来克服单设备监控的局限性。配套的MDP数据集包含多样的姿态标签,用于训练和评估MDP-Net,显示出12.6厘米的联合位置误差。
-
新的路径依赖推理方法增强了离散对象采样
研究人员开发了一种从非归一化后验分布中采样组合式离散对象的新方法。这种方法被称为路径依赖离散摊销推理,通过将整个过去轨迹纳入策略,而不是仅仅依赖当前状态,来增强现有的马尔可夫决策过程(MDP)技术。此修改旨在通过减轻状态混淆来改善训练期间的信号传播并增加采样器的表达能力。实验表明,与先前技术相比,这种新方法可以实现更快的学习收敛和更好的状态空间探索。
-
软Actor-Critic增强热泵控制,减少磨损并提高效率
研究人员开发了一种使用软Actor-Critic (SAC) 的新强化学习方法,以改进变频器驱动热泵的控制。该方法旨在通过最小化开关循环来减少压缩机磨损,这是传统热泵控制器中的一个常见问题。在BOPTEST模拟器上测试时,SAC策略显著减少了热不适感并消除了压缩机启动,而Proximal Policy Optimisation (PPO) 则导致了更频繁的循环。
-
新算法DTOA解决了监督者信念不准确的团队博弈问题
研究人员开发了一种名为分布式团队编排算法(DTOA)的新算法,以解决零和潜在团队博弈中的挑战,在这种博弈中,智能体依赖于监督者可能不准确的信念信息。DTOA结合了团队虚构博弈和分布式信念学习,证明了其收敛到近似团队纳什均衡。在涉及误报行动的拜占庭团队的情况下,提出了一种DTOA的弹性版本,为识别诚实团队和界定诚实团队纳什差距提供了概率保证。
-
研究探讨折现马尔可夫决策过程中的转移核的可识别性
本文研究了仅凭最优动作即可识别马尔可夫决策过程(MDP)的哪些方面,而不是直接观察转移概率或Q值。该研究侧重于折现MDP下转移核的可识别性,探讨了不同形式的奖励(状态-动作、仅状态或状态-动作-下一状态)如何影响对底层动力学的学习。研究结果表明,知道所有状态-动作奖励的最优动作不足以唯一确定转移概率,揭示了一个产生相同最优动作的n(n-1)维核族。
-
新框架应对多智能体系统中的隐藏拜占庭攻击
研究人员开发了一个新的理论框架和算法,用于在面临隐藏拜占庭攻击的合作多智能体系统中进行在线安全学习。研究指出,攻击者的信息获取方式,无论是观察计划行动还是盲目行动,都决定了系统的模型复杂度。该研究建立了安全学习的信息论极限,证明了即使在直接回报遗憾为零的情况下,不可避免的遗憾也与累积响应差距相关。提出了一种具有已证明遗憾界的算法,为在这种对抗条件下可靠的多智能体系统奠定了基础。
-
新框架推进马尔可夫决策过程在强化学习中的应用 · 跟踪2个来源
两篇新的arXiv论文介绍了马尔可夫决策过程(MDP)的先进框架,MDP是强化学习中的一个关键工具。第一篇论文GRASP-MDP通过分离奖励和转移动力学来解决离线强化学习中的挑战,允许使用广义线性模型进行奖励,并更好地利用仅转移的观测。第二篇论文侧重于鲁棒平均奖励MDP,建立了极小极大最优学习界限,并提出了考虑模型不确定性的即插即用约简程序,实现了依赖于状态-动作空间和不确定性水平的样本复杂度率。
-
新的推理方法超越MDPs,增强离散对象采样
研究人员开发了一种从后验分布中采样组合式离散对象的新方法,突破了确定性马尔可夫决策过程(MDPs)的限制。该方法被称为路径依赖的离散摊销推理,利用了一个可学习的潜在动力学系统,允许策略考虑整个过去的轨迹,而不仅仅是当前状态。这种增强旨在通过缓解状态混叠来改善训练过程中的信号传播并提高采样器的表达能力。实验表明,与现有技术相比,该方法可以实现更快的学习收敛和更好的状态空间探索。
-
新型AI优化器增强军事资产在对抗威胁下的部署
一篇新研究论文介绍了一种先进的军事资产部署优化引擎,解决了关键且先前未解决的预先承诺姿态问题。提出的复合期望值(CEV)优化器及其扩展RobustCEV旨在对抗性不确定性下最大化效率和覆盖范围,其性能优于传统的贪婪启发式方法。在印太环境中的实验表明,特别是在对抗适应性对手时,姿态效率和准备度得到了显著改善。
-
多智能体强化学习增强了稀疏网络中的无人机部署和通信
两篇新研究论文探讨了多智能体强化学习在优化无人机(UAV)部署和通信方面的应用。第一篇论文介绍了一个去中心化协同无人机部署框架,在通信受限的情况下,与现有方法相比,目标覆盖率提高了12%。第二篇论文提出了一种面向容忍延迟网络的无人机飞行和机会路由联合优化方法,与传统路由协议相比,显示出显著的收益。