Q-learning
PulseAugur coverage of Q-learning — every cluster mentioning Q-learning across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
新的QWM框架通过世界模型增强强化学习
研究人员推出了一种新颖的QWM框架,该框架将世界模型与Q学习相结合,以提高强化学习的样本效率。该方法使用世界模型在想象的轨迹上进行测试时搜索,从而在不直接在预测状态上优化策略的情况下改进动作选择。QWM仅在真实转换上进行训练,从而避免了模型偏差的累积,并在RoboMimic和LIBERO等具有挑战性的操纵基准上展示了显著的性能提升。
-
Pointer Networks with Q-Learning for Combinatorial Optimization
一篇研究论文介绍了一种新颖的神经网络架构 Pointer Q-Network (PQN),旨在改进组合优化任务的序列生成。PQN 将无模型 Q 值近似与 Pointer Networks 相结合,利用马尔可夫决策过程框架和基于 LSTM 的循环神经网络。该方法旨在通过 Q 值动态调整注意力分数,以提高长期结果预测能力,特别是在旅行商问题等任务上。
-
新的Q学习方法解决了大动作空间中的过高估计偏差问题
本文解决了Q学习中的过高估计偏差问题,特别是在大离散动作空间中。作者提出了一种“动作交集”策略,通过允许两个Q函数之间共享轨迹数据来半解耦Q值估计。该方法通过调整数据共享比例,提供对估计偏差的精细控制,使其范围从低估到过高估计。在表格和深度强化学习环境中的实验表明,与现有的最先进基线相比,该方法有了显著的改进。
-
新算法应对去中心化多玩家强化学习
研究人员开发了用于信息不对称的去中心化多玩家强化学习在片段式马尔可夫决策过程(MDP)中的新算法。提出的方法 mQ-learning、mQ-learning-intervals、mEXC 和 mEXC-Bellman 解决了未观察到的动作以及独立或共同奖励的情况。与集中式学习相比,这些算法实现了具有竞争力的遗憾界限,尤其是在玩家数量较少或动作集有限的情况下。
-
已撤稿的论文提出了用于IoMT WBAN的Q学习路由
这篇已被撤稿的论文提出了一种名为QQMR的Q学习基础路由协议,用于无线体域网(WBAN)中的医疗物联网(IoMT)。QQMR旨在通过将数据划分为优先级级别,并使用自适应排队和模糊C均值聚类进行优化路由,来应对动态拓扑和能源限制等挑战。作者声称实验结果显示,与现有方法相比,该协议提高了数据包的传输成功率,减少了延迟,并降低了能耗。
-
新的强化学习算法优化激光切割参数,减少时间和浪费
一篇新研究论文介绍了一种名为“激光切割强化学习”(RL^2C)的算法,旨在优化用于光学薄膜激光切割的参数。与传统的试错法和其他强化学习技术相比,这种基于Q学习的方法显著减少了优化步骤和处理时间。RL^2C旨在提高切割质量,最大限度地减少材料浪费,并减少工业激光切割过程中的手动干预。
-
新框架支持复杂AI算法的在线统计推断
研究人员开发了一种新颖的在线统计推断框架,用于利用马尔可夫数据的非线性随机逼近算法。该框架为部分和路径建立了函数中心极限定理,无需估计渐近方差即可创建自归一化置信区间。所提出的方法采用五维多项式级数归一化器,展示了接近标称的覆盖率,并与在线bootstrap方法相比降低了计算成本。其应用包括Q学习、具有马尔可夫数据的广义线性模型以及低秩自适应(LoRA)的推断。
-
新的LUQ-Learning方法优化患者特定治疗方案
研究人员开发了潜在效用Q-Learning(LUQ-Learning),一种用于优化动态治疗方案(DTRs)的新方法,该方法考虑了患者在多种结果上的不同偏好。这种方法将偏好估计与结果回归分离,即使在偏好观察不完美或异质的情况下也能实现灵活学习。模拟表明,LUQ-Learning的性能优于现有方法,包括具有朴素结果聚合的标准Q-Learning。
-
新的自适应训练控制器增强了金融任务的风险感知Q学习能力
研究人员开发了一种用于条件在险价值(CVaR)风险感知Q学习(RaQL)的自适应训练控制器,以提高其在金融应用中的稳定性和样本效率。该控制器引入了六个协调机制来改进训练过程,而无需更改核心CVaR估计器。在比特币交易任务上的评估显示,与固定参数基线相比,Bellman残差显著减少,风险调整后的性能得到改善,夏普比率达到0.9281,同时波动性和回撤大幅降低。
-
新的SADQ方法增强了深度Q网络中Q学习的稳定性
研究人员引入了后继者回溯聚合深度Q网络(SADQ),这是一种新颖的Q学习修改,旨在提高深度Q网络(DQN)的训练稳定性。SADQ通过使用从学习到的动力学模型进行的一次性回溯预测来解决DQN对估计噪声过于敏感的问题。这种方法指导未来回报的聚合,减少了最大化算子偏向不可靠估计所引起的误差放大。理论分析和在各种控制任务及Atari基准上的实证结果表明,与现有的DQN变体相比,SADQ在减轻高估和增强训练稳定性方面是有效的。
-
Gated Q-learning 提出强化学习偏差的新方法
研究人员引入了 Gated Q-learning,这是一个旨在解决强化学习中离线策略偏差和样本效率平衡这一长期挑战的新框架。与强制在截断学习或有偏估计之间做出选择的先前方法不同,Gated Q-learning 使用依赖于状态-动作的门控机制来选择性地衰减资格痕迹。这种方法允许更长的信用分配范围,而不会产生传统方法的有害错误,从而在经验评估中实现更快的初始学习。
-
TRUAV框架使用分布式Q学习用于无人机辅助的车辆自组织网络
研究人员开发了TRUAV,一个新颖的分布式多智能体强化学习框架,专为无人机辅助的车辆自组织网络(VANETs)中的轨迹规划和路由增强而设计。该系统利用每个无人机上的独立Q学习智能体,仅依赖局部观测来优化定位和路由,而无需全局网络状态聚合。仿真表明,TRUAV在覆盖范围和数据包传输方面与集中式深度强化学习方法相当,同时在中继延迟和能源效率方面也有所提高。
-
新指标揭示多智能体AI协调中的时间公平性差距
研究人员开发了新的指标来评估多智能体系统中的时间公平性,特别是在重复博弈场景中。这些“交替(ALT)指标”解决了传统基于结果的度量标准的局限性,后者可能掩盖资源访问的差异。该研究引入了完美交替(PA)作为公平轮流的基准,并证明了即使是具有高奖励公平性得分的智能体也可能表现出较差的时间协调性,在新ALT指标上的表现显著不如随机策略。
-
Equilibrium stability drives cooperation in Q-learning algorithms
一篇新的研究论文探讨了在探索不会随时间消失的情况下,均衡稳定性如何驱动Q学习者之间的合作。该研究聚焦于重复的囚徒困境,分析了持续适应的算法所采用的合作策略的时间平均比例。研究人员推导出了一个预测非背叛主导行为何时出现的边界条件,并通过对epsilon-greedy Q学习的大量模拟进行了验证。
-
ADORN 使用强化学习管理开放无线接入网中的 AI/ML 模型漂移
研究人员开发了 ADORN,这是一种管理开放无线接入网 (O-RAN) 中使用的 AI/ML 模型的性能漂移的新方法。该系统利用基于 Q 学习的强化学习代理来做出自适应再训练决策,平衡预测准确性与计算成本。ADORN 采用多专家长短期记忆 (LSTM) 集成,以防止灾难性遗忘并增强模型在不同流量条件下的鲁棒性。实验结果表明,与现有方法相比,ADORN 显著降低了再训练开销,同时确保系统性能保持在服务水平协议之内。
-
研究人员为对决 Q-Learning 提供谱分析和收敛性保证
本文对对决 Q-Learning 进行了谱分析,对决 Q-Learning 是强化学习中使用的 Q-Learning 算法的扩展。该研究侧重于为该算法的无正则化表格版本提供理论理解和收敛性保证。作者推导了确定性对决 Q-Learning 的线性系统表示,并为随机版本建立了有限时间误差界限,阐明了值和优势更新如何影响 Q 函数分量。
-
强化学习系列介绍 Q-learning 及其对 DQN 的影响
Shawn Hymel 发布了他的强化学习系列文章的第十篇,重点介绍了 Q-learning。该方法与 SARSA 的不同之处在于,它利用下一个动作的最大 Q 估计值,这一技术为深度 Q 网络 (DQN) 铺平了道路。该文旨在向读者介绍强化学习中的这一基本概念。
-
文章发现,强化学习中的因果推理面临数据损坏的挑战
一篇新文章探讨了将因果推理整合到强化学习(RL)智能体中的挑战。虽然因果模型有望为RL带来更强的泛化能力和干预能力,但如果学习到的因果图不正确,其性能可能比标准的基于相关性的方法更差。文章强调,RL智能体策略收集的数据会破坏因果发现过程,使得某些因果关系在统计学上变得不可见。这项工作旨在阐明因果模型何时能使RL从业者和研究人员受益,尤其是在非平稳环境中。
-
Q学习理论通过新的误差分析和切换系统框架得到推进 · 跟踪2个来源
两篇新研究论文从不同的理论角度分析了Q学习,一种基础的强化学习算法。第一篇论文侧重于Q学习固有的高估偏差,将误差分解为正负分量,以推导出单独的有限时间收敛速率。第二篇论文将线性Q学习置于切换线性系统理论的框架内,使用联合谱半径来分析有限时间误差并提供收敛证明。
-
新的RL-HGGA算法加速装箱问题解决方案
研究人员开发了RL-HGGA,这是一种结合了元启发式方法和强化学习来解决一维装箱问题的新型算法。这种混合方法使用Q学习代理动态选择遗传算子,从而在保持具有竞争力的解决方案质量的同时,显著减少了计算时间。在基准数据集上的实验表明,RL-HGGA的平均最优性差距为0.95%,在效率方面比以前的方法有了实质性改进。