Q-learning
PulseAugur coverage of Q-learning — every cluster mentioning Q-learning across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新的SQAM方法增强了流量策略的强化学习
研究人员开发了一种名为Q-learning with Scalar Adjoint Matching (SQAM)的新方法,以改进强化学习中流量策略的微调。该技术通过推导一个闭式标量伴随,消除了每步的向量-雅可比乘积,从而解决了传统伴随匹配的计算成本问题。SQAM在具有挑战性的OGBench领域取得了显著成功,性能优于现有基线18至35个百分点,并且在真实机器人任务上微调大型视觉-语言-动作策略方面也显示出有效性。
-
量子强化学习大幅降低5G网络能耗
研究人员开发了一种新颖的量子强化学习(QRL)算法,以显著降低5G及未来网络中的能耗。该方法解决了基站高能耗的挑战,基站占网络能耗的很大一部分。通过利用叠加和纠缠等量子原理,QRL算法比传统的深度强化学习(DRL)方法收敛更快。模拟显示,QRL在保持服务质量的同时能有效降低能耗,在速度和学习复杂度方面均优于DRL和Q-Learning。
-
新的Q学习算法为MDP提供无模型可达性
研究人员开发了Quasar,一种新颖的无模型算法,它使用Q学习在没有非终端最大结束组件(MECs)的马尔可夫决策过程(MDPs)中实现可达性规范的渐近收敛。这种方法消除了对显式估计转移概率的需求,而这是先前基于模型的方法的要求。与现有的最先进的基于模型的技术相比,Quasar显著减小了内存占用,并在定量验证基准集上展示了更快的收敛速度,标志着在规范引导强化学习方面迈出了实用性的一步。
-
新的HybridInfer系统利用热感知来路由大语言模型推理
一篇新研究论文介绍HybridInfer,一个旨在管理设备端、边缘端和云端大语言模型(LLM)推理的系统。该系统解决了设备端推理的热限制问题,这种限制可能导致移动GPU在持续使用过程中崩溃或无响应。HybridInfer采用强化学习方法,特别是Q学习,根据估计的复杂性、可用的热余量以及质量、延迟、成本和本地性之间的权衡来动态路由查询。这种方法旨在与始终使用设备端模型相比,提高可靠性并降低延迟,特别是对于较长的查询。
-
人工智能代理商在与一致的合作伙伴配对时学会提高价格
一篇新发表在arXiv上的研究探讨了定价代理商如何在重复的Bertrand竞争场景中学习设定价格。研究发现,与一致的合作伙伴配对的代理商会持续设定更高的价格,将利润提高了约0.27的竞争利润与垄断利润之间的差距。即使代理商看不到对手的价格,也观察到了这种效应,这表明存在一种学习到的惩罚机制或独立于直接观察的战略定价。使用Qwen2.5模型进行的探索性测试表明,当对手的价格从提示中省略时,会出现类似的定价行为。
-
新的QEMScore指标挑战学习型量子纠错声明
提出了一种名为QEMScore的新评分指标,以更好地评估学习型量子纠错技术。该指标将学习型纠错器与使用相同电路描述但未读取测量数据的容量匹配的对照模型进行比较。实验表明,在受控环境中,简单的多项式拟合可以优于学习型纠错器,并且对照模型通常能匹配学习型纠错器增益的很大一部分。然而,对已发布的硬件数据的分析显示,测量输入可以为Q-LEAR和QRAFT等特定学习器带来预测性增益。
-
新技术分析Q学习的收敛性和随机逼近中的偏差
研究人员开发了一种新技术,用于分析非光滑收缩随机逼近(SA)动力学,这与Q学习特别相关。该研究在Wasserstein距离下,对加性噪声以及加性和乘性噪声的同步/异步Q学习的迭代弱收敛到平稳极限分布进行了证明。引入了一种新颖的预极限耦合方法,以证明稳态收敛并表征步长趋近于零时的极限分布,揭示了与光滑SA不同,存在与步长平方根成比例的渐近偏差。
-
新的HQARRF系统提高了无线网络中传感器的生存率
一篇新研究论文介绍了一种名为HQARRF的两级调度系统,该系统专为无线可充电传感器网络设计。该系统旨在通过考虑传感器死亡风险、充电器能量和旅行成本等因素来优化多充电器调度。据报道,与现有基线相比,HQARRF系统将传感器的平均生存率提高了20多个百分点。
-
新框架模拟具有环境反馈的多智能体Q学习
研究人员开发了一个新的框架,使用进化计算来模拟复杂环境反馈回路中的多智能体Q学习。该模型模拟了单个智能体学习、局部交互和环境变化如何相互影响。该框架使用平均场近似来预测群体行为,并通过在各种图结构上进行模拟进行了验证,结果表明该近似对于更大的群体和更高的平均度通常成立。
-
新的Q-SVMPC方法通过RL和SVGD增强轨迹优化
研究人员开发了Q-SVMPC,一种新颖的模型预测控制(MPC)方法,它利用Q学习和Stein变分梯度下降(SVGD)来增强轨迹优化。该方法通过将基于学习的MPC视为轨迹级别的后验推理,旨在克服现有基于学习的MPC技术的局限性,例如模式崩溃和收敛到单一解。在导航、机器人操作和水果采摘任务上的实验表明,与传统的MPC、无模型强化学习和其他基于学习的MPC方法相比,Q-SVMPC具有竞争力的学习效率、强大的性能和训练稳定性。
-
用于机器人导航的新型风险规避Q学习方法
研究人员开发了一种新颖的风险规避强化学习方法,用于复杂的决策任务。该方法称为Mini-Batch Risk-Averse Deep Q-Learning,通过将转移风险映射应用于多个样本的经验测量来解决其估计的挑战。该技术被集成到Double Deep Q-Network中,以创建一种风险规避的Q学习算法。
-
Alice系统集成了Qwen模型与路由器、内存和学习功能
该文档概述了“Alice”,一个本地智能系统,它集成了其核心语言模型Qwen之外的多个组件。Alice遵循“知晓→执行→必要时学习→保留→复用”的原则,强调复用现有知识和电路,而非冗余的解决问题。其架构包括一个路由器、内存(SQLite)、用于知识和电路的“Living Map”,以及Q学习等学习机制,这使其区别于单独的Qwen模型。
-
新AI方法优化海事目标卫星调度
研究人员开发了一种名为隐式Q学习引导蚁群优化(IQACO)的新方法,用于改进敏捷地球观测卫星的海事移动目标观测调度。该方法将离线Q学习模块集成到蚁群优化中,以动态调整关键参数,从而提高任务选择、卫星分配和观测排序的效率和有效性。实验表明,与传统的蚁群优化算法相比,IQACO在各种场景下始终实现了更高的观测收益,提升幅度在3.40%至9.40%之间。
-
新的Q学习框架提供稳定的无限维线性逼近
研究人员开发了一种使用无限维线性函数逼近的稳定Q学习新框架。该方法通过重建和压缩算子来保持贝尔曼收缩,从而解决了传统Q学习中的不稳定性问题。该框架的学习变量是紧致潜在度量空间上的系数场,并提供了\(\\widetilde O(n^{-1/2})\)阶的收敛界限。该方法为理解统计难度提供了强大的抽象,并能适应潜在空间的几何形状和光滑度。
-
新的QWM框架通过世界模型增强强化学习
研究人员推出了一种新颖的QWM框架,该框架将世界模型与Q学习相结合,以提高强化学习的样本效率。该方法使用世界模型在想象的轨迹上进行测试时搜索,从而在不直接在预测状态上优化策略的情况下改进动作选择。QWM仅在真实转换上进行训练,从而避免了模型偏差的累积,并在RoboMimic和LIBERO等具有挑战性的操纵基准上展示了显著的性能提升。
-
Pointer Networks with Q-Learning for Combinatorial Optimization
一篇研究论文介绍了一种新颖的神经网络架构 Pointer Q-Network (PQN),旨在改进组合优化任务的序列生成。PQN 将无模型 Q 值近似与 Pointer Networks 相结合,利用马尔可夫决策过程框架和基于 LSTM 的循环神经网络。该方法旨在通过 Q 值动态调整注意力分数,以提高长期结果预测能力,特别是在旅行商问题等任务上。
-
新的Q学习方法解决了大动作空间中的过高估计偏差问题
本文解决了Q学习中的过高估计偏差问题,特别是在大离散动作空间中。作者提出了一种“动作交集”策略,通过允许两个Q函数之间共享轨迹数据来半解耦Q值估计。该方法通过调整数据共享比例,提供对估计偏差的精细控制,使其范围从低估到过高估计。在表格和深度强化学习环境中的实验表明,与现有的最先进基线相比,该方法有了显著的改进。
-
新算法应对去中心化多玩家强化学习
研究人员开发了用于信息不对称的去中心化多玩家强化学习在片段式马尔可夫决策过程(MDP)中的新算法。提出的方法 mQ-learning、mQ-learning-intervals、mEXC 和 mEXC-Bellman 解决了未观察到的动作以及独立或共同奖励的情况。与集中式学习相比,这些算法实现了具有竞争力的遗憾界限,尤其是在玩家数量较少或动作集有限的情况下。
-
已撤稿的论文提出了用于IoMT WBAN的Q学习路由
这篇已被撤稿的论文提出了一种名为QQMR的Q学习基础路由协议,用于无线体域网(WBAN)中的医疗物联网(IoMT)。QQMR旨在通过将数据划分为优先级级别,并使用自适应排队和模糊C均值聚类进行优化路由,来应对动态拓扑和能源限制等挑战。作者声称实验结果显示,与现有方法相比,该协议提高了数据包的传输成功率,减少了延迟,并降低了能耗。
-
新的强化学习算法优化激光切割参数,减少时间和浪费
一篇新研究论文介绍了一种名为“激光切割强化学习”(RL^2C)的算法,旨在优化用于光学薄膜激光切割的参数。与传统的试错法和其他强化学习技术相比,这种基于Q学习的方法显著减少了优化步骤和处理时间。RL^2C旨在提高切割质量,最大限度地减少材料浪费,并减少工业激光切割过程中的手动干预。