Deep Q-Network
PulseAugur coverage of Deep Q-Network — every cluster mentioning Deep Q-Network across labs, papers, and developer communities, ranked by signal.
10 天有情绪数据
-
新的 L4V 方法优化 AAV 轨迹以进行物联网数据收集
研究人员开发了一种名为 Learn for Variation (L4V) 的新方法,用于优化自主航空飞行器 (AAV) 在第六代物联网网络中进行数据收集的轨迹。L4V 利用一个可微分的世界模型,该模型考虑了 AAV 运动学、信道状态和用户积压,用一个代理目标取代了复杂的完成时间目标。这种方法能够有效地将敏感性传播到神经网络策略,与现有方法相比,显著减少了任务时间。
-
新的多智能体DRL框架优化基站部署
研究人员开发了一个新的多智能体深度强化学习框架,用于优化复杂校园环境中的毫米波基站部署。该研究对四种深度强化学习方案进行了基准测试,包括单智能体和多智能体深度Q网络(Deep Q-Network)和深度确定性策略梯度(Deep Deterministic Policy Gradient)方法。结果表明,在密集场景下,多智能体DDPG方法显著优于单智能体方法,实现了全覆盖,Jain指数达到0.94。
-
LLM增强的交通控制系统SIGMA可减少延误
研究人员开发了SIGMA,一个新颖的强化学习框架,用于交通信号控制,该框架包含一个大型语言模型(LLM),用于自适应目标调整。该系统可以解释自然语言指令来调整优先级,例如为紧急车辆调整优先级,而无需手动进行奖励工程。在城市交叉口模拟中,SIGMA在减少等待时间和排队长度、同时提高吞吐量方面取得了显著的改进。
-
深度强化学习改进机器人抓取
研究人员开发了一个新颖的强化学习框架,以提高机器人抓取能力。该系统集成了深度Q网络(DQN)和基于关键点的物体表示,利用二维图像来精炼初始抓取候选。在Dex-Net数据集上使用UR5机械臂进行的实验表明,对于先前无法抓取的物体,成功率达到了100%。该框架的有效性通过在Delta并联机器人上的仿真到真实迁移得到了进一步验证,展示了其在可扩展和适应性强的机器人操作方面的潜力。
-
深度强化学习利用RFID数据优化智能工厂调度
本文介绍了一种新颖的动态车间生产调度框架,适用于利用RFID技术的智能工厂。该方法通过分析RFID收集的数据来估计生产不确定性并挖掘可行的生产序列,从而应对制造过程中的不确定性。采用了一种深度强化学习方法,特别是深度Q网络(DQN),来优化调度,在缩短完工时间方面优于FIFO和LIFO等传统方法。
-
深度Q网络以99.72%的准确率增强云网络防御
研究人员开发了一种新颖的网络安全框架,利用深度Q网络(DQN)来增强云基础设施抵御复杂网络攻击的能力。这种基于强化学习的方法训练自适应策略,用于实时威胁检测和自动化缓解。与决策树和随机森林等传统机器学习模型相比,DQN模型表现出卓越的性能,准确率达到99.72%,攻击缓解率达到99.54%。
-
为黑暗之魂Boss战斗创建新的AI基准环境 · 跟踪2个来源
研究人员开发了黑暗之魂学习环境(DSLE),这是一个旨在对《黑暗之魂:重制版》中的Boss遭遇战进行AI代理基准测试的平台。该环境将22场Boss战斗作为挑战,具有高维视觉输入和稀疏奖励,要求代理执行实时操作。对五Boss子集(DSLE-5)的初步评估表明,即使是Proximal Policy Optimization (PPO)和Deep Q-Network (DQN)等高级代理,在经过大量训练后,在教程Boss上的胜率低于1%,在…
-
Google DeepMind首席执行官Demis Hassabis卸任;Koray Kavukcuoglu接任
Google DeepMind迎来重大人事变动,首席执行官Demis Hassabis卸任,转任董事长兼Alphabet首席科学家,而Koray Kavukcuoglu接任Google DeepMind高级副总裁。此次变动正值Google的Gemini模型面临挑战,被认为落后于竞争对手之际。Kavukcuoglu曾是Yann LeCun的学生,也是DQN和WaveNet等DeepMind早期成功的关键人物,他在深度学习和管理大型研究组…
-
新的SADQ方法增强了深度Q学习中的Q值更新
研究人员开发了后继状态聚合深度Q网络(SADQ),这是一种增强深度Q学习(DQN)中Q值更新的新方法。SADQ通过显式地使用随机转移模型来建模环境动态并整合后继状态分布,解决了DQN更新中因依赖来自潜在次优过去策略的下一状态而导致的高方差问题。SADQ旨在提供更稳定且与策略一致的值更新。该方法在各种强化学习基准测试和现实世界的控制任务中,在稳定性和学习效率方面均持续优于标准的DQN变体。
-
新的奖励塑造框架改进了自动驾驶汽车停车AI
研究人员为强化学习智能体开发了一种新的奖励塑造框架,专门解决非完整约束下自动驾驶汽车停车的挑战。该框架结合了覆盖门控对齐反馈、驱动方向切换正则化和对齐的剧集终止机制。通过使用贝叶斯优化对环境奖励和算法超参数进行联合元优化,他们的深度Q网络(DQN)智能体成功克服了常见的控制故障,并在成功率和轨迹平滑度方面均优于基线方法。
-
强化学习加速激光器设计,Dueling DQN展现潜力
研究人员开发了一种使用基于价值的强化学习来加速光子晶体表面发射激光器(PCSELs)设计的新方法。在一项模拟预算限制为83次的 연구 中,Dueling DQN 表现出最可靠的性能,与基线 DQN 和其他变体相比,在品质因数、波长误差和向上功率等关键指标上有所提高。该方法为归因于科学优化中的算法增益提供了一个可复现的框架,并且源代码已公开提供。
-
D3QN-PER提升无人机-IRS通信的保密能效
研究人员开发了一种新颖的方法,通过集成无人机(UAV)和智能反射面(IRS)来增强低空无线通信中的保密能效。所提出的方法构建了一个复杂的优化问题,以最大化保密能效,涉及波束成形、IRS相位偏移和无人机轨迹。为了解决无人机轨迹优化问题,引入了一种基于优先经验回放的双深度Q网络(D3QN-PER)算法,据称与传统的深度Q网络相比,该算法提供了更好的收敛性和稳定性。
-
RL 框架增强无线 Token 通信以传输视频
研究人员开发了一种新颖的无线 Token 通信 (TokenCom) 框架,该框架利用强化学习来提高多用户视频传输的效率和语义质量。该系统集成了深度 Q 网络 (DQN) 用于 Tokenizer 协议和子信道分配,以及深度确定性策略梯度 (DDPG) 用于波束成形。该方法旨在通过使发送器和接收器就相同的 Tokenizer 模型和码本达成一致,来建立共享的语义潜在空间。仿真结果表明,视频传输冻结事件显著减少,优于传统方法。
-
AI框架解决降级监控下的航空交通冲突
研究人员开发了一个使用深度Q网络的(Deep Q-Networks)多智能体强化学习框架,用于管理航空走廊内不同类型飞机之间的冲突,特别是在监控数据不可靠的情况下。该系统为无人机和电动垂直起降飞机(eVTOL)训练了独立的策略,并纳入了通信延迟和信息丢失等各种现实世界条件。评估表明,该框架能在1秒内有效解决大多数冲突,智能体大部分时间保持航线,并在冲突期间利用转向、速度控制和垂直机动。研究还通过帕累托最优配置(Pareto-optim…
-
Memory Merge DQN 增强了 Atari 游戏中稳定价值的学习
研究人员推出了一种新颖的深度 Q 网络目标网络更新机制——Memory Merge DQN,旨在提高强化学习中智能体的稳定性和最终性能。该方法通过合并在线网络的近期历史副本来构建目标网络,根据参数对 Q 值敏感度的影响来加权参数,而不是简单地复制最新的参数。这种方法旨在在长时程学习中保留有用的价值函数结构。在 Atari 环境上的评估表明,Memory Merge DQN 具有竞争力,在几款游戏中取得了优于标准 DQN、Average…
-
强化学习框架增强个性化膀胱癌治疗
研究人员开发了一个使用强化学习的个性化膀胱癌治疗新框架。该系统模拟患者状态转移,并采用深度Q网络动态优化治疗决策。该框架旨在通过生成可解释的治疗轨迹和详细的模拟日志来提高透明度并支持临床决策。评估显示,该系统实现了 63,918.87 的累积奖励和 6.62% 的策略改进分数,证明了其在优化复发性膀胱癌治疗方面的有效性。
-
新算法解决随机需求和外包的车辆路径问题
研究人员开发了一种新颖的深度强化学习算法来解决具有随机需求和外包的车辆路径问题(VRP-SDO)。该方法将客户请求划分为由固定车队处理的请求和外包给通用承运商的请求,旨在最大限度地降低预期的旅行、加班和外包成本。该算法利用深度Q网络,并通过图注意力网络增强状态表示,以学习有效的路径策略。实验表明,与现有方法相比,路径成本显著降低,并且该算法能够快速生成高质量的决策。
-
新的CMDP方法通过自适应审计增强链下数据完整性
研究人员开发了一种新颖的方法来确保链下数据的完整性,将加密审计建模为约束马尔可夫决策过程(CMDP)。他们提出的DRQN-CMDP方法利用带有门控循环单元的深度循环Q网络来维护存储节点隐藏状态的信念。该系统结合拉格朗日对偶上升法,动态调整失误率惩罚,以在气体成本、失误率和检测延迟之间取得有利的平衡,其性能优于各种基线方法。
-
多领域强化学习新研究 · 追踪10个来源
arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…
-
强化学习数学系列解释深度Q网络
强化学习数学系列中的这一部分重点介绍深度Q网络(DQN)。它解释了DQN如何通过用神经网络替换传统的Q表来启动深度强化学习革命。