PulseAugur
中
实时 19:03:56
实体 Deep Q-Network

Deep Q-Network

PulseAugur coverage of Deep Q-Network — every cluster mentioning Deep Q-Network across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
50
90 天内 50
发布 · 30天
0
90 天内 0
论文 · 30天
49
90 天内 49
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/3 页 · 共 54 条
  1. TOOL · CL_287114 ·

    新的攻击方法针对深度强化学习代理

    研究人员开发了一种新的轨迹级对抗攻击方法,旨在针对深度强化学习(DRL)代理。该方法利用环境的可微分模型和温度平滑的代理策略,在递缩视界上优化扰动序列。在各种深度Q网络(DQN)和双重DQN(DDQN)代理的CartPole-v1环境上的实验表明,这种轨迹级攻击在白盒、跨模型和跨算法场景中显著优于标准的每步攻击和随机噪声。

  2. TOOL · CL_287024 ·

    AI 攻击者规避物联网入侵检测系统

    研究人员开发了一种使用深度 Q 网络 (DQN) 的自适应端口扫描规避技术,以挑战部署在资源受限设备(如 Raspberry Pi 3B+)上的基于机器学习的入侵检测系统 (IDS)。研究发现,虽然静态 IDS 模型对传统扫描具有高检测率,但 DQN 攻击者可以通过学习最佳探测时机、TCP 标志和有效载荷大小来有效规避它们。规避成功率因攻击者可用的特征可见性以及目标 IDS 模型而异,这表明物联网边缘环境需要更强大的防御措施。

  3. TOOL · CL_282156 ·

    新启发式算法优化复杂美术馆问题中的代理部署

    研究人员开发了新的方法来优化复杂、部分可观察环境中的代理部署。先前为部分可观察合作守卫美术馆问题(POCGAGP)建立的CADENCE算法,通过学习到的角落选择启发式方法得到了增强。这些启发式方法采用通过深度Q学习训练的CNN和GATv2网络,通过减少完全覆盖的步骤和降低高峰代理数量,尤其是在大规模场景中,显著提高了效率。

  4. TOOL · CL_282916 ·

    强化学习优化VLSI芯片供电网络

    研究人员开发了一个强化学习框架,用于优化超大规模集成(VLSI)芯片中的供电网络(PDN)。这种新方法使用感知工作负载的功耗轨迹来调整PDN资源分配,在保持完整性约束的同时,将平均归一化PDN面积减少了47%。该强化学习代理,特别是深度Q网络,实现了与模拟退火相当的优化质量,但速度显著更快,优化完成速度大约快26倍。

  5. TOOL · CL_280509 ·

    新框架将生物神经网络与硅计算接口

    研究人员开发了一个名为Embodied Neurocomputation的新框架,旨在连接生物神经网络(BNNs)与传统的硅计算。该框架解决了生物体与数字接口之间最优编码和解码机制的挑战。在一个模拟的网格世界导航任务中,该系统在4000小时内评估了约1300个参数组合,确定了12种能够持续学习的配置。在给定的交互预算内,这些生物-硅混合配置在同一任务上的表现优于优化的硅基深度Q网络(Deep Q-Network)智能体,为未来的生物-…

  6. TOOL · CL_254801 ·

    新算法CDE解决了自适应列车调度中的稳定-塑性困境

    研究人员开发了一种名为持续深度Q网络扩展(CDE)的新算法,以解决自适应列车调度中的稳定-塑性困境。该问题涉及在动态环境中平衡先前获得的知识的保留与对新信息的适应。CDE利用具有相邻技能的课程学习,并动态调整Q函数子空间以管理环境变化和任务需求。该算法使用EWC减轻灾难性遗忘,同时通过自适应理性激活函数保持塑性,在现有强化学习基线方面显示出显著的改进。

  7. TOOL · CL_252061 ·

    强化学习模型在适应性化疗控制方面展现出潜力

    研究人员开发并比较了用于适应性化疗控制的闭环深度强化学习(DRL)策略,同时利用了连续(TD3)和离散(DQN)动作空间。这些DRL策略在一个复杂异质性肿瘤模型上进行了训练,并与基于Pontryagin最大值原理(PMP)推导出的传统开环方法进行了基准测试。该研究评估了这些策略在100名具有扰动生长和药物敏感性参数的虚拟患者队列中的泛化能力,揭示了肿瘤缩小与剂量一致性之间的权衡。

  8. TOOL · CL_241216 ·

    六种技术增强深度 Q 网络代理,附 Java 实现

    Guilherme Alves Silveira 详细介绍了六种可以增强深度 Q 网络 (DQN) 代理能力的技巧。重点在于理解每种技术提供的具体改进,而不仅仅是它们的存在。Silveira 还用 Java 提供了这些方法的增量实现,包括 PER、Double DQN、Dueling DQN、N-step returns、NoisyNets 和 C51。

  9. TOOL · CL_239497 ·

    新框架增强了在不可靠无线网络上的机器人控制能力

    研究人员开发了一个新的框架,用于在无线网络上实现弹性远程机器人控制。该方法将控制系统与联合嵌入预测架构(JEPA)世界模型相结合,共同学习机器人动力学和无线信道演变。通过预测未来的机器人状态和信道条件,该系统可以优化通信,减少不必要的传输,同时保持可靠的控制。在模拟环境中进行的评估显示,与 PID、DQN 和 Vision Transformers 等传统方法相比,在通信效率、鲁棒性和弹性方面都有显著改进。

  10. TOOL · CL_235447 ·

    新的 LUGL 框架使梯度提升树能够用于强化学习游戏

    研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架允许将非增量学习器(如梯度提升树,GBT)有效地用于强化学习(RL)环境。这种方法将数据收集与模型拟合分离开来,使 GBT 能够克服通常阻碍其在 RL 中使用的分布偏移问题。LUGL 在有限表格中累积表格更新与使用该表格训练可泛化函数逼近器之间交替进行。在各种完全信息和不完全信息游戏中的实验表明,LUGL(特别是使用 LightGBM 时)的性能与 DQN 和 De…

  11. TOOL · CL_239999 ·

    新的 LUGL 框架使梯度提升树能够用于强化学习游戏

    研究人员开发了一个名为 LUGL(本地更新,全局学习)的新框架,该框架使非增量学习器(如梯度提升树,GBT)能够在强化学习(RL)环境中发挥作用。传统上,神经网络在 RL 领域占据主导地位,因为它们能够处理自我对弈训练的非平稳性。然而,LUGL 将数据收集与模型拟合分离开来,使得 LightGBM 等 GBT 能够针对本质上是表格型的游戏状态进行训练。这种方法在用于累积游戏数据的本地更新和用于训练可泛化函数逼近器的全局学习阶段之间交替…

  12. TOOL · CL_233493 ·

    强化学习与基于规则的定价在P2P电力交易中的比较

    本文探讨了住宅光伏社区点对点电力交易的两种定价机制:基于规则的和基于强化学习(RL)的。基于规则的方法包括账单分摊、中间市场价和供需比定价。利用深度Q网络的RL方法,在SDR形状定价下进行了评估,显示当引入电池储能时,社区节省有所提高。然而,基于规则的定价仍然具有竞争力,并且家庭之间的收益分配不均。

  13. TOOL · CL_218141 ·

    新的分层强化学习框架增强了对话代理

    研究人员开发了一种名为ToSCA的新型两级分层强化学习(RL)框架,用于对话代理。该方法通过结合时间和策略抽象,弥合了现有token级或utterance级RL方法之间的差距。该框架使用深度Q网络(DQN)作为高级critic,并使用近端策略优化(PPO)作为低级actor-critic,通过双粒度奖励机制解决奖励稀疏性问题。实验表明,与现有基线相比,ToSCA在日常对话和情感支持对话中都提高了策略确定性和响应质量。

  14. TOOL · CL_212168 ·

    新的 L4V 方法优化 AAV 轨迹以进行物联网数据收集

    研究人员开发了一种名为 Learn for Variation (L4V) 的新方法,用于优化自主航空飞行器 (AAV) 在第六代物联网网络中进行数据收集的轨迹。L4V 利用一个可微分的世界模型,该模型考虑了 AAV 运动学、信道状态和用户积压,用一个代理目标取代了复杂的完成时间目标。这种方法能够有效地将敏感性传播到神经网络策略,与现有方法相比,显著减少了任务时间。

  15. TOOL · CL_210555 ·

    新的多智能体DRL框架优化基站部署

    研究人员开发了一个新的多智能体深度强化学习框架,用于优化复杂校园环境中的毫米波基站部署。该研究对四种深度强化学习方案进行了基准测试,包括单智能体和多智能体深度Q网络(Deep Q-Network)和深度确定性策略梯度(Deep Deterministic Policy Gradient)方法。结果表明,在密集场景下,多智能体DDPG方法显著优于单智能体方法,实现了全覆盖,Jain指数达到0.94。

  16. TOOL · CL_210298 ·

    LLM增强的交通控制系统SIGMA可减少延误

    研究人员开发了SIGMA,一个新颖的强化学习框架,用于交通信号控制,该框架包含一个大型语言模型(LLM),用于自适应目标调整。该系统可以解释自然语言指令来调整优先级,例如为紧急车辆调整优先级,而无需手动进行奖励工程。在城市交叉口模拟中,SIGMA在减少等待时间和排队长度、同时提高吞吐量方面取得了显著的改进。

  17. TOOL · CL_208440 ·

    深度强化学习改进机器人抓取

    研究人员开发了一个新颖的强化学习框架,以提高机器人抓取能力。该系统集成了深度Q网络(DQN)和基于关键点的物体表示,利用二维图像来精炼初始抓取候选。在Dex-Net数据集上使用UR5机械臂进行的实验表明,对于先前无法抓取的物体,成功率达到了100%。该框架的有效性通过在Delta并联机器人上的仿真到真实迁移得到了进一步验证,展示了其在可扩展和适应性强的机器人操作方面的潜力。

  18. TOOL · CL_206014 ·

    深度强化学习利用RFID数据优化智能工厂调度

    本文介绍了一种新颖的动态车间生产调度框架,适用于利用RFID技术的智能工厂。该方法通过分析RFID收集的数据来估计生产不确定性并挖掘可行的生产序列,从而应对制造过程中的不确定性。采用了一种深度强化学习方法,特别是深度Q网络(DQN),来优化调度,在缩短完工时间方面优于FIFO和LIFO等传统方法。

  19. RESEARCH · CL_198105 ·

    深度Q网络以99.72%的准确率增强云网络防御

    研究人员开发了一种新颖的网络安全框架,利用深度Q网络(DQN)来增强云基础设施抵御复杂网络攻击的能力。这种基于强化学习的方法训练自适应策略,用于实时威胁检测和自动化缓解。与决策树和随机森林等传统机器学习模型相比,DQN模型表现出卓越的性能,准确率达到99.72%,攻击缓解率达到99.54%。

  20. RESEARCH · CL_193410 ·

    为黑暗之魂Boss战斗创建新的AI基准环境 · 跟踪2个来源

    研究人员开发了黑暗之魂学习环境(DSLE),这是一个旨在对《黑暗之魂:重制版》中的Boss遭遇战进行AI代理基准测试的平台。该环境将22场Boss战斗作为挑战,具有高维视觉输入和稀疏奖励,要求代理执行实时操作。对五Boss子集(DSLE-5)的初步评估表明,即使是Proximal Policy Optimization (PPO)和Deep Q-Network (DQN)等高级代理,在经过大量训练后,在教程Boss上的胜率低于1%,在…