PulseAugur
实时 13:06:11
实体 deep reinforcement learning

deep reinforcement learning

PulseAugur coverage of deep reinforcement learning — every cluster mentioning deep reinforcement learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
16
90 天内 90
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 86
层级分布 · 90 天
主题
关系
情绪 · 30 天

11 天有情绪数据

最近 · 第 1/5 页 · 共 90 条
  1. TOOL · CL_216006 ·

    AI代理优化可持续性和公平性的市场价格

    本研究论文提出了一种使用深度强化学习来设定考虑外部性和可持续性的市场价格的新颖方法。所提出的政策制定者代理在其他学习代理的环境中运行,允许根据资源浪费、公平性和整体福利等各种目标来调整价格。值得注意的是,与传统市场均衡结果相比,政策制定者在稀缺环境中维持资源可持续性方面表现出更优越的性能。

  2. TOOL · CL_216120 ·

    新的DRL-MPC框架增强了多类别交通网络的控制能力

    研究人员开发了一个将深度强化学习(DRL)与模型预测控制(MPC)相结合的新颖框架,用于管理复杂的多类别交通网络。这种混合方法旨在克服每种方法单独存在的局限性,例如DRL可能学习缓慢以及MPC计算需求高且依赖于精确模型。提出的分层DRL-MPC系统划分了控制权限,MPC负责较慢的高层决策,DRL负责较快的底层输入。评估表明,该框架优于现有控制器,显著减少了计算时间,并提供了更好的约束执行,尤其是在处理模型不准确的情况下。

  3. TOOL · CL_210555 ·

    新的多智能体DRL框架优化基站部署

    研究人员开发了一个新的多智能体深度强化学习框架,用于优化复杂校园环境中的毫米波基站部署。该研究对四种深度强化学习方案进行了基准测试,包括单智能体和多智能体深度Q网络(Deep Q-Network)和深度确定性策略梯度(Deep Deterministic Policy Gradient)方法。结果表明,在密集场景下,多智能体DDPG方法显著优于单智能体方法,实现了全覆盖,Jain指数达到0.94。

  4. TOOL · CL_208477 ·

    扩散模型通过强化学习和数字孪生增强无人机决策能力

    一篇新研究论文探讨了将扩散模型(DMs)与强化学习(RL)和数字孪生(DT)技术相结合,以增强无人机(UAVs)的能力。该论文利用扩散模型学习概率分布和生成真实数据的能力,解决了无人机决策和建模中的挑战,从而提高了强化学习训练和数字孪生仿真的准确性和效率。仿真结果表明,扩散模型在通过深度强化学习进行的无人机集群协调任务中,在生成邻近速度估计方面非常有效。

  5. TOOL · CL_206219 ·

    AI框架利用大型语言模型和强化学习优化无人机物流

    研究人员开发了一个自主AI框架,用于优化云制造环境中无人机(UAV)的物流调度。该框架集成了大型语言模型和思维链推理,将用户输入转化为复杂问题的数学公式,该问题将物理产品收集与计算任务调度相结合。采用一种分层深度强化学习方法,特别是近端策略优化(PPO),来管理无人机路线规划和任务执行,在模拟中展示了99.6%的产品收集率和100%的截止日期满意度。

  6. TOOL · CL_206025 ·

    AI框架利用数字孪生优化城市无线基站部署

    研究人员开发了一种优化城市无线网络中基站部署的新颖框架。该方法结合了地理数据驱动的数字孪生和深度强化学习。该系统无需现场测量或真实用户数据即可预测无线电地图和用户分布,实现了接近理想化基准的性能,同时显著降低了优化成本。

  7. TOOL · CL_206014 ·

    深度强化学习利用RFID数据优化智能工厂调度

    本文介绍了一种新颖的动态车间生产调度框架,适用于利用RFID技术的智能工厂。该方法通过分析RFID收集的数据来估计生产不确定性并挖掘可行的生产序列,从而应对制造过程中的不确定性。采用了一种深度强化学习方法,特别是深度Q网络(DQN),来优化调度,在缩短完工时间方面优于FIFO和LIFO等传统方法。

  8. RESEARCH · CL_206150 ·

    新的GCN辅助DRL系统可降低无人机视频传输延迟

    研究人员开发了一种名为GCN-Assisted A2C的新系统模型,该模型利用深度强化学习来优化无人机(UAV)的视频传输延迟。该模型采用图卷积网络(GCN)来识别和传输帧中最相关的像素相关区域,而不是整个视频。通过结合拉格朗日对偶形式和梯度下降,该系统旨在提高收敛性并防止延迟优化过程中的约束违反。实验结果表明,与现有的DRL和最先进的模型相比,这种方法显著降低了无人机视觉系统中的传输延迟和误检率。

  9. RESEARCH · CL_205678 ·

    新的TTP-D问题使用DRL优化无人机辅助收集路线

    研究人员提出了携带无人机的旅行窃贼问题(TTP-D),这是一个新的问题表述,用于优化物品选择、车辆路线和无人机飞行同步以最大化利润。该方法对小规模实例使用混合整数线性规划,并为大规模实例开发了元启发式算法和深度强化学习(DRL)策略。一种结合DRL策略和退火运行的混合求解器在以降低的计算成本恢复解的质量方面显示出潜力。

  10. TOOL · CL_196140 ·

    AI天气预测框架使用强化学习协调专家模型

    研究人员开发了一个名为FTAE-Weather的新框架,该框架使用深度强化学习来提高天气预测的准确性。FTAE-Weather不创建单一的、庞大的AI模型,而是协调现有的专业天气模型池。一个战术代理根据大气状态和预报提前期动态地为这些模型分配权重,而一个战略代理通过修剪表现不佳的模型和纳入新模型来管理模型池。这种方法显著减少了预测误差,并且优于传统的集成方法,将模型多样性转化为科学优势。

  11. TOOL · CL_193435 ·

    新的深度强化学习方法可实现跨不同配置的机器人控制

    研究人员开发了一种新颖的深度强化学习(DRL)方法,用于控制可跨不同配置泛化的驱动式并联机器人(CDPR)。该方法训练执行器级别的策略,专注于单个电机控制以达到目标电缆长度,而不是末端执行器位置,这是CDPR控制的首次尝试。该方法允许将单一策略应用于任何CDPR配置,而与执行器数量无关,并且已成功从模拟转移到真实机器人,在鲁棒性和精度方面优于传统的DRL方法。

  12. TOOL · CL_191350 ·

    强化学习智能体因评论家偏差而在部分可观测性下挣扎

    一项对部分可观测性下强化学习智能体的最新分析表明,学习性能受到的影响比之前归因于策略限制的要大。研究人员发现,即使最优策略是可表示的,价值函数也是富有表现力的,学习算法也可能收敛到次优策略。这是因为智能体无法观察到完整状态,导致评论家将无法解释的变化误解为价值估计中的急剧曲率,从而将执行器引离真正的最优值。研究表明,调整价值估计的前瞻性视野,而不是简单地提供过去观测的记忆,是缓解这一问题的关键。

  13. TOOL · CL_191109 ·

    深度强化学习优化卡车路线,成本降低 10%

    本文探讨了深度强化学习(DRL)在物流行业解决复杂车辆路径问题(VRP)的应用。它提出了一个案例研究,重点关注三种不同用例的卡车网络设计,展示了 DRL 代理如何优化路线。研究表明,与基线方法相比,基于 DRL 的优化实现了超过 10% 的总成本降低,这表明未来有可能广泛推广到各种 VRP 类型。

  14. RESEARCH · CL_187158 ·

    新AI方法使用LLM初始化强化学习代理

    研究人员推出ProDVI,一个旨在提高深度强化学习代理样本效率的新框架。ProDVI利用大型语言模型生成Python代码,假设环境动力学,创建用于预训练价值网络的合成转换。这种方法绕过了对预收集数据集或高保真模拟器的需求,为初始化RL代理提供了一种新方法。在OpenAI Gym和DeepMind Control Suite任务上的实验证明了ProDVI在提高无模型RL算法样本效率方面的有效性。

  15. RESEARCH · CL_181501 ·

    新框架融合人工智能与电力工程教育 · 跟踪 2 个来源

    一个名为“工程基础人工智能”(EGAI)的新框架已被开发出来,用于将人工智能整合到电力和能源系统教育中。该框架以一系列开放、可执行的 Jupyter Notebook 的形式呈现,旨在降低电力工程师和跨学科学习者的入门门槛。它从基础的深度神经网络进展到更高级的应用,如用于电池控制的深度强化学习和用于系统动力学的物理信息神经网络。该项目得到了 IEEE 在线课程和网络研讨会系列的支持,该系列受到了广泛关注,表明电力行业对实践性人工智能培…

  16. TOOL · CL_165100 ·

    AI框架集成物流路径规划与调度以提高效率

    研究人员开发了一个新框架,通过集成订单调度和路径规划决策来优化物流中的末端取货操作。该方法使用动态残差图注意力网络进行路径规划,并使用路由神谕引导的启发式方法进行调度,旨在保持实时可扩展性。在菜鸟物流的真实数据上进行的实验表明,这种集成方法在解决方案质量和速度上均优于现有基准,为大规模、实时物流挑战提供了有效支持。

  17. TOOL · CL_160919 ·

    深度强化学习提升量子态制备精度

    研究人员开发了一个新的框架,利用深度强化学习,特别是近端策略优化(PPO),来应对近似量子态制备(QSP)的复杂挑战。该方法旨在通过最小化门使用量同时最大化制备的量子态的保真度来有效识别最优量子电路。在不同量子比特数量和预定义状态(如贝尔态、GHZ态、W态和Dicke态)上的实验表明,该框架能够实现低至 $10^{-14}$ 的近似误差。

  18. RESEARCH · CL_160535 ·

    新的MAPS架构增强了交叉路口自动驾驶汽车的协调能力

    研究人员开发了主代理原型规划系统(MAPS),这是一种新颖的层次化深度强化学习架构,旨在改善无信号灯交叉路口自动驾驶汽车之间的协调。MAPS利用一个集中的主代理生成紧凑的“原型计划”嵌入,然后由去中心化的工作代理将其与本地观测结合起来进行车辆控制。这种方法有效地将战略意图与战术执行分离,允许独立模块优化。在HighwayEnv模拟中的评估表明,MAPS能够实现无碰撞导航并显著减少行程时间,其性能优于现有方法,并且在比初始训练时更多的代…

  19. TOOL · CL_156349 ·

    LLM-DRL混合导航复杂网络中的UAV

    研究人员开发了一种用于在复杂集成陆地和非陆地网络(ITNTN)中导航的无人机(UAV)的新分层控制框架。该系统结合了大型语言模型(LLM)的战略推理和深度强化学习(DRL)的快速控制。基于云的LLM负责全局网络平衡,而部署在各个UAV上的小型边缘LLM则将观测转化为DRL控制器的战术目标。模拟结果表明,该方法显著减少了碰撞并提高了系统吞吐量。

  20. TOOL · CL_151841 ·

    AI策略被转化为可读的Prolog程序,以增强可解释性

    研究人员开发了一种新颖的三阶段流程,将深度强化学习策略转化为可执行的Prolog程序。该方法旨在通过将复杂AI模型的“黑箱”性质转化为可读可编辑的逻辑,使其更具可解释性。该系统保证了单调改进和终止,实证结果表明,在包括连续控制场景在内的各种任务上,Prolog程序可以媲美甚至超越原始神经网络的性能。