PulseAugur
中
实时 19:47:48
实体 deep reinforcement learning

deep reinforcement learning

PulseAugur coverage of deep reinforcement learning — every cluster mentioning deep reinforcement learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
102
90 天内 102
发布 · 30天
0
90 天内 0
论文 · 30天
98
90 天内 98
层级分布 · 90 天
主题
关系
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/6 页 · 共 110 条
  1. TOOL · CL_282158 ·

    AI混合设计赋能高效的机器人集群视觉导航

    研究人员开发了一种新颖的、由AI驱动的为机器人集群设计分布式控制器的方法,使其能够在复杂环境中自主进行视觉导航。该方法结合了多智能体强化学习和神经进化策略,特别是使用交叉熵方法和协方差矩阵自适应进化策略来优化预训练的导航策略。该系统依赖于一个紧凑的神经网络,仅使用单目摄像头图像,优先考虑计算和能源效率,以实现实际的机器人集群部署。仿真实验表明,交叉熵方法控制器比协方差矩阵自适应进化策略的探索覆盖率提高了36.20%,并且基于视觉的策略…

  2. TOOL · CL_280508 ·

    深度强化学习控制旋转爆震发动机跃迁

    研究人员开发了一种新颖的深度强化学习(DRL)方法来控制旋转爆震发动机(RDEs)中的复杂跃迁。通过在跟踪爆震波的移动参考系中重新构建DRL问题,该系统可以有效地将快速的波传播动力学与较慢的工作模态变化分离开来。这种方法允许DRL控制器更可靠地在不同的发动机状态之间引发快速跃迁,其性能优于在固定参考系中训练的控制器,并在各种驱动周期和初始条件下都显示出更广泛的有效性。

  3. TOOL · CL_280446 ·

    量子强化学习大幅降低5G网络能耗

    研究人员开发了一种新颖的量子强化学习(QRL)算法,以显著降低5G及未来网络中的能耗。该方法解决了基站高能耗的挑战,基站占网络能耗的很大一部分。通过利用叠加和纠缠等量子原理,QRL算法比传统的深度强化学习(DRL)方法收敛更快。模拟显示,QRL在保持服务质量的同时能有效降低能耗,在速度和学习复杂度方面均优于DRL和Q-Learning。

  4. TOOL · CL_268899 ·

    新型对抗性攻击针对基于深度强化学习的入侵检测系统

    研究人员开发了新的通用对抗性扰动(UAP)生成方法,专门用于降低基于深度强化学习(DRL)的入侵检测系统(IDS)的性能。这些UAP旨在通过在各种网络流量类型上应用单一的、与输入无关的扰动来降低检测准确性。提出的基于概率鲁棒性(PR)的UAP将显式的PR驱动目标整合到UAP生成中,而高级版本PX-UAP则利用可解释人工智能(XAI)在现实约束下塑造扰动。实验表明,PX-UAP在攻击有效性方面优于现有的UAP方法。

  5. TOOL · CL_259438 ·

    DRL-AdaPart 优化 STAR-RIS 资源分配,实现公平高效的数据速率

    研究人员开发了 DRL-AdaPart,一种利用深度强化学习优化同时传输和反射智能表面 (STAR-RIS) 资源分配的新方法。该方法旨在通过智能分配 STAR-RIS 元素和优化相位偏移来确保用户公平高效的数据速率。DRL 算法可以停用未使用的 STAR-RIS 元素,从而在不影响性能的情况下实现显著的节能,模拟显示在静态场景下可停用高达 27% 的元素。

  6. TOOL · CL_259385 ·

    AI研究将仓库AGV与末端配送优化相结合

    一篇新发表在arXiv上的研究论文详细介绍了一种自动化仓库作业与末端运输的一体化优化方法。提出的深度强化学习算法旨在动态连接仓库AGV与多式联运系统,以提高效率和适应性。该研究引入了仓库优化(MORM-AGDQN)和末端运输(MRMH-HCVRP)的具体算法,在准时送达率、缩短配送时间、减少运输距离等方面取得了显著改进。

  7. TOOL · CL_259170 ·

    四旋翼无人机深度强化学习的新安全层

    研究人员开发了CALOS(流形上控制仿射李雅普诺夫安全层),旨在强制执行四旋翼无人机深度强化学习中的安全约束。该运行时层将姿态和李雅普诺夫下降条件构建为二次规划问题,从而能够实时校正策略的扭矩输出。在NVIDIA Isaac Lab中进行测试,CALOS显著减少了横向跟踪误差,消除了姿态约束违规,同时还加速了训练收敛并提高了数据效率。

  8. TOOL · CL_258975 ·

    深度学习与运筹学融合,赋能决策制定

    一篇新的教程论文探讨了深度学习与运筹学(OR/MS)在不确定性下序贯决策领域的交叉点。论文认为,深度学习通过提供适应性和可扩展的近似能力,是对传统OR/MS方法的补充而非取代。论文围绕预测-优化(predict-then-optimize)、决策感知学习(decision-aware learning)和深度强化学习(deep reinforcement learning)等主题组织该领域,应用涵盖供应链、医疗保健和能源等领域。

  9. TOOL · CL_252165 ·

    PEARL框架增强了以人为中心的CPS中的隐私-效用控制

    研究人员开发了PEARL,一个用于控制利用深度强化学习的以人为中心的网络物理系统(CPS)中隐私和效用的新框架。PEARL采用双路径早期退出深度Q网络,在不注入噪声的情况下结构性地限制共享动作的描述能力。这是通过使用效用置信度标签(UCL)和隐私置信度标签(PCL)来实现的,以确保动作质量并控制隐私泄露。该框架已在智能家居HVAC和VR教室系统上得到验证,证明在可控的效用成本下,对抗性状态推断的准确性显著降低。

  10. RESEARCH · CL_244579 ·

    新研究论文详述LLM-DRL集成在云连续体资源管理中的应用

    一篇新研究论文提出了一个扩展的分类法,用于利用大型语言模型(LLM)和深度强化学习(DRL)来管理物联网、边缘和云环境中的资源。所提出的框架引入了AI增强范式和反馈通道的维度,以更好地将LLM集成到DRL管道中。对六个现有架构的分析揭示了一个差距,因为在云连续体环境中,没有一个架构能够完全结合LLM编排和代理层反馈,这表明需要一个跨层反馈抽象。

  11. RESEARCH · CL_235148 ·

    深度强化学习框架应对配电网风险

    研究人员开发了一个深度强化学习框架,用于识别配电网运行中的风险和异常,特别是在不确定性条件下。所提出的方法集成了分布强化学习和贝叶斯深度强化学习来量化不确定性,区分固有风险(aleatoric不确定性)和分布外行为(epistemic不确定性)。该方法旨在通过提供更好的风险表征和异常检测来提高配电网运行的可靠性。

  12. TOOL · CL_228654 ·

    网络拓扑和对手身份塑造多智能体强化学习中的合作

    一篇新的研究论文探讨了网络拓扑和对手信息如何影响多智能体强化学习系统中玩迭代囚徒困境的合作。研究发现,图中邻居的数量和平均路径长度对合作有显著影响。研究还表明,虽然伙伴选择可以通过限制对手多样性来促进相互合作,但向智能体提供对手身份信息会阻碍合作策略的传播。

  13. RESEARCH · CL_227174 ·

    扩散模型展示出固有的注意力机制和改进的采样技术 · 跟踪了7个来源

    近期研究探索了扩散模型(一种主流的图像生成架构)的进展。一篇论文揭示了这些模型固有地利用了类似于Transformer的注意力机制,这表明注意力是一种通用的机器学习原理。另一项研究引入了控制变量分数匹配(CVSI)来提高扩散模型的采样效率并降低方差。此外,一种名为优势加权匹配(AWM)的新方法将强化学习目标与扩散模型的预训练相结合,从而显著加快了生成质量。

  14. TOOL · CL_223112 ·

    新型中间件DRL提升企业级NL2SQL的可靠性

    一篇新研究论文介绍了一种名为DRL(确定性关系中间件层)的新型中间件,旨在提高企业环境中自然语言转SQL(NL2SQL)系统的可靠性。DRL通过动态修剪上下文和验证事务安全性,解决了大型语言模型上下文窗口限制和模式扩展的挑战。该系统在PostgreSQL和MySQL上进行了评估,展示了显著的上下文缩减,并标记了大量本会通过验证但实际上错误的查询。

  15. RESEARCH · CL_223140 ·

    新研究探索深度强化学习在混合交通中安全网联自动驾驶车辆编队加入

    一篇新研究论文提出了一个仿真框架,用于评估深度强化学习(DRL)算法在混合交通中网联自动驾驶车辆(CAV)编队加入操作。研究比较了深度Q网络(DQN)、双深度Q网络(DDQN)和近端策略优化(PPO),发现在其奖励函数中加入风险惩罚后,PPO的成功率达到98%,碰撞率低于1%。研究还强调了安全性、效率和决策速度之间的权衡,并指出外部安全控制器可以防止碰撞,但可能会降低整体效率。

  16. TOOL · CL_221260 ·

    COMLLM框架利用大语言模型和多步模拟增强移动边缘计算

    研究人员开发了COMLLM,一个旨在改进移动边缘计算(MEC)系统中任务卸载的新框架。该方法利用大语言模型(LLMs),并新颖地集成了组相对策略优化(GRPO)和前瞻协作模拟(LACS)机制。COMLLM通过将多步模拟纳入其奖励设计来捕捉决策的长期影响,从而实现近乎最优的延迟和更好的负载均衡公平性。一个关键优势是其零样本拓扑可扩展性,允许在较小网络上训练的模型在无需重新训练的情况下泛化到更大、未见过的网络。

  17. RESEARCH · CL_227178 ·

    新研究探索鲁棒、自适应和结构化强化学习技术 · 追踪 10 个来源

    arXiv 上发表的多篇研究论文探讨了强化学习 (RL) 技术的进展。其中一篇论文统一了基于正则化的方法,以实现针对对抗性扰动的鲁棒深度强化学习,并提出了一种具有动态更新的拉格朗日乘子的约束优化方法。另一篇论文介绍了 CLAW,一种使用超网络生成低秩适配器来适应基于模型的强化学习中的世界模型的方法,在少样本学习场景中表现优于现有方法。此外,还介绍了用于长时限 LLM 代理的粒度自适应信用分配、用于具有局部对称性的强化学习的群代数状态表…

  18. TOOL · CL_218118 ·

    新框架通过持续不确定性学习增强控制系统鲁棒性

    研究人员开发了一个名为持续不确定性学习(CUL)的新框架,旨在提高处理多种不同不确定性的控制系统的鲁棒性。该方法采用基于课程的学习方法,将复杂的控制问题分解为逐步扩展不确定性范围的顺序任务。通过采用内存高效的正则化技术并嵌入基线模型控制器,CUL旨在提高学习效率并保留先前获得的策略。该框架成功应用于汽车动力总成的有源振动控制器,证明了其在非线性和动态变化方面的控制性能和鲁棒性得到了改善。

  19. TOOL · CL_218000 ·

    新的Delta框架可检测深度强化学习智能体的安全性和最优性错误

    研究人员开发了一个名为Delta的新框架,用于识别深度强化学习(DRL)智能体的安全性和最优性错误。该框架采用两阶段方法:首先,它评估智能体的关键故障并收集数据,然后通过离线强化学习使用这些数据训练一个挑战者智能体。通过将挑战者智能体的性能与原始智能体进行比较,Delta可以精确定位原始智能体次优的实例。在五个环境中的实验表明,Delta平均发现了2,518个最优性问题,显著优于现有方法。

  20. TOOL · CL_217903 ·

    AI框架DeepSAGE增强结构化认知行为疗法咨询对话

    研究人员开发了DeepSAGE,一个结合大型语言模型(LLMs)和深度强化学习(DRL)的新型框架,用于创建更结构化、目标导向的AI咨询代理。该系统旨在在一场咨询中遵循认知行为疗法(CBT)的十一个阶段,由外部控制器管理阶段完成,DRL模型指导生成响应的治疗意图。使用模拟客户进行的评估表明,与其它方法相比,DeepSAGE提高了对话控制、效率和用户参与度,但仍需要进一步的人类评估来确认其临床有效性和安全性。