Soft Actor--Critic
PulseAugur coverage of Soft Actor--Critic — every cluster mentioning Soft Actor--Critic across labs, papers, and developer communities, ranked by signal.
- 2026-05-26 research_milestone Researchers introduce modifications to Soft Actor-Critic enabling it to match PPO performance for legged robot locomotion. 来源
4 天有情绪数据
-
新AI方法提高自主血管内导航成功率
研究人员开发了一种名为渐进式经验融合(PEF)的新方法来训练自主血管内导航控制器。该技术旨在提高机械取栓的输送成功率,尤其是在复杂的血管解剖结构中。在模拟中,PEF的成功率为74%,显著优于软Actor-Critic和基础TD-MPC2控制器等其他方法。进一步的测试表明,具有自适应规划的PEF控制器在未见过的血管中成功率为90%,并成功转移到体外患者血管中,通过微调将路径比率从63%提高到80%。
-
V-Simba架构提升视觉控制中RL的样本效率
研究人员推出了一种新颖的强化学习(RL)架构V-Simba,旨在提高视觉连续控制任务中的样本效率。受基于状态的RL中使用的Simba架构的启发,V-Simba结合了归一化层和逐点卷积,以稳定训练并降低计算成本。与DrQ-v2相比,新架构在DMC、Adroit和Meta-World等基准测试中表现出与现有最先进方法相当或更优的性能,同时计算效率更高。
-
新的SMAC方法实现了鲁棒的离线到在线强化学习迁移
研究人员开发了一种名为得分匹配Actor-Critic (SMAC) 的新方法,以改进强化学习模型从离线到在线环境的迁移。传统方法在在线微调离线训练模型时,性能通常会下降,这归因于损失景观中的性能谷。SMAC通过在离线训练期间对Q函数进行正则化来解决这个问题,确保向在线学习的平稳过渡。实验表明,SMAC在迁移到Soft Actor-Critic和TD3等算法时,在各种D4RL任务上实现了显著的遗憾减少并保持了性能。
-
HetGPS框架通过可扩展的多智能体强化学习增强电动汽车充电安全性
研究人员开发了HetGPS,一个专为电动汽车充电网络设计的新型可扩展多智能体强化学习框架。该系统集成了学习到的图风险和基于物理的校正,以确保在不影响任务性能的情况下满足安全约束。HetGPS在各种网络规模下均显示出电压违规的显著减少,同时保持了高离场成功率,在模型大小和效率方面优于传统的集中式方法。
-
新型MASAC控制器实现无人机协同室内导航
研究人员开发了一种新的无人机(UAV)协同室内导航框架,该框架利用共享的体素地图世界模型结合多智能体软Actor-Critic(MASAC)控制器。该系统允许多个无人机将LiDAR观测融合到一个通用的占用地图中,然后将其处理成用于去中心化控制的鸟瞰图表示。MASAC控制器集成了地图特征、障碍物数据和目标信息,在模拟走廊导航中实现了90.3%的成功率,优于传统的规划和控制方法。通过从真实世界数据中进行离线模仿微调的进一步适应,使得在GN…
-
新框架通过自适应修正提升零售需求预测能力
研究人员开发了一个名为预测-修正(PtC)的新框架,以改进零售需求预测,特别是在需求快速变化和早期数据有限的情况下。该框架结合了初步的机器学习预测和少样本连续上下文赌博机修正策略。在沃尔玛零售数据和饮料数据集上进行测试,与现有方法相比,PtC 在预测误差(MAPE、MAE、RMSE)方面显示出显著降低,并降低了库存成本。
-
多领域强化学习新研究 · 追踪10个来源
arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…
-
新理论连接牛顿-拉夫逊方法与正则化策略迭代
研究人员在正则化马尔可夫决策过程(RMDPs)的应用中,正式建立了牛顿-拉夫逊方法与正则化策略迭代(RPI)之间的等价性。这种联系,尤其是在正则化项为香农熵时,使得对RPI进行统一的理论分析并开发加速算法成为可能。研究表明,RPI表现出局部二次收敛性,并提出了一种实现三阶局部收敛的新算法,该算法得到了数值实验的支持。
-
强化学习算法增强机器容错能力
研究人员探索了使用强化学习(RL)算法,特别是近端策略优化(PPO)和软Actor-Critic(SAC),来增强机器的硬件容错能力。该研究系统地比较了这些RL方法,并研究了四种知识迁移策略。在模拟环境中评估了性能,结果表明RL可以实现快速、针对特定故障的恢复,不同的算法和策略在适应速度和渐近性能方面产生了不同的权衡。
-
AI框架助力无人机在颠簸海况下实现100%着陆成功率
研究人员开发了一种新颖的框架,用于无人机(UAV)在海上平台上的自主着陆,解决了恶劣海况带来的挑战。该系统采用了两个独立的深度强化学习(DRL)代理:一个使用软Actor-Critic(SAC)进行着陆甲板的主动波浪补偿,另一个负责无人机的最终进近。模拟显示,即使在恶劣条件下,平台也能在1度以内保持水平稳定,着陆成功率达到100%。
-
强化学习优化风电场数据中心能源使用
研究人员探索了使用强化学习(RL)来优化风电场内数据中心的运行。开发了一个仿真框架来测试RL控制器进行工作负载转移,以解决风能利用不足的挑战。研究发现,尽管像近端策略优化(PPO)和软Actor-Critic(SAC)这样的RL方法显示出潜力,但它们仍落后于具有全天预见能力的离线优化方法。
-
强化学习优化风电场数据中心能源使用
本文探讨了使用强化学习(RL)优化与风电场相结合的数据中心运营。研究人员开发了一个模拟框架,用于测试RL代理进行工作负载转移,目标是在考虑削减的情况下最大限度地利用风能。研究发现,尽管像Proximal Policy Optimization(PPO)和Soft Actor-Critic(SAC)这样的RL代理表现强劲,但由于其在线决策的局限性,它们仍落后于离线优化器。论文还评估了模仿学习和奖励塑形作为提高RL性能的方法。
-
新型混合控制器增强了流体流动中微型机器人的细胞操控能力
研究人员开发了一种新颖的混合控制器,用于在流体环境中进行微型机器人的细胞操控。该控制器结合了模型预测控制(MPC)系统和使用Soft Actor-Critic(SAC)训练的强化学习(RL)策略。RL策略提供了一个有界的速度校正,仅在与细胞接触时应用,与传统的MPC或PID控制器相比,在时变流条件下增强了鲁棒性和跟踪精度。该系统展示了泛化能力,在对特定参考曲线进行训练后,在未见过的轨迹上表现良好。
-
新的AI方法通过基于注意力的强化学习优化增材制造
研究人员开发了一种新颖的方法,通过集成多头注意力机制与软Actor-Critic (SAC) 算法来优化增材制造过程。该方法利用连续动作空间和基于注意力的特征提取器,解决了传统强化学习 (RL) 的局限性,提高了智能体捕捉细微输入变化的能力。与DQN、PPO和TD3等标准RL技术相比,增强的SAC算法在激光粉末床熔融的孔隙率预测和工艺参数优化方面表现出更快的收敛速度和更高的奖励。
-
新的DRL框架优化城市电动汽车车队控制
研究人员开发了一个新的城市电动汽车(EV)车队控制框架,该框架使用分布鲁棒强化学习(DRL)来处理不确定的需求和出行时间。这种名为PD-RSAC的方法可以优化调度、重新定位和充电决策,同时严格遵守充电器和馈线容量限制。使用纽约市出租车数据进行的实验表明,PD-RSAC将净利润显著提高到122万美元,优于各种启发式和强化学习基线。
-
新的大语言模型训练方法优化数据调度以提高效率和性能
研究人员开发了通过先进数据调度技术优化大语言模型(LLM)训练的新方法。一种方法是整体数据调度器(HDS),它使用多目标强化学习在预训练期间动态调整数据混合,从而在 The Pile 和 MMLU 等基准测试中显著提高训练效率和模型性能。另一种方法是自适应数据调度(ADS),它通过从统一数据采样转向语义集群和策略边界样本的自适应分布,专注于改进训练后强化学习,在推理基准测试中显示出优势。此外,一种使用精选数据集和最小 GRPO 设置的…
-
量子电路增强金融强化学习稳定性
研究人员开发了FPQC-SAC,一种新颖的软Actor-Critic (SAC)算法变体,旨在提高低信噪比金融强化学习任务的稳定性。该方法在表示层面引入参数化量子电路 (PQC) 来约束特征传播,从而减轻了由嘈杂市场数据放大的误差。在实际投资组合管理模拟中,与标准SAC相比,FPQC-SAC的累积回报显著提高了66.89%,并且比其他深度强化学习基线高出约27%。
-
新的强化学习框架通过自定步调学习训练自动超级摩托车
研究人员开发了一个新的框架,用于在模拟环境中训练自动驾驶超级摩托车。该方法结合了软Actor-Critic (SAC) 和自定步调课程深度强化学习 (SPDL),后者可自动创建难度递增的训练任务。该系统旨在解决摩托车控制的独特挑战,例如平衡和倾斜角度管理,这些比四轮车辆更复杂。初步结果表明,与标准的SAC相比,SPDL在单圈时间和稳定性方面效率更高,性能更好。
-
Transformer critic 提升了强化学习在长时任务中的表现
研究人员开发了一种新的序列条件判别器,用于 Soft Actor-Critic (SAC),该判别器使用轻量级 Transformer 来模拟轨迹上下文。这种方法集成了 N-步回报而无需重要性采样,使其能够捕获长时和稀疏奖励问题的时序结构。该方法在局部运动基准测试中,尤其是在长轨迹控制任务上,展示了比标准 SAC 和其他基线一致的性能提升。
-
新的强化学习算法优化股票交易执行
研究人员开发了一种名为TT-DAC-PS的新型强化学习算法,用于优化股票交易执行。这种确定性Actor-Critic架构采用了多种先进技术,包括双目标、策略平滑和保守Q正则化,以最小化高估误差。该算法在美国股票数据上进行了测试,并证明其在减少执行成本方面优于传统方法和其他强化学习基线。