PulseAugur
中
实时 01:10:26
实体 Soft Actor--Critic

Soft Actor--Critic

PulseAugur coverage of Soft Actor--Critic — every cluster mentioning Soft Actor--Critic across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
36
90 天内 36
发布 · 30天
0
90 天内 0
论文 · 30天
36
90 天内 36
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-26 research_milestone Researchers introduce modifications to Soft Actor-Critic enabling it to match PPO performance for legged robot locomotion. 来源
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/3 页 · 共 41 条
  1. TOOL · CL_280479 ·

    人工智能实现脑机接口的自主机器人导航

    研究人员开发了一种用于通过经血管方式访问大脑的自主机器人导航系统,无需开颅手术。该系统利用在计算机中训练的软Actor-Critic控制器在脑血管中导航,并在模拟和体外环境中证明了可行性。尽管初步结果显示成功率令人鼓舞,尤其是在特定任务和解剖结构中,但该研究强调了在临床前应用之前需要改进解剖结构泛化能力和模拟到现实校准。

  2. TOOL · CL_245348 ·

    行为克隆在自适应肿瘤治疗研究中优于强化学习

    一篇新研究论文探讨了不同强化学习方法在自适应肿瘤治疗中的有效性。研究发现,与近乎最优的控制参考相比,行为克隆在评估中显著优于Soft Actor-Critic (SAC) 和 TD3 方法。即使使用SAC对克隆策略进行微调,也会降低其性能,导致在模拟中未能实现持续的肿瘤治愈。

  3. RESEARCH · CL_243459 ·

    机器人建造使用人工智能自适应地建造结构

    研究人员开发了一种新颖的机器人建造强化学习方法,该方法无需僵化的预定义计划。该方法通过操作图结构状态表示和混合动作空间来适应性地生成建造序列,允许离散块选择和连续放置。该系统名为 HSAC,在模拟中表现出比以前的混合 PPO 方法更优越的性能和样本效率,并在物理双机器人设置上成功进行了验证,用 3D 打印块建造了一个跨度拱。

  4. TOOL · CL_217714 ·

    脉冲神经网络在性能上可与传统强化学习算法媲美

    研究人员开发了一种脉冲演员网络软演员批评(SANSAC)算法,这是软演员批评(SAC)强化学习方法的一个变体。该新算法旨在兼容神经形态硬件,尽管它是在常规计算机上进行测试的。研究表明,SANSAC在复杂的连续环境中表现与传统的SAC相当,为未来的神经形态强化学习研究奠定了基础。

  5. TOOL · CL_210573 ·

    新AI方法提高自主血管内导航成功率

    研究人员开发了一种名为渐进式经验融合(PEF)的新方法来训练自主血管内导航控制器。该技术旨在提高机械取栓的输送成功率,尤其是在复杂的血管解剖结构中。在模拟中,PEF的成功率为74%,显著优于软Actor-Critic和基础TD-MPC2控制器等其他方法。进一步的测试表明,具有自适应规划的PEF控制器在未见过的血管中成功率为90%,并成功转移到体外患者血管中,通过微调将路径比率从63%提高到80%。

  6. TOOL · CL_193776 ·

    V-Simba架构提升视觉控制中RL的样本效率

    研究人员推出了一种新颖的强化学习(RL)架构V-Simba,旨在提高视觉连续控制任务中的样本效率。受基于状态的RL中使用的Simba架构的启发,V-Simba结合了归一化层和逐点卷积,以稳定训练并降低计算成本。与DrQ-v2相比,新架构在DMC、Adroit和Meta-World等基准测试中表现出与现有最先进方法相当或更优的性能,同时计算效率更高。

  7. TOOL · CL_193661 ·

    新的SMAC方法实现了鲁棒的离线到在线强化学习迁移

    研究人员开发了一种名为得分匹配Actor-Critic (SMAC) 的新方法,以改进强化学习模型从离线到在线环境的迁移。传统方法在在线微调离线训练模型时,性能通常会下降,这归因于损失景观中的性能谷。SMAC通过在离线训练期间对Q函数进行正则化来解决这个问题,确保向在线学习的平稳过渡。实验表明,SMAC在迁移到Soft Actor-Critic和TD3等算法时,在各种D4RL任务上实现了显著的遗憾减少并保持了性能。

  8. TOOL · CL_181223 ·

    HetGPS框架通过可扩展的多智能体强化学习增强电动汽车充电安全性

    研究人员开发了HetGPS,一个专为电动汽车充电网络设计的新型可扩展多智能体强化学习框架。该系统集成了学习到的图风险和基于物理的校正,以确保在不影响任务性能的情况下满足安全约束。HetGPS在各种网络规模下均显示出电压违规的显著减少,同时保持了高离场成功率,在模型大小和效率方面优于传统的集中式方法。

  9. TOOL · CL_169728 ·

    新型MASAC控制器实现无人机协同室内导航

    研究人员开发了一种新的无人机(UAV)协同室内导航框架,该框架利用共享的体素地图世界模型结合多智能体软Actor-Critic(MASAC)控制器。该系统允许多个无人机将LiDAR观测融合到一个通用的占用地图中,然后将其处理成用于去中心化控制的鸟瞰图表示。MASAC控制器集成了地图特征、障碍物数据和目标信息,在模拟走廊导航中实现了90.3%的成功率,优于传统的规划和控制方法。通过从真实世界数据中进行离线模仿微调的进一步适应,使得在GN…

  10. TOOL · CL_154160 ·

    新框架通过自适应修正提升零售需求预测能力

    研究人员开发了一个名为预测-修正(PtC)的新框架,以改进零售需求预测,特别是在需求快速变化和早期数据有限的情况下。该框架结合了初步的机器学习预测和少样本连续上下文赌博机修正策略。在沃尔玛零售数据和饮料数据集上进行测试,与现有方法相比,PtC 在预测误差(MAPE、MAE、RMSE)方面显示出显著降低,并降低了库存成本。

  11. RESEARCH · CL_154008 ·

    多领域强化学习新研究 · 追踪10个来源

    arXiv上发表的多篇研究论文探讨了强化学习(RL)的进展及其应用。一项研究侧重于通过决策树剪枝提高RL策略的可解释性,并在控制基准测试中显示出有效性。另一篇论文介绍了一种博弈论逆强化学习方法,用于预测人类驾驶行为,其准确性优于现有方法。此外,研究还探讨了可解释人工智能(XAI)在人机协作中的支持作用、RL组件在样本高效控制中的协同作用,以及多目标RL的网络现代化。其他论文深入研究了轨迹相对滞后蒸馏、信用节约动作到令牌分配,以及在模拟…

  12. TOOL · CL_148010 ·

    新理论连接牛顿-拉夫逊方法与正则化策略迭代

    研究人员在正则化马尔可夫决策过程(RMDPs)的应用中,正式建立了牛顿-拉夫逊方法与正则化策略迭代(RPI)之间的等价性。这种联系,尤其是在正则化项为香农熵时,使得对RPI进行统一的理论分析并开发加速算法成为可能。研究表明,RPI表现出局部二次收敛性,并提出了一种实现三阶局部收敛的新算法,该算法得到了数值实验的支持。

  13. TOOL · CL_121503 ·

    强化学习算法增强机器容错能力

    研究人员探索了使用强化学习(RL)算法,特别是近端策略优化(PPO)和软Actor-Critic(SAC),来增强机器的硬件容错能力。该研究系统地比较了这些RL方法,并研究了四种知识迁移策略。在模拟环境中评估了性能,结果表明RL可以实现快速、针对特定故障的恢复,不同的算法和策略在适应速度和渐近性能方面产生了不同的权衡。

  14. TOOL · CL_119390 ·

    AI框架助力无人机在颠簸海况下实现100%着陆成功率

    研究人员开发了一种新颖的框架,用于无人机(UAV)在海上平台上的自主着陆,解决了恶劣海况带来的挑战。该系统采用了两个独立的深度强化学习(DRL)代理:一个使用软Actor-Critic(SAC)进行着陆甲板的主动波浪补偿,另一个负责无人机的最终进近。模拟显示,即使在恶劣条件下,平台也能在1度以内保持水平稳定,着陆成功率达到100%。

  15. TOOL · CL_123527 ·

    强化学习优化风电场数据中心能源使用

    研究人员探索了使用强化学习(RL)来优化风电场内数据中心的运行。开发了一个仿真框架来测试RL控制器进行工作负载转移,以解决风能利用不足的挑战。研究发现,尽管像近端策略优化(PPO)和软Actor-Critic(SAC)这样的RL方法显示出潜力,但它们仍落后于具有全天预见能力的离线优化方法。

  16. RESEARCH · CL_117378 ·

    强化学习优化风电场数据中心能源使用

    本文探讨了使用强化学习(RL)优化与风电场相结合的数据中心运营。研究人员开发了一个模拟框架,用于测试RL代理进行工作负载转移,目标是在考虑削减的情况下最大限度地利用风能。研究发现,尽管像Proximal Policy Optimization(PPO)和Soft Actor-Critic(SAC)这样的RL代理表现强劲,但由于其在线决策的局限性,它们仍落后于离线优化器。论文还评估了模仿学习和奖励塑形作为提高RL性能的方法。

  17. TOOL · CL_111718 ·

    新型混合控制器增强了流体流动中微型机器人的细胞操控能力

    研究人员开发了一种新颖的混合控制器,用于在流体环境中进行微型机器人的细胞操控。该控制器结合了模型预测控制(MPC)系统和使用Soft Actor-Critic(SAC)训练的强化学习(RL)策略。RL策略提供了一个有界的速度校正,仅在与细胞接触时应用,与传统的MPC或PID控制器相比,在时变流条件下增强了鲁棒性和跟踪精度。该系统展示了泛化能力,在对特定参考曲线进行训练后,在未见过的轨迹上表现良好。

  18. RESEARCH · CL_99596 ·

    新的AI方法通过基于注意力的强化学习优化增材制造

    研究人员开发了一种新颖的方法,通过集成多头注意力机制与软Actor-Critic (SAC) 算法来优化增材制造过程。该方法利用连续动作空间和基于注意力的特征提取器,解决了传统强化学习 (RL) 的局限性,提高了智能体捕捉细微输入变化的能力。与DQN、PPO和TD3等标准RL技术相比,增强的SAC算法在激光粉末床熔融的孔隙率预测和工艺参数优化方面表现出更快的收敛速度和更高的奖励。

  19. TOOL · CL_98057 ·

    新的DRL框架优化城市电动汽车车队控制

    研究人员开发了一个新的城市电动汽车(EV)车队控制框架,该框架使用分布鲁棒强化学习(DRL)来处理不确定的需求和出行时间。这种名为PD-RSAC的方法可以优化调度、重新定位和充电决策,同时严格遵守充电器和馈线容量限制。使用纽约市出租车数据进行的实验表明,PD-RSAC将净利润显著提高到122万美元,优于各种启发式和强化学习基线。

  20. RESEARCH · CL_106759 ·

    新的大语言模型训练方法优化数据调度以提高效率和性能

    研究人员开发了通过先进数据调度技术优化大语言模型(LLM)训练的新方法。一种方法是整体数据调度器(HDS),它使用多目标强化学习在预训练期间动态调整数据混合,从而在 The Pile 和 MMLU 等基准测试中显著提高训练效率和模型性能。另一种方法是自适应数据调度(ADS),它通过从统一数据采样转向语义集群和策略边界样本的自适应分布,专注于改进训练后强化学习,在推理基准测试中显示出优势。此外,一种使用精选数据集和最小 GRPO 设置的…