Conservative Q-Learning for Offline Reinforcement Learning
PulseAugur coverage of Conservative Q-Learning for Offline Reinforcement Learning — every cluster mentioning Conservative Q-Learning for Offline Reinforcement Learning across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新算法增强了分布偏移下的软体机器人控制能力
研究人员开发了DiSA-IQL,一种新颖的离线强化学习算法,旨在改进软体蛇形机器人的控制。该方法解决了分布偏移的挑战,分布偏移通常会在遇到未见过的情景时降低离线强化学习算法的性能。通过引入惩罚不可靠状态-动作对的鲁棒性调制,DiSA-IQL在分布内和分布外评估中均表现出优于行为克隆、保守Q学习和标准隐式Q学习等现有方法的性能。
-
SutureFormer 使用目标条件离线强化学习学习缝合轨迹
研究人员开发了 SutureFormer,一个在像素空间中使用目标条件离线强化学习从内窥镜视频中学习手术轨迹的新框架。该方法将针尖视为一个逐步移动的代理,自然地捕捉了运动的连续性,并能够显式地建模可行的状态转换。SutureFormer 利用带有行为克隆正则化的保守 Q 学习来优化专家演示的策略,有效地将稀疏的标注转换为密集的奖励信号。在肾脏伤口缝合数据集上的实验表明,与现有方法相比,平均位移误差显著降低。
-
Diffusion-SAC通过AI增强无人机网络控制
研究人员开发了一种名为Diffusion-SAC的新方法,该方法将离线强化学习与去噪扩散概率模型相结合,以优化6G通信无人机(UAV)网络的控制。该方法旨在通过从静态数据集中学习富有表现力的策略来提高设备的能源效率和公平性,即使在数据有限的情况下也是如此。模拟表明,Diffusion-SAC优于现有的离线RL基线,表现出更稳定的收敛性和更高的奖励,从而在数据效率、能耗和吞吐量方面取得了显著的改进。