PulseAugur
实时 07:25:23
English(EN) Optimistic Online LQR via Intrinsic Rewards

新的IR-LQR算法通过内在奖励增强在线控制

研究人员推出了一种用于在线线性二次调节器(LQR)问题的新型算法IR-LQR。该方法将强化学习中的内在奖励与方差正则化相结合,以鼓励在未知动力学系统中进行探索。IR-LQR修改了成本函数,保持了简单的结构以实现高效计算,并达到了$\sqrt{T}$的最优最坏情况遗憾率。飞机和无人机控制示例的数值实验证明了其与现有算法相比的有效性。 AI

影响 为在线控制系统引入了一种更高效、计算成本更低的方法,有望提高机器人和自主系统的性能。

排序理由 该集群包含一篇详细介绍新算法的研究论文。[lever_c_demoted from research: ic=1 ai=0.7]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的IR-LQR算法通过内在奖励增强在线控制

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Marcell Bartos, Bruce D. Lee, Lenart Treven, Andreas Krause, Florian D\"orfler, Melanie N. Zeilinger ·

    基于内在奖励的乐观在线LQR

    arXiv:2603.28938v2 Announce Type: replace-cross Abstract: Optimism in the face of uncertainty is a popular approach to balance exploration and exploitation in reinforcement learning. Here, we consider the online linear quadratic regulator (LQR) problem, i.e., to learn the LQR cor…