研究人员推出了一种用于在线线性二次调节器(LQR)问题的新型算法IR-LQR。该方法将强化学习中的内在奖励与方差正则化相结合,以鼓励在未知动力学系统中进行探索。IR-LQR修改了成本函数,保持了简单的结构以实现高效计算,并达到了$\sqrt{T}$的最优最坏情况遗憾率。飞机和无人机控制示例的数值实验证明了其与现有算法相比的有效性。 AI
影响 为在线控制系统引入了一种更高效、计算成本更低的方法,有望提高机器人和自主系统的性能。
排序理由 该集群包含一篇详细介绍新算法的研究论文。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →