研究人员开发了一种名为持续深度Q网络扩展(CDE)的新算法,以解决自适应列车调度中的稳定-塑性困境。该问题涉及在动态环境中平衡先前获得的知识的保留与对新信息的适应。CDE利用具有相邻技能的课程学习,并动态调整Q函数子空间以管理环境变化和任务需求。该算法使用EWC减轻灾难性遗忘,同时通过自适应理性激活函数保持塑性,在现有强化学习基线方面显示出显著的改进。 AI
影响 引入了一种管理复杂强化学习场景中知识适应的新方法,有可能提高动态环境中的效率。
排序理由 该集群包含一篇详细介绍新算法及其实验结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →