研究人员推出了一种新颖的车间调度问题(JSSP)方法PORL,该方法结合了在线强化学习预训练和离线微调。这种混合方法利用基于仿真的交互来探索通用的调度策略,然后使用历史生产数据来调整这些策略。PORL的一个关键特性是其基于KL散度的策略约束,它限制了微调过程中的偏差,以保持预训练策略的优势。评估表明,PORL在处理分布变化和低质量数据集时,始终优于独立的离线强化学习和其他通用调度基线。 AI
影响 这种混合强化学习方法可以通过减少对高质量历史数据的依赖来提高工业调度的效率。
排序理由 该集群包含一篇详细介绍特定优化问题新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Job Shop Scheduling Problem
- JSSP
- Kullback–Leibler divergence
- Offline RL
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →