研究人员开发了一种使用模型预测控制(MPC)来优化异构躁动多臂老虎机(RMABs)的新方法。这种方法被称为LP-update策略,它通过反复求解有限时间范围的线性规划问题来指导无限时间范围的决策。该策略在均匀遍历性下实现了O(sqrt(1/N))的次优间隙,即使在有限时间范围计算量很小的情况下也表现出强大的性能。 AI
影响 为复杂的赌博机问题引入了一种计算效率高的优化策略,可能适用于需要自适应决策的AI系统。
排序理由 学术论文,详细介绍了解决特定优化问题的新算法方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Dheeraj Narasimha
- Heterogeneous Restless Multi-armed Bandits
- LP-update policy
- model predictive control
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →