研究人员开发了一种名为保留臂消除承诺(RAEC)的新算法,以解决在学习环境中平衡短期绩效与长期利益的挑战。该算法适用于初始最优行动可能不会带来最佳长期结果的情况,尤其是在承诺后奖励可能发生变化时。RAEC战略性地分配实验轮次,以识别最佳的承诺后选项,同时最大限度地减少短期遗憾,并对其性能提供理论保证。 AI
影响 为具有潜在奖励转移的动态环境中的优化决策引入了一种新颖的算法方法。
排序理由 该集群包含一篇详细介绍自适应实验新算法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- Reserved Arm Eliminations for Commitment (RAEC)
- Reserved Online Stochastic Convex Optimization for Commitment (ROSCOC)
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →