研究人员开发了一种名为电子流程授权汤普森采样(e-ATS)的新方法来应对强盗问题中非平稳性的挑战。该方法通过为臂提供具有完整历史和折扣贝塔状态的臂,并由可逆相关性分数控制,从而允许遗忘过时的信息。在授权之前,e-ATS 的功能与乐观汤普森采样(OTS)相同。实验表明,移除授权机制在一个数据集上增加了遗憾,而在另一个数据集上则减少了遗憾,这表明证据,而不是持续的适应,决定了学习何时有益。 AI
影响 为动态环境中的自适应学习引入了一种新颖的算法方法,有可能改进需要持续适应的系统的决策。
排序理由 详细介绍强盗问题新算法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Beta-Bernoulli prior-predictive stationary model
- cs.LG
- E-process-authorized Thompson sampling
- optimistic Thompson sampling
- Thompson sampling
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →