研究人员推出了一种名为“$\alpha$-TS”的广义线性 bandit 问题 Thompson Sampling 算法变体。这种新方法将方差膨胀的概念形式化,这对于在现有分析中实现近乎最优的遗憾保证是必要的。该研究概述了在无需可处理后验近似的情况下分析 $\alpha$-TS 的一般条件,这与先前的工作不同。研究结果为特定奖励分布建立了 $O(d^{3/2}\sqrt{T}\log T)$ 的遗憾界限,并提供了一个解释上限中 $d^{3/2}$ 因子来源的下界。 AI
影响 为 bandit 问题引入了一种新颖的算法方法,有可能改进 AI 系统的决策。
排序理由 详细介绍新算法及其理论分析的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →