实体
Bernoulli bandits
Bernoulli bandits
PulseAugur coverage of Bernoulli bandits — every cluster mentioning Bernoulli bandits across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的正则化贪婪算法提高了有限时间赌徒的性能
研究人员开发了一类新的正则化贪婪算法,用于在有限时间范围内运行的多臂伯努利赌徒。这些算法为这类策略提供了首个推导出的有限时间后悔包络,表明后悔可以分解为探索成本和一个随着正则化增加呈指数级减小的收敛项。该分析提供了一种校准正则化参数的方法,从而提高了标准贪婪策略的后悔保证,并在数值实验中优于现有的最先进算法。
-
新方法本地化规避维度,以改进强化学习界限
研究人员提出了一种新的方法来本地化规避维度(eluder dimension),这是理解机器学习中乐观探索样本复杂性的关键概念。该技术为广义线性模型类建立了下界,表明传统的规避维度分析不足以实现一阶遗憾界限。所提出的本地化方法不仅恢复并增强了伯努利老虎机(Bernoulli bandits)的现有结果,还为具有有界累积回报的有限时间强化学习任务提供了第一个真正的一阶界限。