Follow-the-Regularized-Leader
PulseAugur coverage of Follow-the-Regularized-Leader — every cluster mentioning Follow-the-Regularized-Leader across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究探讨 1/2-Tsallis-INF 算法在最佳臂识别中的应用
本研究论文调查了 1/2-Tsallis-INF 算法(一种用于最小化多臂老虎机问题遗憾值的已知方法)在应用于识别最佳臂任务时的有效性。该研究分析了该算法在随机老虎机设置下的失效概率,重点关注次优臂的采样方式以及这对累积损失估计器的影响。通过为估计累积损失的间隙过程开发一个李雅普诺夫函数,论文为失效概率建立了多项式上限,并证明了这些上限中的指数基本上是紧密的。
-
新算法在双线性鞍点问题中实现$\tilde{O}(T^{-1/4})$收敛
研究人员开发了一种新的解耦学习算法,该算法在双线性鞍点问题中实现了末迭代收敛到纳什均衡。该算法保证以$\tilde{O}(T^{-1/4})$的速率收敛,并且计算效率高,仅需要线性优化预言机。该方法结合了实验设计技术和Follow-The-Regularized-Leader (FTRL)框架,为每个学习者的动作集使用了定制的正则化器。
-
新的自适应学习率增强了Follow-the-Perturbed-Leader算法
研究人员为在线学习中的Follow-the-Perturbed-Leader (FTPL)算法开发了一种新的自适应学习率方法。该方法引入了代理概率函数,能够在无需精确计算概率的情况下实现依赖于概率的自适应。该方法将Best-of-Both-Worlds保证扩展到具有Pareto扰动和专家建议设置的FTPL,并保持了FTPL的计算效率。
-
论文分析了FTRL学习者在博弈中的策略剩余
本文研究了在两人零和博弈中,针对FTRL(Follow-the-Regularized-Leader)学习算法可实现的策略剩余。研究表明,策略剩余的提取是FTRL家族的固有特征,其规模与学习者采取的次优行动数量成正比。分析揭示了基于正则化器陡峭度的二分法:非陡峭正则化器通过有限时间消除次优行动,从而实现最大的瞬时剩余;而陡峭正则化器则会延迟剩余的饱和。