PulseAugur
实时 22:34:23
实体 Online Mirror Descent

Online Mirror Descent

PulseAugur coverage of Online Mirror Descent — every cluster mentioning Online Mirror Descent across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_141051 ·

    新的 Bandit 算法解决了公平性和连续 K-Max 问题 · 跟踪 6 个来源

    研究人员开发了新的 Bandit 问题算法,这些算法用于推荐系统等应用。对于连续 K-Max bandits,DCK-UCB 实现了 $\widetilde{O}(T^{3/4})$ 的次线性 regret 边界,而 MLE-Exp 为指数分布提供了接近最优的 $\widetilde{O}(\sqrt{T})$ regret。在相关领域,UCB-HARE 解决了 bandits 中的“公平性成本”问题,建立了 $\Omega(\sig…

  2. TOOL · CL_100212 ·

    新研究详细介绍了在线镜像下降中的近似成本

    一篇新论文探讨了在线镜像下降(OMD)中近似误差的影响,OMD是优化和机器学习的核心算法。研究揭示了所用正则化器的平滑度与算法对这些误差的鲁棒性之间存在复杂的关联。具体来说,虽然均匀平滑的正则化器对超额遗憾有严格的界限,但像单纯形上的负熵这样的障碍正则化器对近似误差很敏感,需要指数级小的误差才能避免线性遗憾。然而,负熵在单纯形上的随机损失下可以恢复鲁棒性,尽管这种好处并不适用于所有子集。

  3. RESEARCH · CL_48912 ·

    Prudent-Banker 算法确保延迟反馈中的安全性

    研究人员推出了一种名为 Prudent-Banker 的新型算法,用于对抗性多臂赌博机,即使在反馈延迟的情况下也能保持安全保证。这种新颖的方法将延迟适应型在线镜像下降法与分阶段激进机制相结合,以确保与安全基线策略相比,遗憾值接近恒定。该算法的关键创新在于延迟校准的重启阈值,该阈值严格考虑了反馈失真并可靠地检测次优性。Prudent-Banker 实现了最佳的安全-鲁棒性权衡,理论保证和实验验证表明其在各种延迟分布中平衡安全性和学习方面的有效性。