实体
Regret-minimization algorithms for multi-agent cooperative learning systems
Regret-minimization algorithms for multi-agent cooperative learning systems
PulseAugur coverage of Regret-minimization algorithms for multi-agent cooperative learning systems — every cluster mentioning Regret-minimization algorithms for multi-agent cooperative learning systems across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新研究探讨 1/2-Tsallis-INF 算法在最佳臂识别中的应用
本研究论文调查了 1/2-Tsallis-INF 算法(一种用于最小化多臂老虎机问题遗憾值的已知方法)在应用于识别最佳臂任务时的有效性。该研究分析了该算法在随机老虎机设置下的失效概率,重点关注次优臂的采样方式以及这对累积损失估计器的影响。通过为估计累积损失的间隙过程开发一个李雅普诺夫函数,论文为失效概率建立了多项式上限,并证明了这些上限中的指数基本上是紧密的。
-
新的分布式在线控制谱滤波方法得到分析
研究人员开发了一种谱滤波方法来分析线性动力系统的分布式在线控制中的遗憾。该方法将在线谱控制框架扩展到分布式设置,其中代理使用源自过去扰动和汉克尔矩阵特征向量的谱控制器。控制器参数通过在局部代理成本上进行分布式在线梯度下降进行更新,旨在最小化与最佳集中式线性策略相比的遗憾。
-
Blackwell 可达性与梯度均衡被证明等价
研究人员在 Blackwell 可达性与梯度均衡(GEQ)——一个在线优化框架——之间建立了等价关系。这一发现将 GEQ 与诸如遗憾最小化和校准等已建立的在线学习概念联系起来。该工作表明,一个框架可解决的问题可以用另一个框架高效解决,从而转移乐观和强适应性等保证。