Bregman divergence
PulseAugur coverage of Bregman divergence — every cluster mentioning Bregman divergence across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Bregman散度统一用于改进神经网络优化器
研究人员开发了一个使用Bregman散度的统一框架,用于分析不同散度选择对神经网络优化器(特别是Shampoo)的影响。该框架连接了各种流行的散度,从而可以联合研究它们的影响。该研究通过经验分析了散度选择如何影响Kronecker近似,并与预处理中的有限样本误差相互作用,表明某些散度可以更好地减轻对经验二阶矩的低估。这些发现通过GPT-2预训练实验得到了验证,为改进Shampoo及相关优化技术提供了指导。
-
新方法改进离散模型参数估计
研究人员开发了一种新方法,通过结合经验局部化和变形Bregman散度来估计非归一化离散模型中的参数。该方法显著降低了计算归一化常数的计算成本。Bregman散度的变形选择使得提出的估计器具有良好的统计特性,包括效率和对异常值噪声的鲁棒性。
-
新的Riesz回归框架统一了去偏机器学习
研究人员引入了广义Riesz回归,这是一个旨在统一和改进去偏机器学习技术的新框架。该新方法利用Bregman散度下的Riesz表示拟合,提供了一种灵活的方法,可以适应各种回归目标。该框架建立了经验Riesz方程,可以精确控制系统误差并实现正交得分恒等式,其推导出的收敛速率适用于稀疏模型、再生核希尔伯特空间模型和神经网络。
-
新的牛顿法达到 O(1/k^3) 收敛速率
研究人员开发了一种新颖的直接加速牛顿方法,用于最小化具有 Lipschitz 连续 Hessian 的凸函数。这种新算法仅使用原始变量进行操作,并且每次迭代仅需要一次线性求解,在函数残差方面实现了 O(1/k^3) 的全局收敛速率。该方法值得注意的是,它在不依赖辅助子问题或对偶修正的情况下达到了这一速率,并且可以在保持其快速全局收敛速率的同时以无 Hessian 的方式实现。该构造进一步扩展到通过 Bregman 散度和复合优化问题来…
-
新的贝叶斯框架增强了时空数据的特征提取
研究人员开发了一个新的贝叶斯特征提取框架,专为高维时空数据设计,在科学领域特别有用。该框架利用高斯和扩散伽马先验来实现结构化稀疏性,并通过Bregman散度兼容各种损失函数。该方法在脑电图数据上进行了演示,分析了酒精暴露对大脑活动的影响,显示出改进的特征恢复和可解释性。
-
新框架将校准扩展到一般损失函数
研究人员开发了一种使用遗憾最小化进行校准的新框架,将先前针对特定损失函数的工作扩展到更广泛的一般损失函数。该方法利用 Bregman 散度来分析 $\alpha$-Tsallis 和 Lipschitz 损失等损失函数,实现了对维度依赖性有改进的对数遗憾。该研究还提出了 Be The Regularized Leader 算法的一种新颖遗憾等式,适用于一般损失函数。