LogSumExp
PulseAugur coverage of LogSumExp — every cluster mentioning LogSumExp across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法提高了Cox回归分析的可扩展性
研究人员开发了一种可扩展Cox回归的新方法,解决了大规模数据集中的计算挑战。该方法利用分组风险集和更优的LogSumExp速率分析,改进了先前的优化界限。该方法相对于完整的Cox解决方案实现了T^{-4/5}的均方速率,并与其渐近分布相匹配,在实验中表现良好。
-
新的基于马氏距离的注意力机制提高了AI模型效率
研究人员推出了一种新颖的注意力机制——基于马氏距离的多头注意力(MHA-CSP),它用基于马氏距离的RBF核取代了标准的点积。这种方法允许在不增加参数数量的情况下,在无限维特征空间中进行注意力计算。该方法能够直接构建树注意力,并具有用于跨头核协作的注意力网格机制,从而提高了准确性和训练效率。实验表明,MHA-CSP在长序列状态跟踪任务上优于Transformer和GCN基线模型。
-
GaugeQuant 通过学习模型对称性来优化大语言模型量化
研究人员开发了 GaugeQuant,一种利用大语言模型(LLMs)内部对称性来优化其量化过程的新颖方法。该技术在训练损失中引入了一个 LogSumExp 项,引导模型选择量化最优基,而无需校准数据或模拟。在 W4A4 量化下对 LLaMA-2 7B 模型进行的实验显示,困惑度从 8.22 显著降低到 6.73,优于一些训练后量化方法。在 W4A16 量化下观察到进一步改进,困惑度从 11.16 下降到 5.45。
-
LogSumExp平滑在最大函数逼近中近乎最优
一篇新发表在arXiv上的论文提供了一个初等证明,证明了LogSumExp平滑在$\\mathbb{R}^d$中逼近最大函数时近乎最优。该研究为高估平滑度设定了一个下界,表明它们必须至少相差d的自然对数的约0.8145倍。虽然LogSumExp接近这个界限,但该论文也引入了严格更强的平滑方法,并针对低维度提出了完全最优的平滑方法,这些方法达到了已设定的下界。
-
新的安全 KL 散度改进 LogSumExp 优化
研究人员开发了一种 LogSumExp 函数的新颖近似方法,该函数对于熵正则化最优传输和分布鲁棒优化等优化问题至关重要。这种新的近似方法,称为安全 KL 散度,保持了凸性和光滑性,从而可以使用随机梯度方法进行高效优化。实验和理论分析表明,这种方法在基于 LogSumExp 的随机优化方面优于现有方法。