Kullback--Leibler
PulseAugur coverage of Kullback--Leibler — every cluster mentioning Kullback--Leibler across labs, papers, and developer communities, ranked by signal.
-
新理论指导Transformer注意力机制的LoRA秩选择
研究人员开发了一个理论框架,用于确定Transformer注意力机制中低秩适应(LoRA)的最佳秩。这项工作提供了与任务相关的近似误差界限,深入探讨了秩如何影响注意力函数匹配的准确性。研究还探讨了秩共享和融合多头LoRA中的因子分解约束以及联合查询/键更新的影响。
-
新的Riesz回归框架统一了去偏机器学习
研究人员引入了广义Riesz回归,这是一个旨在统一和改进去偏机器学习技术的新框架。该新方法利用Bregman散度下的Riesz表示拟合,提供了一种灵活的方法,可以适应各种回归目标。该框架建立了经验Riesz方程,可以精确控制系统误差并实现正交得分恒等式,其推导出的收敛速率适用于稀疏模型、再生核希尔伯特空间模型和神经网络。
-
SPARE框架在多模态大语言模型代理中修剪推理文本,保留视觉证据
研究人员开发了SPARE框架,旨在管理多模态大语言模型(MLLM)代理的上下文修剪。该方法解决了“文本债务”问题,即模型自行生成的推理文本会压垮上下文窗口,从而掩盖关键的视觉证据。SPARE采用KL引导的方法移除冗余的推理令牌,同时保留重要的视觉信息,从而提高代理的准确性并增强其对视觉输入的依赖性。
-
新的离散状态采样算法利用Nesterov加速
研究人员开发了一类新的离散状态采样算法,该算法建立在Nesterov加速梯度法的基础上。该方法通过将传统Metropolis-Hastings算法的概率分布演化解释为KL散度上的梯度下降,从而对其进行了扩展。所提出的方法利用离散Wasserstein-2度量和迁移函数,通过阻尼哈密顿流实现基于动量的加速。还引入了一个粒子相互作用系统来近似这些加速采样动力学,并通过数值示例证明了其在估计离散得分函数方面的有效性。
-
新的PAC-Bayes理论聚焦行为等价性与Z信息
一篇新的研究论文介绍了PAC-Bayes理论,该理论超越了参数空间,聚焦于行为等价性和Z信息。该研究使用可测量的行为映射和测度分解来形式化行为等价性,以分解经典的PAC-Bayes复杂度。这种分解将对预测行为的不确定性与等价实现之间的变化分离开来,将Z信息定义为KL散度与仅行为不确定性复杂度之间的差距。
-
新的KL投影方法增强了双重随机聚类
研究人员开发了一种新颖的双重随机聚类方法,通过对低秩因子进行精确的Kullback--Leibler (KL)投影。该方法利用具有规定行边际和共享、学习到的列边际的非负因子,减少了有效变量,并实现了高效的无矩阵Hessian-向量乘积。该方法应用于双重随机图学习,无需具体化大型优化变量即可诱导出精确的双重随机图。匹配聚类实验证明了其具有竞争力的准确性和有利的随时可用行为。
-
新的PTQ方法增强了Vision Transformer在边缘设备的效率
两篇新研究论文介绍了用于Vision Transformer(ViTs)的先进训练后量化(PTQ)技术,以提高在资源受限设备上的效率。MixFrag通过估计组件脆弱性并将比特分配制定为背包问题,专注于自适应的层级精度分配,在ImageNet-1K上取得了有竞争力的性能,并在COCO目标检测上取得了最先进的结果。DopQ-ViT通过将量化与激活分布对齐并处理异常值来解决性能下降问题,提出了一种Tan量化器和一种MAD引导的最优缩放因子,…