Kullback--Leibler divergence
PulseAugur coverage of Kullback--Leibler divergence — every cluster mentioning Kullback--Leibler divergence across labs, papers, and developer communities, ranked by signal.
- used by Gotit.pub 70%
- used by alphaXiv 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
- instance of Gotit.pub 70%
- used by DagsHub 70%
- instance of Kullback-Leibler information as a basis for strong inference in ecological studies 70%
- instance of Wasserstein 70%
- used by Kullback-Leibler information as a basis for strong inference in ecological studies 70%
- used by Wasserstein 70%
10 天有情绪数据
-
贝叶斯神经网络:似然退火影响分析
研究人员调查了似然退火对变分贝叶斯线性神经网络的影响。他们发现,在宽网络中,高斯均场变分推断会导致“先验主导”,即随着网络宽度的增加,变分预测分布会折叠到先验预测分布。该研究推导了具有各向同性高斯先验的单隐藏层线性网络的极限预测分布在特定退火计划下的情况,揭示了不同尺度下预测期望和方差的相变。研究结果表明,通过适当选择退火参数,可以恢复神经网络高斯过程的后验期望或方差。
-
新框架统一了强化学习和随机过程
一篇新论文引入了“驱动式过程”来统一随机过程和强化学习的视角。该框架应用于脉冲神经网络,证明了最小化策略驱动和奖励驱动分布之间的Kullback-Leibler散度等同于最大熵强化学习。该研究由Shaowei Lin撰写,于2025年10月30日提交至arXiv。
-
Bregman散度统一用于改进神经网络优化器
研究人员开发了一个使用Bregman散度的统一框架,用于分析不同散度选择对神经网络优化器(特别是Shampoo)的影响。该框架连接了各种流行的散度,从而可以联合研究它们的影响。该研究通过经验分析了散度选择如何影响Kronecker近似,并与预处理中的有限样本误差相互作用,表明某些散度可以更好地减轻对经验二阶矩的低估。这些发现通过GPT-2预训练实验得到了验证,为改进Shampoo及相关优化技术提供了指导。
-
新的GMVIP方法增强了隐式过程先验的贝叶斯推理
研究人员引入了广义马瑟隆变分隐式过程(GMVIP),这是一个新颖的变分族,专为具有隐式过程先验的后验推理而设计。这些先验通常通过贝叶斯神经网络或随机模拟器等机制定义,通常缺乏可访问的函数空间密度。GMVIP通过构建校正的路径wise方法来构造后验样本,从而解决了这个问题,并保留了原始隐式过程的结构和变异性。在回归、分类和时间序列预测任务上的实验表明,GMVIP与现有方法相比具有竞争力,特别是在利用模拟器定义的和检索条件化的经验轨迹先验时。
-
新的基于流的模型加速复杂逆问题的解决方案 · 跟踪 2 个来源
两篇新的研究论文探讨了使用基于流的生成模型解决逆问题的先进方法。第一篇论文介绍了条件流匹配,作为传统马尔可夫链蒙特卡洛方法的一种摊销替代方案,为贝叶斯逆问题提供更快、更独立的后验样本。第二篇论文提出了 MS-Flow,一种将生成轨迹表示为中间潜在状态序列的技术,以降低内存成本并提高图像恢复和计算机断层扫描等应用中的重建质量。
-
数据科学相似性指标解析:从Netflix到欺诈检测
本文探讨了数据科学应用中至关重要的各种相似性度量和指标。文章解释了为何需要这些指标,并提供了示例,如Netflix的推荐、Goldman Sachs等金融机构的欺诈检测以及零售企业的客户细分。该帖子还触及了搜索引擎如何使用这些指标对相关文档进行排名,并讨论了欧几里得距离、曼哈顿距离和余弦相似度等不同距离指标的可用性。
-
新的自适应混合方法提高了高斯回归的准确性
研究人员开发了一种用于高斯回归中乘积分布混合的自适应拟合程序,特别解决了预测变量相关性带来的挑战。该新方法直接最小化包含指示符和活动系数上的反向 Kullback-Leibler 散度,从而能够联合优化组件参数和权重。分析建立了近似精度、收缩、选择一致性和 Bernstein-von Mises 近似的条件,在模拟数据集上与传统的平均场近似相比,在包含概率和系数协方差方面显示出更高的准确性。
-
新的ATLAS方法可在保留现有知识的同时使AI模型适应任务
研究人员开发了ATLAS,一种新颖的方法,可以适应语言模型以执行新任务,而不会损害其现有知识。ATLAS创建了一个激活图谱,该图谱使用局部参考中心和定向滤波器,通过共享的低秩残差来指导任务适应。该方法在Qwen3-8B模型上进行了测试,与七种其他方法相比,其Kullback-Leibler散度更低,同时保持了编码性能。ATLAS提供了一种在保留模型原始响应的同时添加专业技能的实用方法,实验表明在各种模型骨干和领域中均取得了持续的收益。
-
新的联邦软聚类方法使用GTVMin连接个性化GMM
研究人员开发了一种新的联邦软聚类方法,该方法允许设备在其私有数据上训练个性化高斯混合模型(GMM)。该方法称为广义全变分最小化(GTVMin),使用图正则化器通过惩罚局部模型之间的差异来连接它们。该研究比较了三种差异度量:平方欧氏距离、Kullback-Leibler散度和最大均值差异,并评估了它们的计算成本和对数据异质性的鲁棒性。
-
新研究探索AI采样方法中的更快收敛速度 · 跟踪2个来源
研究人员发布了关于Wasserstein-Fisher-Rao (WFR) 梯度流的新发现,这是一种用于加速概率分布采样的收敛方法。最新研究建立在先前工作的基础上,分析了WFR流中算子分裂技术的影响。研究表明,精心选择的操作顺序和步长可以比精确的WFR流实现更快的收敛,在某些情况下甚至优于纯粹的Wasserstein或Fisher-Rao流。
-
新的 LLM 蒸馏方法在无目标反馈的情况下减轻教师偏见
研究人员推出了一种名为耦合校准与学习(CCL)的新型算法,用于将大型语言模型(LLM)的知识蒸馏到更小的学生模型中。CCL 解决了教师偏见和错误转移的问题,尤其是在协变量偏移且目标域奖励反馈不可用的情况下。该方法使用源问题反馈迭代地校准教师模型,然后利用此校准后的教师模型在目标问题上训练学生模型。理论分析表明,CCL 可以收敛到零 Kullback-Leibler 散度,并拥有一个神谕学生,从而在无需目标数据奖励反馈的情况下有效减轻持…
-
新框架D-PACT-AFH增强了对抗预测干扰的自适应跳频性能
研究人员推出了一种名为D-PACT-AFH的新型自适应跳频框架,该框架解决了在面对预测干扰时的模型不确定性和策略暴露问题。该框架利用Tsallis-FTRL主算法结合全局和局部学习模型,能够在线选择最合适的模型类别。该系统将信道边际命中风险纳入模型选择,并采用最小Kullback-Leibler投影来强制执行风险预算,实验证明了其有效的适应性和可控的良好吞吐量-风险权衡。
-
知识蒸馏:缩小大型语言模型以实现高效部署
知识蒸馏是一种通过将大型“教师”模型学到的行为转移到较小的“学生”模型中来压缩大型语言模型(LLMs)的技术。此过程对于在资源受限的环境中高效部署 LLMs 至关重要,可降低计算成本和推理延迟,同时保留原始模型相当一部分的准确性。该方法利用教师模型的“软标签”或概率分布,通常使用 Kullback-Leibler 散度来衡量教师和学生输出之间的差异,从而使学生能够学习更丰富的数据关系。
-
新研究探索使用神经音频编解码器进行高级语音增强 · 跟踪 2 个来源
两篇新研究论文探讨了用于语音增强的高级技术,重点关注在挑战性声学条件下提高音频质量的方法。第一篇论文介绍了一种测试时自适应方法,该方法使用从神经音频编解码器派生的自回归先验来正则化语音增强模型,显示出在训练和测试条件不同时尤其得到改善的质量。第二篇论文提出了一种掩码自回归语音增强方法,该方法利用神经音频编解码器的连续潜在表示,展示了性能和计算成本之间的灵活权衡。
-
量子算法有望加速采样和优化
研究人员开发了新的量子算法,可在从复杂概率分布进行采样以及非凸优化任务方面提供加速。这些算法通过整合用于均值和梯度估计的量子子程序,增强了 Langevin Monte Carlo 和 Hamiltonian Monte Carlo 等经典方法。该研究适用于具有特定属性的分布,在 Wasserstein 距离和 Kullback--Leibler 散度方面提供了收敛保证,并展示了更快的采样如何加速各种目标的优化。
-
新的NeVI-Cut方法可在无上游数据的情况下实现不确定性传播
研究人员开发了NeVI-Cut,一种用于割贝叶斯问题的新型神经变分推理方法。该方法允许在下游分析中传播参数不确定性,而无需访问原始上游数据或模型。NeVI-Cut利用条件归一化流和期望 Kullback-Leibler 散度的样本平均近似来实现计算效率和准确性。该方法已在各种应用中证明了其速度和有效性,并具有收敛率的理论保证。
-
新TTM方法增强机器学习知识蒸馏
研究人员开发了一种名为温度自适应变换教师匹配(TTM)的新方法,以改进机器学习中的知识蒸馏。该方法通过引入一种样本级更新机制来解决TTM中固定温度缩放的局限性,该机制最小化了教师和学生分布之间的Kullback-Leibler散度。该方法利用logits的方差和协方差统计量推导出有效的更新,并在图像分类基准测试上的实验表明,它通常能增强TTM和WTTM的性能,并且常常优于现有的自适应蒸馏基线。
-
大型语言模型跨语言知识迁移有限,新的蒸馏方法偏重推理 · 跟踪2个来源
两篇新研究论文探讨了大型语言模型如何获取和保留知识。第一篇论文研究了跨语言的事实知识迁移,发现模型从英语到波斯语的迁移有限,尤其是在训练数据中移除了特定事实时。第二篇论文研究了知识蒸馏技术,提出了“Switch Distillation”,该技术通过基于教师置信度和预测熵进行路由,在训练中期偏重推理而非事实回忆。
-
贝叶斯实验设计:KL散度 vs. Wasserstein距离
一篇新发表在arXiv上的论文探讨了使用贝叶斯实验设计(BED)来校准模型差异。该研究比较了Kullback-Leibler(KL)散度和Wasserstein距离作为BED中的效用函数。研究结果表明,在不存在模型差异时,KL散度提供了更快的收敛速度,而在存在不可忽略的模型差异时,Wasserstein度量提供了更稳健的结果,为选择适当的标准提供了实践指导。
-
新理论量化扩散模型中的并行采样成本
研究人员开发了一个新的自适应并行离散向量采样理论框架,其动机是掩码扩散模型中的并行解码。核心发现是将库尔巴克-莱布勒散度测量的近似误差与揭示轮次中累积的条件总相关性联系起来的一个精确恒等式。该恒等式将条件总相关性确立为轮内并行性的基本信息成本。该研究为马尔可夫链和伯努利游走等各种结构提供了优化的采样计划,并证明了串行深度和熵之间的分离。使用掩码扩散语言模型的实验表明,该框架可以有效地区分不同的解码规则并预测输出质量。