Jensen-Shannon divergence
PulseAugur coverage of Jensen-Shannon divergence — every cluster mentioning Jensen-Shannon divergence across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的小波去噪框架针对网络异常检测
研究人员开发了一种新颖的漂移感知小波去噪框架,专门用于网络流量异常检测。该方法将自适应小波去噪视为一个为识别异常和估计网络容量而优化的预处理步骤。该系统利用一个四探测器门来触发一个学习策略,该策略根据下游任务效用而不是重建保真度来选择最优小波配置。
-
新方法Soft Clamp应对AI代理过度调用工具的问题
研究人员在用于使用工具的AI代理的多教师在线策略蒸馏中发现了一种故障模式。该方法虽然提高了工具调用召回率,但可能导致代理不恰当地过度调用工具。该论文介绍了一种名为“Soft Clamp”的新校准技术,该技术可以动态调整token级别的散度,以减轻这种过度调用行为,同时不牺牲准确性。这种方法有助于确保代理正确地平衡工具使用与直接响应。
-
新研究分析用于信用风险模型监控的散度度量
一篇新发表在arXiv上的研究论文分析了用于监控信用风险模型的散度度量的统计特性和功效。该研究侧重于Jensen-Shannon散度和Kullback-Leibler散度,并将它们与常用的总体稳定性指数(Population Stability Index)进行了比较。研究结果表明,Jensen-Shannon散度能够更好地控制第一类错误(Type I errors),最大限度地减少假阳性,但与Kullback-Leibler散度和总…
-
新的GAN架构SuRGe增强图像超分辨率
研究人员开发了Super-Resolution Generator (SuRGe),这是一种新颖的生成对抗网络(GAN)架构,旨在提高图像质量。SuRGe使用可学习的权重结合不同网络深度的特征,并结合Jensen-Shannon和Gromov-Wasserstein损失来提高生成器利用信息的能力。判别器使用带梯度惩罚的Wasserstein损失进行训练,以防止模式崩溃,与现有最先进的方法相比,从而提高了性能并降低了推理时间。
-
新的IHDec方法无需微调即可保护LLM指令层级 · 跟踪2个来源
研究人员开发了IHDec,一种新颖的方法来解决大型语言模型(LLM)在多轮对话中指令层级失败的问题。与需要昂贵微调的先前解决方案不同,IHDec通过使用Jensen-Shannon散度来检测和纠正下级指令覆盖上级指令的违规行为,从而在无需训练的情况下运行。评估表明,IHDec在处理多轮冲突方面优于基于训练的方法,同时保持响应质量并增强了对抗性攻击的安全性。
-
SARA框架增强了混合专家模型中的多语言能力
研究人员推出了一种名为SARA(Semantically Anchored Routing Alignment,语义锚定路由对齐)的新框架,旨在提高混合专家(MoE)模型在低资源语言上的性能。SARA解决了低资源语言的token经常被路由到与高资源语言不同专家的问题,阻碍了跨语言知识共享。通过使用Jensen-Shannon散度约束,SARA对齐了MoE层的内部路由分布,促进了跨语言的专家选择一致性。实验表明,SARA在Qwen3-3…
-
研究论文揭示Jensen-Shannon散度估计中的不一致性
一篇新发表在arXiv上的研究论文强调了对合成表格数据估计Jensen-Shannon散度时存在显著的不一致性。研究表明,不同的估计协议可能导致不可比较的散度值,基于边缘的估计器通常会通过忽略依赖性来低估散度,而基于分类器的估计器则能捕捉联合结构,但对所用特定估计器的敏感度很高。研究人员提出了一种对基于分类器的估计进行后验校正的方法,并提供了实用的指南和一个开源工具来解决这些协议依赖性,以实现更有意义的比较。
-
研究发现:贝多芬的《月光奏鸣曲》与机器学习架构相似
一项新的研究论文探讨了贝多芬的《月光奏鸣曲》(作品27号之二)与机器学习机制之间的结构相似性。通过对乐谱进行计算分析,该研究在奏鸣曲的三个乐章中识别出了不同的机器学习架构。研究结果表明,音乐的“温度”与吞吐量而非分布宽度有关,并且在较轻的乐章中可以发现更高的不协和度。研究还强调了音级在不同乐章中如何获得不同的上下文身份,类似于自然语言处理中的嵌入,并量化了音乐和语言中编码-解码循环的“手性”。
-
大型语言模型量化天体物理学方法的可复现性
研究人员开发了一个新的信息论框架,使用大型语言模型(LLMs)作为诊断工具来评估文本描述的科学方法的重现性。通过将LLM生成的实现视为概率分布,并用香农熵和Jensen-Shannon散度测量其方差,该研究量化了书面描述在多大程度上约束了算法实现。一项关于天体物理学光谱重构的案例研究表明,虽然LLMs可以恢复核心方法,但它们难以推断精确科学校准所需的默会专家知识,这凸显了限制严格重现性的“熵底线”。
-
OpenAI 在日本测试 ChatGPT 广告,扩散模型改进代码生成
OpenAI 正在日本的 ChatGPT 中测试广告,目标是免费用户和 'Go' 套餐用户。此举旨在将 OpenAI 的盈利策略扩展到日本市场。另外,研究人员正在探索使用扩散模型生成语法正确的抽象语法树,可能将代码生成错误减少 60%。此外,一种使用 Jensen-Shannon 散度的新数学方法正在开发中,用于检测新闻叙事的变化。