PulseAugur
实时 04:59:38
实体 Kullback–Leibler divergence

Kullback–Leibler divergence

PulseAugur coverage of Kullback–Leibler divergence — every cluster mentioning Kullback–Leibler divergence across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 48
发布 · 30天
0
90 天内 0
论文 · 30天
10
90 天内 43
层级分布 · 90 天
主题
关系
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/3 页 · 共 48 条
  1. TOOL · CL_217673 ·

    新的WARP算法改进了RAG系统中意见的摘要

    一篇新研究论文介绍了一种名为WARP的检索后算法,旨在提高从大型文档集合中总结意见的准确性。与可能忽略少数观点或未能捕捉情感强度等现有方法不同,WARP对检索到的文档进行校准,以更好地匹配人口的意见分布。该算法利用Wasserstein-1距离,确保所选文档的情感强度分布与目标人群保持一致,从而解决了KL和JS散度方法的局限性。WARP在三个评论领域进行了测试,在低延迟的情况下显著降低了分布误差,并得到了LLM小组更倾向于生成的答案。

  2. TOOL · CL_216129 ·

    新方法在联邦学习中以差分隐私估计KL散度

    研究人员开发了FedPriKL,一种在联邦学习环境中估计Kullback–Leibler散度并确保差分隐私的新方法。该方法旨在解决由于隐私问题或通信成本而直接共享分布信息的挑战。FedPriKL被设计为具有低敏感性和方差的无偏估计,在差分隐私下提供强大的效用。实证研究表明,它达到了与非隐私方法相当的准确性,并且优于基线隐私保护变体。

  3. TOOL · CL_215794 ·

    新研究确立离散扩散模型的 minimax 最优性

    研究人员为离散扩散模型中的分数估计建立了 minimax 下界,特别关注均匀和掩码离散扩散。他们提出了一种基于最大似然估计 (MLE) 的阈值估计器,该估计器在 KL 散度下实现了近乎最优的 minimax 样本复杂度。这项工作表明,分数-熵离散扩散 (SEDD) 在适当的初始化和离散化下可以达到近乎最优的性能。

  4. RESEARCH · CL_209438 ·

    Unsloth 发布 Qwen3.8-27B 的 Dynamic v3 量化版本,准确性得到提升

    Unsloth 发布了 Qwen3.8-27B GGUFs 的 Dynamic v3.0 量化版本,与其他提供商相比,在相同模型大小下准确性提高了 10% 以上。新版本采用改进的方法,使用更高质量的 imatrix 校准数据集和增强的量化技术,同时避免了 QAT 或 QAD。该版本包括保留显著准确性且体积更小的 1 位量化版本,非常适合内存有限的系统。

  5. TOOL · CL_214811 ·

    QUASAR方法通过降低损失下限来改进LLM量化

    研究人员开发了QUASAR,一种新颖的量化感知训练(QAT)方法,旨在提高大语言模型在低精度下的性能。QUASAR解决了QAT中的一个关键挑战,即使用有损重建的权重来计算损失,导致训练效果不佳。通过将轻量级的、感知损失的重建直接纳入训练循环,QUASAR有效地降低了损失下限,并提高了所得低比特模型的质量。该方法已显示出显著的改进,在Qwen3和Llama-3.1等模型的任务上,与现有的QAT和PTQ基线相比,实现了更低的KL散度和更高的准确性。

  6. TOOL · CL_198215 ·

    SoftWater 方法优化 LLM 量化以减小内存占用

    研究人员开发了一种名为 SoftWater 的新方法,用于量化大型语言模型的 softmax 输出层。该技术将量化视为一个率失真问题,以原始分布和量化分布之间的 KL 散度进行优化。SoftWater 根据类感知分配量化比特,为频繁的低方差类别分配更多精度,为稀有类别分配较少精度,这对于具有 Zipfian 令牌分布的模型尤其有效。该方法优于现有量化器,并在困惑度增加极小的情况下显著减小了模型的内存占用,使得头量化更加实用。

  7. COMMENTARY · CL_196912 ·

    奖励信号而非模型规模是LLM训练中的关键瓶颈

    最近的一项分析强调,改进大型语言模型的首要瓶颈并非模型规模或来自人类反馈的强化学习(RLHF)管道的复杂性,而是奖励信号本身。随着模型越来越擅长利用不完美的奖励模型,它们的实际性能会停滞不前甚至下降,这是2022年一篇关于奖励模型过度优化论文中描述的一种现象。这个问题之所以出现,是因为针对有缺陷的奖励信号进行优化会导致收益递减和最终的性能下降,这类似于一个对抗性博弈,策略模型利用了奖励模型的盲点。为解决此问题,作者建议将与参考策略的K…

  8. TOOL · CL_193919 ·

    新的信息论框架增强了神经网络中的分布外检测

    研究人员开发了一个新颖的信息论框架,用于构建改进神经网络中分布外(OOD)检测的特征。该框架使用一个两项损失函数:一项使用Kullback–Leibler散度分离分布内和分布外特征分布,第二项基于信息瓶颈原理,倾向于保留分布外信息的压缩特征。采用变分过程来优化此损失并生成分布外特征,该特征在分布外基准测试中的表现优于现有方法。

  9. TOOL · CL_191455 ·

    新的KLAL损失函数改进了视觉语言模型的注意力

    研究人员开发了一种名为KL注意力损失(KLAL)的新损失函数,以提高视觉语言模型(VLMs)的性能。这种新颖的方法直接监督了LLM模块内视觉令牌的注意力,解决了与查询相关的视觉令牌获得注意力不足的问题。通过使用KL散度将视觉令牌注意力与地面真实注意力图对齐,KLAL鼓励VLMs关注相关的视觉信息,从而在指代表达理解和几何推理等任务中取得显著改进。

  10. TOOL · CL_180641 ·

    新框架超越外在指标评估MARL策略最优性

    研究人员开发了一个新的信息论框架来评估多智能体强化学习(MARL)策略,超越了传统的奖励曲线等外在指标。这种新颖的方法使用收敛的蒙特卡洛树搜索作为基线来计算有界策略最优性得分,该得分会惩罚协作遗漏。该框架提供了细粒度的

  11. TOOL · CL_179300 ·

    新方法CSCR通过重新分配Token信用来改进LLM长上下文推理

    研究人员开发了一种名为反事实敏感性信用重新分配(CSCR)的新方法,以提高大型语言模型的推理能力,特别是在需要长上下文推理的任务中。该方法解决了现有强化学习技术(如GRPO和On-policy self-distillation)的局限性,这些技术经常将信用错误地归因于不太重要的Token。CSCR将信用从对结果变化高度敏感的Token重新分配,而专注于承载关键推理内容的Token。这种方法在数学推理基准测试中显示出比基线方法持续的性能改进。

  12. TOOL · CL_158489 ·

    新方法估计自回归模型中的分布差异

    研究人员开发了新的方法来估计自回归模型生成的分布之间的全变分(TV)距离。这些方法解决了这样一个挑战:即使服务于相同模型权重的不同推理引擎,由于实现选择和优化,也可能产生不同的输出分布。所提出的算法在各种访问模型(包括样本访问、logit访问和噪声logit访问)下提供了改进的查询复杂度,实证评估证明了它们的实用性和鲁棒性。

  13. TOOL · CL_154081 ·

    新框架LenGuard-GPC提升视觉语言模型空间推理能力

    研究人员开发了LenGuard-GPC,一个旨在提升视觉语言模型空间推理能力的新型强化学习框架。该系统通过引入密集奖励机制,解决了思维链推理倾向于过度冗长但准确率不增的问题。LenGuard-GPC使用标准提示与引导提示之间的Kullback–Leibler散度来惩罚逐令牌偏差,同时分阶段的长度奖励确保响应保持在可控范围内。在六个基准测试上的实验表明,与标准GRPO相比,LenGuard-GPC提高了准确率并缩短了响应长度。

  14. RESEARCH · CL_156464 ·

    新的H$^2$SD框架通过混合自蒸馏提升LLM推理能力

    研究人员开发了H$^2$SD,一种新颖的混合回溯自蒸馏框架,旨在增强大型语言模型的推理能力。该方法解决了现有具有可验证奖励的强化学习(RLVR)技术的局限性,这些技术通常存在监督稀疏和令牌级信用分配不佳的问题。H$^2$SD根据轨迹的正确性来区分其方法:对于成功的路径,它会调整更新幅度;对于失败的路径,它使用参考提示来指导学生模型获得经过验证的答案。在各种推理基准上的实验表明,H$^2$SD在性能和效率方面均优于当前的RLVR、同策略…

  15. TOOL · CL_152023 ·

    新的MOON方法通过动态收缩增强VLM测试时转导

    研究人员推出了一种名为“具有动态收缩的冯·米塞斯-费舍尔混合模型”(MOON)的新方法,旨在提高视觉语言模型(VLM)在测试时转导过程中的性能。该方法解决了类别分布不平衡的挑战,这种不平衡常常会降低VLM的性能。MOON模型在超球面上建模表示,并利用零样本先验动态调整收缩强度,以减轻负迁移并防止离群类别产生不可靠的分配。该方法不依赖于特定模型,无需训练或特定任务调优,并在性能和效率方面均显示出优势。

  16. RESEARCH · CL_151917 ·

    新方法通过改进的强化学习和数据选择来增强大语言模型(LLM)的后训练

    研究人员开发了改进大语言模型(LLM)后训练的新方法。蒸馏强化学习(Distilled RL)将教师监督整合到强化学习目标中,提供细粒度指导,实现更有效的知识转移,性能优于标准强化学习和同策略蒸馏。GradAlign 提供了一种用于大语言模型(LLM)强化学习的梯度对齐数据选择方法,利用验证集优先处理与策略梯度对齐的训练问题,从而实现更稳定的训练和改进的性能。RL-Struct 是一个轻量级框架,使用梯度正则化策略优化来可靠地生成大语…

  17. TOOL · CL_147890 ·

    深度循环Transformer展示每Token固定点收敛

    研究人员调查了深度循环Transformer的内部计算,特别是每个Token的状态如何在多个处理循环中演变。他们发现,每个Token的状态会收敛到一个固定点,尽管这种收敛并不均匀。虽然中位数Token在第六个循环时稳定下来,但大约10%的Token在典型的八个训练循环深度下仍在更新。这种每Token的变化至关重要,因为一旦Token的输出稳定就停止处理,可以在不牺牲质量的情况下显著降低计算深度。

  18. RESEARCH · CL_147487 ·

    KV-Cache嫁接提升小型LLM,实现280万token上下文

    研究人员开发了一种名为KV-Cache嫁接的新颖技术,可以在不改变权重的情况下增强小型语言模型。该方法允许将已验证的知识以字节精确的方式恢复到推理上下文中,从而在能力和效率方面取得显著改进。例如,Gemma-4-12B模型在AIME 2025基准测试上的性能在嫁接了已验证的解决方案库后,从80.0%提高到93.3%。这种方法还大大减少了token使用量和能耗,使得上下文窗口高达280万token,而无需额外的内存成本。

  19. RESEARCH · CL_143317 ·

    新的HMC算法解决了偏差并加速了采样时间 · 跟踪7个来源

    研究人员开发了新的方法来解决哈密顿蒙特卡洛(HMC)算法中的偏差并提高效率。一项研究将偏差去局域化的概念扩展到未调整的HMC和欠阻尼Langevin方法,表明有限数量的积分步数可以控制高维分布中的偏差。另一篇论文介绍了随机哈密顿蒙特卡洛(RHMC),该方法通过使用随机积分时间,证明了从对数凹分布采样的加速混合时间保证。第三种方法,驯服随机梯度哈密顿蒙特卡洛(tSGHMC),被提出用于具有超线性增长梯度的优化问题,提供了理论保证,并在实…

  20. RESEARCH · CL_139278 ·

    新的GPFlow框架实现了可变长度生成式蛋白质设计

    研究人员开发了广义泊松流(GPFlow),一种新颖的生成式蛋白质设计框架,克服了固定长度模型的局限性。GPFlow学习一个不均匀的广义泊松过程,以实现可变长度的蛋白质生成,这对于优化蛋白质功能和可设计性至关重要。该框架在各种设计任务中表现出改进的性能,包括无条件设计、基序支架和肽共设计,其性能优于现有的固定长度基线模型。