Fisher information
PulseAugur coverage of Fisher information — every cluster mentioning Fisher information across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的防御框架 GraphRP 保护 GNN 免受模型提取攻击
研究人员开发了 GraphRP,一个旨在保护图神经网络 (GNN) 免受模型提取攻击的新型防御框架。现有方法由于“欧氏偏差”而常常失效,该偏差未能考虑图拓扑结构,导致效用降低。GraphRP 采用一种结构感知门控机制来创建一个动态的“结构防火墙”,在阻止对手窃取模型知识产权的同时,保持合法查询的准确性。
-
新理论量化量子电路中的信息丢失
研究人员开发了一个理论框架,用于理解在使用固定计算基测量时,参数化量子电路中信息是如何丢失的。他们分析了量子Fisher信息、比特串分布中的完整Fisher信息以及对角读出空间中可用的最大响应。他们的发现表明,即使拥有完整的Pauli字符串范围,信息仍会大量丢失,尤其是在电路深度增加且状态切线框架接近Haar随机性时。
-
LLM 中的灾难性遗忘:微调如何侵蚀能力
微调大型语言模型可能导致灾难性遗忘,即模型在针对新目标进行优化时会丢失先前获得的能力。这种现象源于梯度下降,会导致模型的输出分布向微调数据的特征坍塌。研究人员在 InstructGPT 等模型中发现了这个问题,并探索了诸如混合预训练梯度或惩罚重要参数更改等缓解措施,尽管量化遗忘的确切程度仍然具有挑战性,需要针对特定任务进行评估。
-
通过策略梯度和信息几何探索GFlowNet训练方法 · 跟踪2个来源
两篇新研究论文探讨了生成流网络(GFlowNets)的高级训练方法。第一篇论文介绍了一个基于策略梯度的框架,该框架将GFlowNet的流平衡与强化学习的累积奖励联系起来,提供了新的基于策略的训练方法以及前向和后向策略优化的耦合策略。第二篇论文通过信息几何的视角来构建GFlowNet前向策略训练,利用Fisher-Rao度量和自然梯度来推导出高效的、结构感知的训练方法,这些方法可以通过实证来说明。
-
CalTwin 通过 Fisher 信息正则化改进医学世界模型
研究人员开发了 CalTwin,这是一种新颖的正则化技术,旨在提高医学世界模型的可靠性。该方法解决了两个关键问题:协变量偏移(源于不同医院和时间段的数据碎片化)和置信度失准(多步预测在高风险临床场景中过于自信)。通过结合基于 Fisher 信息的偏移惩罚和置信度失准惩罚,CalTwin 旨在为下游医学任务提供更准确、更校准的预测。
-
新的贝叶斯优化方法RAMBO解决了多模式搜索空间问题
研究人员开发了一种新的贝叶斯优化(BO)方法,称为RAMBO,旨在比标准BO更有效地处理多模式搜索空间。RAMBO利用高斯过程的Dirichlet过程混合模型自动识别数据中的不同模式,每种模式由独立的高斯过程建模。这种方法在分子构象优化、药物发现和聚变反应堆设计等应用中显示出改进。
-
新的 Fisher Widths 分析统计流形的复杂度
本文介绍了两个新的泛函:原始 Fisher 宽度和逆 Fisher 宽度,用于分析统计流形上的高斯宽度复杂度。这些宽度分别提供了对局部参数波动和各向异性高斯测量的互补见解。研究确立了这两个宽度之间的精确关系,表明 Fisher 各向异性不能同时相对于欧几里得尺度减小两者。
-
新数学论文详述Wasserstein空间上的优化
研究人员开发了在Wasserstein空间上优化泛函的新方法,Wasserstein空间是理解概率分布至关重要的数学概念。该工作为近邻下降方案建立了线性收敛性,放宽了对测地凸性的先前要求。这项进展利用了均匀对数Sobolev不等式和熵“三明治”引理,扩展了先前研究并解决了与方案中相对Fisher信息定义相关的挑战。
-
CoCurve 方法通过分析跨模块依赖性来剪枝大模型
研究人员开发了 CoCurve,一种新颖的、无需训练即可对大型语言模型 (LLM) 进行结构化剪枝的方法。与先前独立评估计算单元的方法不同,CoCurve 考虑了 Transformer 中注意力头和前馈网络之间的相互依赖性。通过分析协同剪枝曲率(量化同时移除多个单元所产生的额外损失),CoCurve 可以在无需微调或标签的情况下更有效地识别和移除冗余组件。
-
新的GFWSVD方法通过分析参数相关性来改进LLM压缩
研究人员开发了一种名为广义Fisher加权SVD(GFWSVD)的新型技术,用于压缩大型语言模型(LLM)。该方法通过同时考虑Fisher信息矩阵的对角线和非对角线元素来改进现有的压缩方法,更准确地反映参数的重要性。GFWSVD利用了Kronecker因子近似算法的可扩展适应性,使其能够处理大型模型。在MMLU基准测试上的评估中,GFWSVD在20倍压缩率下比仅依赖对角线近似的方法提高了5个百分点,优于FWSVD。
-
新的几何可观性指数增强了 SE(3) 位姿估计
研究人员引入了几何可观性指数(GOI),这是一个用于评估 SE(3) 环境中位姿估计敏感性的新颖指标。该指数量化了单个测量值对估计位姿的影响,并与 M 估计量和费舍尔信息建立了联系。GOI 的最小特征值直接指示弱可观性和有限样本稳定性,提供了一个已通过合成数据和 TUM RGB-D、KITTI 等真实世界数据集上的实验验证的理论框架。
-
新的CuBAS框架使用信息几何进行自适应数据采样
研究人员开发了CuBAS(基于曲率的自适应采样),一种用于监督分类任务选择信息丰富数据点的新颖框架。该方法利用信息几何,将标记数据集视为统计流形,其中源自Fisher信息的局部曲率指示数据复杂度。CuBAS构建k近邻图并计算曲率得分,以识别几何复杂度高和低的区域,从而能够创建紧凑但信息丰富的训练子集。在众多基准数据集上的实证结果表明,CuBAS的性能始终优于随机采样和基于不确定性的方法,具有计算效率和理论基础。
-
OrthoTryOn框架通过解决任务冲突增强统一时尚生成
研究人员开发了OrthoTryOn,一个旨在改进统一时尚生成模型的新框架。该方法解决了当虚拟试穿和服装重建等多个不同任务组合到单个模型中时出现的负迁移和梯度冲突问题。OrthoTryOn在低秩适应模块内利用正交子空间投影来消除任务特定特征的相关性。此外,它还结合了Fisher引导的负面指导,以减轻推理时残余的语义耦合,从而取得了超越独立训练模型的最新成果。
-
新研究探讨因果推断和复杂数据类型的合成 · 跟踪8个来源
几篇新研究论文探讨了因果推断和数据合成的进展,特别是在表格和时间数据方面。其中一篇论文引入了一个基准框架,用于根据高阶结构因果信息评估表格合成模型,突出了当前最先进模型中的不足。另一项工作提出了“提升因果推断”,以利用参数因果因子图在关系域中高效计算因果效应。此外,研究调查了因果概率时间图中的估计-预测权衡,表明仅凭预测准确性可能无法完全反映模型对因果机制的理解。进一步的工作引入了可以结合领域知识的“因果基础模型”,以及一种用于时间依…
-
新论文模拟了噪声观测下信念形成的几何结构
一篇新的arXiv论文探讨了在具有噪声观测的有限系统中,信念形成相关的几何成本。该研究将该过程建模为Wasserstein空间中的最优传输,并由Fisher信息重新加权,以定义信念成本几何。主要发现包括一个“墙”,在此处推理会拒绝确定性;一个等同于Fisher族的“诚实族”几何;以及一个指向双曲几何的“刚性”,其中Stam界将高斯分布加冕为最具双曲性的。
-
新的“稀疏性诅咒”阻碍了先进RLVR AI模型的合并
一篇新研究论文介绍了“稀疏性诅咒”现象,该现象描述了尽管具有先进推理能力的强化学习可验证奖励(RLVR)模型,由于参数更新稀疏且分散,导致其难以合并。与易于合并的监督微调(SFT)模型不同,RLVR模型表现出脆弱的、近乎正交的参数更新,在使用标准方法组合时会降低性能。为了解决这个问题,研究人员提出了SAR-Merging,一种利用Fisher信息和幅度感知稀疏化来保留RLVR模型独特推理路径的新技术,并在数学和编码基准测试中展示了改进的性能。
-
新框架通过费舍尔几何分析扩散模型退化
研究人员开发了一个新框架,通过量化最小均方误差(MMSE)的变化率来分析扩散模型中的潜在空间退化。该框架将MMSE速率分解为费舍尔信息(FI)和费舍尔信息率(FIR)的贡献,揭示FIR受到编码器和数据几何形状之间相互作用的影响。分析确定了导致扩散退化的四种惩罚:维度压缩、切向畸变以及编码器和数据的固有曲率。推导了保持FIR的理论条件以确保扩散的稳定性,并在各种自动编码器架构上的实验验证了这些界限。
-
新算法提高了非对数凹形分布的采样复杂性
研究人员开发了一种从非对数凹形分布采样的算法,改进了先前的方法。该算法利用了对数凹形采样方面的最新进展,并使用受限高斯预言机(RGO)实现。这种方法在相对Fisher信息方面提供了与对数凹形采样维度依赖性相匹配的复杂性保证,标志着非对数凹形分布的改进。
-
TopoFisher 通过最大化费舍尔信息学习拓扑摘要
研究人员开发了 TopoFisher,这是一种新颖的可微分管道,通过最大化费舍尔信息来学习拓扑摘要。该方法在不需要后验样本或监督目标的情况下,优化了可训练的过滤、向量化和压缩器,同时保持了拓扑归纳偏差。实验表明,在弱引力透镜等复杂推理问题中,TopoFisher 的性能优于固定的拓扑向量化方法,并且比最先进的宇宙学摘要具有更高的费舍尔信息,而使用的参数却显著减少。
-
新框架超越激活对齐来衡量神经敏感性
研究人员开发了一个新的框架,用于评估超越简单激活对齐的神经敏感性。该方法使用局部可解码信息和Fisher信息来衡量表示在噪声下区分微小扰动能力。该方法通过预期的投影回拉/Fisher度量来总结表示,经验上已证明可以恢复独立训练的神经网络中的相应层,并揭示标准训练和鲁棒训练之间的差异。