LayerNorm
PulseAugur coverage of LayerNorm — every cluster mentioning LayerNorm across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的ZonoGPT方法验证了像GPT-2 Medium这样的大型Transformer模型
研究人员开发了ZonoGPT,这是一个专为验证大型Transformer模型设计的新抽象域。该方法保持了与网络深度无关的空间复杂度,并使用特定块的融合变换(用于Attention和LayerNorm)来保留特征关系。ZonoGPT是首个能够验证标准Transformer架构的方法,已成功扩展到HuggingFace模型,如拥有超过3亿参数的GPT-2 Medium,并在文本和视觉任务中验证了1,339个实例。
-
PolicyAttention:用于闭环控制的 Softmax Attention
研究人员开发了一种名为 PolicyAttention 的新方法,该方法在 Transformer 中使用因果 Softmax Attention 来实现闭环控制的策略镜像下降。该方法旨在通过使强化学习代理能够从固定数量的转换中学习来提高其效率和准确性。实证测试表明,PolicyAttention,特别是具有精确一步评论员的版本,在重复控制任务中的表现与理论方法或改编方法相当或更好,尽管在较高步数下与在线策略方法直接比较仍存在挑战。
-
新研究强调联邦CLIP校准问题
一篇新研究论文探讨了在去中心化数据孤岛上使用联邦学习进行适配时,CLIP等视觉语言模型(VLMs)的校准问题。研究发现,常见的提示调优方法通常会降低校准性能,导致尽管识别性能具有竞争力,但错误率却更高。研究还比较了各种骨干网络微调策略,表明这些方法通常比提示调优提供更好的准确性-校准权衡,尽管它们的有效性并非普遍适用。
-
新方法使用随机层归一化追踪 Transformer 中的可区分性
研究人员开发了一种新方法,通过引入随机层归一化来分析 Transformer 模型内部的工作原理。这种修改使得表示在统计上可区分,将可解释性建立在功能结果而非仅仅是接近度的基础上。该方法使用共享的全局速率预算将有限精度分配到模型的层中,从而能够追踪区分度如何在 MLP 块和注意力头中传播。使用 ViT-S 和 GPT-2 small 进行的实验证明了该技术能够揭示连续扰动和特定头部的敏感性,为理解 Transformer 计算提供了新视角。
-
新方法使 Transformer LLM 隐藏轴可测量和可控
研究人员开发了一种“语言模型的规范基”(CBLL)方法,该方法转换了 Transformer LLM 的坐标系,使得每个隐藏轴都可以独立测量和控制。这项技术在 Zenodo 论文中进行了详细介绍,并附有 GitHub 存储库,可以分析模型行为,例如识别特定的功能轴及其对困惑度(perplexity)和 MMLU 等性能指标的影响。CBLL 被证明是无损且架构通用的,在不同类型的归一化和 Qwen 2.5 0.5B 和 SmolLM2 …
-
新的PETA框架高效地使AI模型适应药物发现
研究人员开发了PETA,一个参数高效的框架,用于将预训练的虚拟筛选模型适应特定的蛋白质口袋。该方法通过在测试时直接适应模型来解决重新训练整个模型的计算成本问题。PETA构建了特定于口袋的负例,并使用嵌入空间混合技术创建更具挑战性的排名任务,强调抑制无效候选。实验表明,通过仅更新LayerNorm参数,PETA在各种基准测试中优于预训练模型和完全重新训练的模型。
-
新的FedLNS框架对抗联邦LLM中的对抗性攻击
研究人员开发了FedLNS,一个新设计的服务器端框架,用于保护联邦学习模型免受对抗性操纵。该方法利用客户端更新中归一化层参数变化的签名来识别和筛选恶意贡献。FedLNS不需要客户端进行额外的数据交换,并且可以与标准的联邦学习聚合技术集成。实验表明,即使高达40%的客户端参与目标操纵,该方法也能有效降低GPT风格、BERT风格和LLaMA风格模型的测试困惑度。
-
新的Transformer稳定性分析揭示了注意力敏感性几何学
研究人员开发了一种新颖的Transformer注意力机制敏感性分析方法,将几何学与tokenwise计算对齐。该分析得出了tempered softmax函数的雅可比矩阵的精确恒等式,衡量注意力分布可以被均分的均匀程度。研究结果为多头注意力提供了分布感知的局部雅可比矩阵界限,以及与序列长度无关的Lipschitz界限,并明确依赖于各种模型参数。对早期训练模型的实验表明,注意力变得更加集中,同时在采样层中保持接近最大值的精确敏感性。
-
新方法加速 Vision Transformer 在边缘设备的适配
研究人员开发了更有效地将 Vision Transformer (ViT) 适配到特定任务的新方法。一种方法使用遗传编程来演化层特定的标量函数,以近似归一化层,在 ImageNet-1K 上实现高精度,同时降低边缘设备的计算复杂度和内存流量。另一种方法,Circuit Fine-Tuning (CFT),使用电路发现来识别和微调 ViT 的关键模块,与标准参数高效微调技术相比,在各种基准测试中显著减少了训练时间和 FLOPs。
-
新的RFSQ方法通过改进信号条件增强神经压缩
研究人员开发了鲁棒残差有限标量量化(RFSQ),这是一种新的方法,通过解决多阶段量化中残差幅度衰减的问题来改进神经压缩。RFSQ 结合了可学习的缩放因子和可逆层归一化,以在量化阶段保持信号强度。实验表明,与现有方法相比,RFSQ-LayerNorm 在音频重建方面提高了 3.6%,在 ImageNet 上的 L1 和感知损失方面取得了显著的提高。
-
新型轻量级检测 Transformer 实现全整型推理
研究人员开发了 I-LW-DETR,这是一种新型轻量级检测 Transformer,可实现全整型推理。这对于在 NPU 和微控制器上部署此类模型来说是一个重大进展,因为这些设备传统上难以处理 Transformer 中常见的浮点运算。该系统包含一个保持比例的分割卷积、一个依赖符号的 GELU 近似(SD-ShiftGELU)和一个约束的 Shiftmax 函数,以确保包括非线性在内的所有运算都使用整数算术执行。这种方法使得模型尺寸减小…
-
研究发现 LayerNorm 在循环 Transformer 中充当隐式增益控制
一篇新研究论文提出,在预 LayerNorm 的循环 Transformer 中,Layer Normalization 起到了隐式增益控制器的作用。该机制通过将块的局部 Lipschitz 常数与激活尺度成反比耦合来稳定递归,即使算子范数超过一,也能使雅可比矩阵收缩。实验表明,梯度下降主要利用非线性递归来存储记忆,而 LayerNorm 的作用是稳定而非直接的记忆路由,除非在特定的轴对齐任务中。
-
新的审计工具揭示表示压缩在神经网络中滞后于泛化
开发了一个新的审计工具来分析神经网络中的“grokking”现象,特别是检查泛化后表示的压缩情况。该工具显示,对于模运算任务,嵌入压缩在泛化后可以持续数万步,显著高估了收敛值。研究表明,在 transformer 中添加 LayerNorm 可以减少 grokking 阶段的压缩程度。
-
新方法提高了LLM检查点迁移的准确性
研究人员开发了一种名为Signed-Permutation Coordinate Transport (SPCT)的新方法,以提高大型语言模型 (LLM) 检查点之间信息迁移的准确性。该技术通过同时考虑模型参数的置换和符号变化,解决了现有方法(尤其是在基于RMSNorm的模型上)的局限性。SPCT显著提高了坐标迁移的准确性,从而在稀疏自编码器重建和情感引导等任务中获得更好的性能。
-
现代 LLM Transformer 块通过 RMSNorm、GQA 和 MoE 演进
大型语言模型 (LLM) 中的现代 Transformer 块已超越最初的 2017 年设计,以提高训练稳定性、上下文长度、推理效率和模型容量。关键的进步包括使用 RMSNorm 进行更简单、更稳定的归一化,使用分组查询注意力 (GQA) 和旋转位置嵌入 (RoPE) 来优化注意力机制,以及在前馈网络中使用 SwiGLU 或专家混合 (MoE) 来增强表达能力和容量。这些修改解决了关键的扩展挑战,使大规模 LLM 的开发和部署更加实用。
-
新的SPOFA框架稳定异构知识蒸馏
研究人员开发了SPOFA,一个旨在稳定异构知识蒸馏(HKD)的新框架。HKD旨在传输不同模型架构(如Transformers和CNNs)之间的知识,但由于特征范数差异和梯度冲突,常常面临训练不稳定的问题。SPOFA通过双重稳定机制解决这些问题,该机制解耦特征幅度,并使用动量驱动的缩放器来适应性地惩罚冲突梯度,以最小的计算开销实现了最先进的准确性。
-
新协议揭示深度学习反馈对齐方法中的隐性故障
研究人员发现,深度学习中反馈对齐(FA)技术的标准评估方法存在重大局限性。目前的评估依赖于任务准确率和梯度余弦相似度,但这会掩盖关键的故障模式。一个问题是测量退化,即在某些架构中梯度会崩溃,导致余弦相似度失去意义。另一个问题是聚合崩溃,即层级异质性被聚合分数所隐藏。为了解决这个问题,提出了一种使用尺度稳定性、参考有效性和深度效用检查的新诊断协议,以及逐层余弦报告,以更好地识别和指导有效的FA方法的开发。
-
权重范数在神经网络 Grokking 中的作用得到阐明
研究人员调查了神经网络中“Grokking”现象,即模型从记忆转向泛化。他们的发现表明,先前被认为是这种转变主要驱动因素的权重范数,主要充当 Logit 尺度的上游控制。通过直接操纵 Logit 尺度,研究人员可以控制 Grokking 延迟的整个范围,而权重范数仅产生微小的附加效应。发现这种关系取决于所使用的损失函数,均方误差显示出与交叉熵不同的机制。
-
新的诊断工具可识别 LayerNorm Transformer 中的“死方向”
研究人员已识别出一种代数方法来检测 LayerNorm Transformer 中的“死方向”,这些方向是 Fisher 信息度量消失的参数空间方向。这项发表在 arXiv 上的新诊断技术仅使用 LayerNorm 尺度参数即可查明这些死方向,无需进行计算密集型的前向传播或特征值分解。该方法已在 14 个预训练 Transformer 上成功测试,准确预测了 LayerNorm 模型中的死方向,并正确识别了 RMSNorm 模型中死方…
-
新型 MIVE 引擎加速大语言模型归一化操作
研究人员开发了一种名为 MIVE(Minimalist Integer Vector Engine,极简整数向量引擎)的新硬件架构,旨在加速大语言模型(LLMs)中的关键操作。MIVE 是一种可编程引擎,可以在单个数据通路中高效处理 Softmax、LayerNorm 和 RMSNorm 功能,从而减少对重复硬件资源的需求。ASIC 实现表明,与现有针对这些操作的独立加速器相比,MIVE 在面积和硬件效率方面均有所提高。