PulseAugur
实时 15:17:34
实体 LayerNorm

LayerNorm

PulseAugur coverage of LayerNorm — every cluster mentioning LayerNorm across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 24
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 22
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_212107 ·

    新的PETA框架高效地使AI模型适应药物发现

    研究人员开发了PETA,一个参数高效的框架,用于将预训练的虚拟筛选模型适应特定的蛋白质口袋。该方法通过在测试时直接适应模型来解决重新训练整个模型的计算成本问题。PETA构建了特定于口袋的负例,并使用嵌入空间混合技术创建更具挑战性的排名任务,强调抑制无效候选。实验表明,通过仅更新LayerNorm参数,PETA在各种基准测试中优于预训练模型和完全重新训练的模型。

  2. TOOL · CL_210540 ·

    新的FedLNS框架对抗联邦LLM中的对抗性攻击

    研究人员开发了FedLNS,一个新设计的服务器端框架,用于保护联邦学习模型免受对抗性操纵。该方法利用客户端更新中归一化层参数变化的签名来识别和筛选恶意贡献。FedLNS不需要客户端进行额外的数据交换,并且可以与标准的联邦学习聚合技术集成。实验表明,即使高达40%的客户端参与目标操纵,该方法也能有效降低GPT风格、BERT风格和LLaMA风格模型的测试困惑度。

  3. TOOL · CL_206260 ·

    新的Transformer稳定性分析揭示了注意力敏感性几何学

    研究人员开发了一种新颖的Transformer注意力机制敏感性分析方法,将几何学与tokenwise计算对齐。该分析得出了tempered softmax函数的雅可比矩阵的精确恒等式,衡量注意力分布可以被均分的均匀程度。研究结果为多头注意力提供了分布感知的局部雅可比矩阵界限,以及与序列长度无关的Lipschitz界限,并明确依赖于各种模型参数。对早期训练模型的实验表明,注意力变得更加集中,同时在采样层中保持接近最大值的精确敏感性。

  4. RESEARCH · CL_194008 ·

    新方法加速 Vision Transformer 在边缘设备的适配

    研究人员开发了更有效地将 Vision Transformer (ViT) 适配到特定任务的新方法。一种方法使用遗传编程来演化层特定的标量函数,以近似归一化层,在 ImageNet-1K 上实现高精度,同时降低边缘设备的计算复杂度和内存流量。另一种方法,Circuit Fine-Tuning (CFT),使用电路发现来识别和微调 ViT 的关键模块,与标准参数高效微调技术相比,在各种基准测试中显著减少了训练时间和 FLOPs。

  5. TOOL · CL_174363 ·

    新的RFSQ方法通过改进信号条件增强神经压缩

    研究人员开发了鲁棒残差有限标量量化(RFSQ),这是一种新的方法,通过解决多阶段量化中残差幅度衰减的问题来改进神经压缩。RFSQ 结合了可学习的缩放因子和可逆层归一化,以在量化阶段保持信号强度。实验表明,与现有方法相比,RFSQ-LayerNorm 在音频重建方面提高了 3.6%,在 ImageNet 上的 L1 和感知损失方面取得了显著的提高。

  6. TOOL · CL_169817 ·

    新型轻量级检测 Transformer 实现全整型推理

    研究人员开发了 I-LW-DETR,这是一种新型轻量级检测 Transformer,可实现全整型推理。这对于在 NPU 和微控制器上部署此类模型来说是一个重大进展,因为这些设备传统上难以处理 Transformer 中常见的浮点运算。该系统包含一个保持比例的分割卷积、一个依赖符号的 GELU 近似(SD-ShiftGELU)和一个约束的 Shiftmax 函数,以确保包括非线性在内的所有运算都使用整数算术执行。这种方法使得模型尺寸减小…

  7. RESEARCH · CL_141611 ·

    研究发现 LayerNorm 在循环 Transformer 中充当隐式增益控制

    一篇新研究论文提出,在预 LayerNorm 的循环 Transformer 中,Layer Normalization 起到了隐式增益控制器的作用。该机制通过将块的局部 Lipschitz 常数与激活尺度成反比耦合来稳定递归,即使算子范数超过一,也能使雅可比矩阵收缩。实验表明,梯度下降主要利用非线性递归来存储记忆,而 LayerNorm 的作用是稳定而非直接的记忆路由,除非在特定的轴对齐任务中。

  8. TOOL · CL_133511 ·

    新的审计工具揭示表示压缩在神经网络中滞后于泛化

    开发了一个新的审计工具来分析神经网络中的“grokking”现象,特别是检查泛化后表示的压缩情况。该工具显示,对于模运算任务,嵌入压缩在泛化后可以持续数万步,显著高估了收敛值。研究表明,在 transformer 中添加 LayerNorm 可以减少 grokking 阶段的压缩程度。

  9. RESEARCH · CL_119632 ·

    新方法提高了LLM检查点迁移的准确性

    研究人员开发了一种名为Signed-Permutation Coordinate Transport (SPCT)的新方法,以提高大型语言模型 (LLM) 检查点之间信息迁移的准确性。该技术通过同时考虑模型参数的置换和符号变化,解决了现有方法(尤其是在基于RMSNorm的模型上)的局限性。SPCT显著提高了坐标迁移的准确性,从而在稀疏自编码器重建和情感引导等任务中获得更好的性能。

  10. TOOL · CL_116105 ·

    现代 LLM Transformer 块通过 RMSNorm、GQA 和 MoE 演进

    大型语言模型 (LLM) 中的现代 Transformer 块已超越最初的 2017 年设计,以提高训练稳定性、上下文长度、推理效率和模型容量。关键的进步包括使用 RMSNorm 进行更简单、更稳定的归一化,使用分组查询注意力 (GQA) 和旋转位置嵌入 (RoPE) 来优化注意力机制,以及在前馈网络中使用 SwiGLU 或专家混合 (MoE) 来增强表达能力和容量。这些修改解决了关键的扩展挑战,使大规模 LLM 的开发和部署更加实用。

  11. RESEARCH · CL_107913 ·

    新的SPOFA框架稳定异构知识蒸馏

    研究人员开发了SPOFA,一个旨在稳定异构知识蒸馏(HKD)的新框架。HKD旨在传输不同模型架构(如Transformers和CNNs)之间的知识,但由于特征范数差异和梯度冲突,常常面临训练不稳定的问题。SPOFA通过双重稳定机制解决这些问题,该机制解耦特征幅度,并使用动量驱动的缩放器来适应性地惩罚冲突梯度,以最小的计算开销实现了最先进的准确性。

  12. TOOL · CL_104679 ·

    新协议揭示深度学习反馈对齐方法中的隐性故障

    研究人员发现,深度学习中反馈对齐(FA)技术的标准评估方法存在重大局限性。目前的评估依赖于任务准确率和梯度余弦相似度,但这会掩盖关键的故障模式。一个问题是测量退化,即在某些架构中梯度会崩溃,导致余弦相似度失去意义。另一个问题是聚合崩溃,即层级异质性被聚合分数所隐藏。为了解决这个问题,提出了一种使用尺度稳定性、参考有效性和深度效用检查的新诊断协议,以及逐层余弦报告,以更好地识别和指导有效的FA方法的开发。

  13. TOOL · CL_98023 ·

    权重范数在神经网络 Grokking 中的作用得到阐明

    研究人员调查了神经网络中“Grokking”现象,即模型从记忆转向泛化。他们的发现表明,先前被认为是这种转变主要驱动因素的权重范数,主要充当 Logit 尺度的上游控制。通过直接操纵 Logit 尺度,研究人员可以控制 Grokking 延迟的整个范围,而权重范数仅产生微小的附加效应。发现这种关系取决于所使用的损失函数,均方误差显示出与交叉熵不同的机制。

  14. RESEARCH · CL_99566 ·

    新的诊断工具可识别 LayerNorm Transformer 中的“死方向”

    研究人员已识别出一种代数方法来检测 LayerNorm Transformer 中的“死方向”,这些方向是 Fisher 信息度量消失的参数空间方向。这项发表在 arXiv 上的新诊断技术仅使用 LayerNorm 尺度参数即可查明这些死方向,无需进行计算密集型的前向传播或特征值分解。该方法已在 14 个预训练 Transformer 上成功测试,准确预测了 LayerNorm 模型中的死方向,并正确识别了 RMSNorm 模型中死方…

  15. TOOL · CL_96153 ·

    新型 MIVE 引擎加速大语言模型归一化操作

    研究人员开发了一种名为 MIVE(Minimalist Integer Vector Engine,极简整数向量引擎)的新硬件架构,旨在加速大语言模型(LLMs)中的关键操作。MIVE 是一种可编程引擎,可以在单个数据通路中高效处理 Softmax、LayerNorm 和 RMSNorm 功能,从而减少对重复硬件资源的需求。ASIC 实现表明,与现有针对这些操作的独立加速器相比,MIVE 在面积和硬件效率方面均有所提高。

  16. TOOL · CL_93301 ·

    Z-Plane 神经网络取代 ReLU 和 LayerNorm,实现稳定的深度学习

    研究人员推出了一种名为 Z-Plane 神经网络的新型神经网络架构,它取代了传统的激活函数(如 ReLU)和归一化技术(如 LayerNorm)。这种新方法将隐藏状态映射到超球体上的二维相量束,并利用一种称为径向有界的几何激活函数。该方法旨在防止梯度不稳定、避免神经元死亡并保留方向信息。一个 100 层的 Z-Plane 多层感知机在 MNIST 数据集上展示了成功的收敛性和数值稳定性,在没有 ReLU 或 LayerNorm 的情况…

  17. TOOL · CL_91441 ·

    研究论文:PostDeg 通过优化 LayerNorm 标量放置来增强 GNN

    一篇题为“PostDeg: Placement Beats Parameterization in LayerNorm GNNs”的新研究论文已提交至 arXiv。该论文指出,在基于 LayerNorm 的图神经网络 (GNN) 中,每个节点的正标量的放置位置对其保留拓扑信号的能力有显著影响。作者提出了“PostDeg”,一种无参数方法,将此标量插入到 LayerNorm 之后,在诸如影响力最大化和网络拆解等任务上,与标准的 Laye…

  18. TOOL · CL_91359 ·

    神经网络“领悟”与权重范数动力学相关

    研究人员调查了神经网络中“领悟”(grokking)现象,即模型在已拟合训练数据后仍发生泛化。他们的研究表明,权重范数在此延迟泛化中起着关键作用。通过在训练过程中干预和操纵权重范数,他们发现了一个始终达到的特定临界范数值 Wc,并且该值与网络的模块化基数呈幂律关系。此外,他们观察到将范数保持在 Wc 的固定倍数,会导致“领悟”延迟呈范数倍数的指数关系。

  19. RESEARCH · CL_79207 ·

    新的剪枝技术有望实现更小的模型和更快的训练速度

    研究人员开发了新的神经网络和数据集剪枝方法以提高效率。DCP-Prune 专注于视觉模型的超低 token 剪枝,以显著更少的 token 实现高性能。Squeeze-Release 提供迭代剪枝和结构最小化,模型压缩高达 39 倍,同时保持准确性。此外,OrderDP 和一个基于图的框架提供了理论上保证的无损动态数据剪枝,在不牺牲性能的情况下将训练速度提高了 40% 以上。

  20. TOOL · CL_68549 ·

    SaluNet 用可学习激活替换归一化层

    研究人员开发了 SaluNet,这是一种新颖的深度网络架构,无需传统的归一化层(如 BatchNorm 和 LayerNorm)。这是通过一种新的可学习激活函数 SALU 实现的,该函数在不依赖批次统计数据的情况下内在稳定信号。SaluNet 在图像分类任务(包括 CIFAR-10、CIFAR-100 和 ImageNet)上表现出色,即使在通常会导致归一化网络失败的非常小的批次大小下也是如此。