PulseAugur
实时 15:08:45
实体 RMSNorm

RMSNorm

PulseAugur coverage of RMSNorm — every cluster mentioning RMSNorm across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 23
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 17
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 23 条
  1. RESEARCH · CL_209314 ·

    Kimi K3模型通过新的注意力机制突破长上下文和深度瓶颈 · 已追踪2个来源

    Moonshot的Kimi K3模型解决了极长上下文窗口和深度神经网络的挑战。为了处理长达一百万个token的上下文窗口,Kimi K3采用了Kimi Delta Attention (KDA),它将历史信息压缩成固定大小的状态,而不是像标准注意力那样存储单独的键值对。这种方法解决了序列长度增加带来的计算成本不断上升的问题。此外,该模型还引入了Attention Residuals,一种学习每一先前层贡献的机制,防止有用表示在模型深度中丢失。

  2. TOOL · CL_193835 ·

    新研究诊断出仅解码器Transformer中的秩崩溃问题

    一篇新研究论文发布在arXiv上,详细介绍了一种用于理解后归一化解码器Transformer中秩崩溃的机制性诊断方法。该研究分析了这些模型中的因果注意力如何导致高相似度表示,以及为什么训练动态未能纠正这一点。研究提出了一个使用token相似度作为状态变量的两阶段分析,解释了初始化和后续训练动态如何导致梯度消失和模型崩溃。

  3. TOOL · CL_193825 ·

    SwiftQK 通过高效的张量并行优化大型语言模型训练

    研究人员开发了 SwiftQK,一种用于优化大型语言模型(使用张量并行训练)中查询-键归一化(QK-Norm)的新方法。该技术通过仅交换标量归一化统计数据并使计算与数据归约重叠,显著降低了与 QK-Norm 相关的通信开销。与现有方法相比,SwiftQK 在延迟和端到端服务性能方面均取得了实质性改进。

  4. TOOL · CL_191133 ·

    新的分块SVD方法直接从权重中提取网络机制

    研究人员开发了一种名为列分块SVD的新方法,可以直接从神经网络中的线性位提取可用的权重机制。该方法识别网络权重本身的概念,而不是依赖外部代理词典。该方法在Gemma-2-2B上使用WikiText-2进行了评估,在所有测试的线性映射中均获得满分182/182,其中特定的映射在残差写入方面显示出完整的A/B/C评分。

  5. TOOL · CL_189340 ·

    乐高积木类比解析现代GPT架构及效率提升

    本文使用乐高积木类比解释现代GPT架构的内部工作原理,详细说明了单个token如何从输入处理到输出。文章分解了RoPE、RMSNorm和SwiGLU等关键改进,解释了这些进步如何比GPT-2等旧模型提高效率。解释侧重于Transformer Blocks和注意力机制,这对于理解GPT模型如何通过预测下一个token来生成文本至关重要。

  6. SIGNIFICANT · CL_186255 ·

    Kimi K3 采用 896 个专家和混合注意力机制实现高效扩展

    Kimi K3 是一个拥有 2.8 万亿参数的模型,它采用了一种新颖的方法来管理其庞大的规模,即每个 token 只激活 896 个路由专家中的 16 个。研究员苏剑林详细介绍了这一策略,旨在控制计算成本,尽管参数量和上下文长度有所增加。该模型集成了 LatentMoE 以减少专家计算和通信,并结合了 RMSNorm 和 SiTU-GLU 等机制,以在低精度训练期间保持数值稳定性。其注意力架构结合了 KDA 用于连续状态维护和 MLA…

  7. TOOL · CL_175631 ·

    Kroma v0.1 LoRA 微调模型已发布,适用于 Krea 2 模型

    名为 Kroma v0.1 的新 LoRA 微调模型已发布,适用于 Krea 2 模型,专为 ComfyUI 设计。此微调模型打包为单个 safetensors 文件,不仅包含 LoRA 适配器,还包含完全微调的归一化和调制张量作为权重增量。Kroma v0.1 兼容基础 Krea 2 检查点和更快的 Turbo 版本,并提供了特定推荐设置以获得最佳效果。

  8. RESEARCH · CL_154381 ·

    新的几何框架对五种大型语言模型的Transformer架构进行建模

    研究人员开发了一个连续几何框架来模拟Transformer架构,将离散的代数运算转化为微分几何和测度论。该框架对注意力机制和优化动态等方面进行定量预测,并在包括Qwen3、LLaMA-3.1、Gemma-3、GPT-2和Mistral在内的五种不同模型架构上进行了测试。实验结果与几何预测高度一致,为理解大型语言模型的稳定极限和优化动态提供了新的描述性词汇。

  9. TOOL · CL_139285 ·

    vLLM 发布 0.25.1 版本,修复 RMSNorm quant fusions 错误

    vLLM 发布了 0.25.1 版本,这是一个 bug修复更新,解决了 mixed-dtype allreduce RMSNorm quant fusions 的问题。该版本包括特定的代码更改,并由 Hugo Centeno Jr. 签署。此次更新侧重于 vLLM 项目的内部优化和稳定性。

  10. SIGNIFICANT · CL_130601 ·

    ai-sage 发布 4320 亿参数的 GigaChat 3.5 Ultra

    ai-sage 发布了 GigaChat 3.5 Ultra,这是一款拥有 4320 亿参数的混合专家模型,专为多语言任务、推理和代码生成而设计。与前代 GigaChat 3.1 Ultra 相比,新版本体积缩小了约 40%,同时在编码和数学场景下性能有所提升。GigaChat 3.5 Ultra 采用混合注意力架构,结合了多头潜在注意力 (Multi-head Latent Attention) 和门控 Delta 网络 (Gate…

  11. RESEARCH · CL_119632 ·

    新方法提高了LLM检查点迁移的准确性

    研究人员开发了一种名为Signed-Permutation Coordinate Transport (SPCT)的新方法,以提高大型语言模型 (LLM) 检查点之间信息迁移的准确性。该技术通过同时考虑模型参数的置换和符号变化,解决了现有方法(尤其是在基于RMSNorm的模型上)的局限性。SPCT显著提高了坐标迁移的准确性,从而在稀疏自编码器重建和情感引导等任务中获得更好的性能。

  12. RESEARCH · CL_119631 ·

    Review Residuals 改进了 Transformer 的大规模训练稳定性和性能

    研究人员为 Transformer 模型引入了一种名为“Review Residuals”的新型门控机制,旨在提高训练的稳定性和性能,尤其是在大规模应用中。该方法使用学习到的、依赖于输入的门来缩放子层更新,这与标准的残差连接不同。实验表明,虽然门控的凸形式在深度方面存在困难,但保持身份的加法形式可以在各种深度下稳定训练。此外,Review Residuals 在参数量从 5.9 亿到 10 亿的模型中,相比标准的残差连接和 Highw…

  13. TOOL · CL_116105 ·

    现代 LLM Transformer 块通过 RMSNorm、GQA 和 MoE 演进

    大型语言模型 (LLM) 中的现代 Transformer 块已超越最初的 2017 年设计,以提高训练稳定性、上下文长度、推理效率和模型容量。关键的进步包括使用 RMSNorm 进行更简单、更稳定的归一化,使用分组查询注意力 (GQA) 和旋转位置嵌入 (RoPE) 来优化注意力机制,以及在前馈网络中使用 SwiGLU 或专家混合 (MoE) 来增强表达能力和容量。这些修改解决了关键的扩展挑战,使大规模 LLM 的开发和部署更加实用。

  14. RESEARCH · CL_111635 ·

    RayPE编码提升视频生成模型的三维感知能力

    研究人员开发了RayPE,一种用于视频扩散Transformer的新型位置编码方法,可增强三维感知能力。与使用相机网格坐标的现有方法不同,RayPE结合了6D Plucker坐标来捕捉相机射线之间的几何关系。该方法将注意力分数分解为内容和几何项,两者都被发现对性能至关重要。该方法轻量级,为现有模型增加的参数不到0.1%,并在相机可控性、帧间三维一致性以及整体视频质量方面取得了改进。

  15. RESEARCH · CL_99805 ·

    新的 QG-MIL 架构提高了医学影像分析的准确性

    研究人员开发了 QG-MIL,这是一种新颖的门控 Transformer 聚合器,旨在提高医学影像中多实例学习 (MIL) 的稳定性和准确性。这种新架构通过引入基于 RMSNorm 的预归一化、每头 QK 归一化、细粒度注意力输出门控和 SwiGLU 前馈模块来解决过度自信和不稳定的预测问题。QG-MIL 在病理学和血液学六个基准测试中表现出色,平均比现有方法高出 6.1 个宏平均 F1 分数,并显示出更分布式的实例加权。

  16. RESEARCH · CL_99566 ·

    新的诊断工具可识别 LayerNorm Transformer 中的“死方向”

    研究人员已识别出一种代数方法来检测 LayerNorm Transformer 中的“死方向”,这些方向是 Fisher 信息度量消失的参数空间方向。这项发表在 arXiv 上的新诊断技术仅使用 LayerNorm 尺度参数即可查明这些死方向,无需进行计算密集型的前向传播或特征值分解。该方法已在 14 个预训练 Transformer 上成功测试,准确预测了 LayerNorm 模型中的死方向,并正确识别了 RMSNorm 模型中死方…

  17. TOOL · CL_96153 ·

    新型 MIVE 引擎加速大语言模型归一化操作

    研究人员开发了一种名为 MIVE(Minimalist Integer Vector Engine,极简整数向量引擎)的新硬件架构,旨在加速大语言模型(LLMs)中的关键操作。MIVE 是一种可编程引擎,可以在单个数据通路中高效处理 Softmax、LayerNorm 和 RMSNorm 功能,从而减少对重复硬件资源的需求。ASIC 实现表明,与现有针对这些操作的独立加速器相比,MIVE 在面积和硬件效率方面均有所提高。

  18. RESEARCH · CL_93581 ·

    新的QK-Normed MLA方法在无需完全缓存键的情况下稳定LLM注意力

    研究人员开发了QK-Normed MLA,一种无需完全缓存键即可稳定大型语言模型中注意力机制的方法。该技术通过分解RMSNorm并将静态权重吸收到现有投影中,将QK归一化集成到多头潜在注意力(MLA)中。与QK剪枝相比,该方法在保持MLA高效解码的同时,实现了更低的训练损失和更高的下游准确性,并且在Nvidia H800硬件上具有最小的延迟开销。

  19. RESEARCH · CL_65711 ·

    新论文通过谱几何分析神经网络的“领悟”现象

    两篇新的arXiv论文探讨了神经网络中“领悟”(grokking)现象,即模型在记忆训练数据后才能泛化。其中一篇论文提出“低秩衰减”(Low-Rank Decay, LRD)作为谱正则化器,通过压缩奇异值来改善领悟,并表明它可以加速秩崩溃并扩大泛化能力的数据分数边界。另一篇论文将领悟视为一个约束优化问题,证明了梯度下降在零损失流形上最小化权重范数,并推导出了记忆后动力学的闭式表达式。

  20. TOOL · CL_26875 ·

    Transformer大语言模型架构趋向标准化栈

    对2017年至2025年间53个大语言模型的最新分析显示,Transformer架构正显著趋同。这一事实上的标准包括预归一化 (RMSNorm)、旋转位置嵌入 (RoPE)、MLP中的SwiGLU激活函数以及共享键值注意力机制 (MQA/GQA)。这种趋同归因于优化稳定性提高、每FLOP质量提升以及内核可用性和KV缓存经济性等实际考量。