PulseAugur
中
实时 15:53:48
实体 Softmax

Softmax

PulseAugur coverage of Softmax — every cluster mentioning Softmax across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
54
90 天内 54
发布 · 30天
0
90 天内 0
论文 · 30天
47
90 天内 47
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/3 页 · 共 57 条
  1. TOOL · CL_286837 ·

    新研究将LLM中的灾难性遗忘定位到输出嵌入

    研究人员发现,大型语言模型中的灾难性遗忘(模型在持续训练中会丢失先前学到的信息)存在于新训练数据中未出现的token的输出嵌入中。这种遗忘是由Adam的二阶矩归一化所放大的持续的、单向的softmax梯度驱动的。为解决此问题,提出的解决方案包括在训练期间增加Adam的epsilon值,特别是针对输出投影层。这一调整在不影响新学习或需要模型特定调优的情况下,显著减少了各种模型大小和系列的遗忘,并补充了现有的基于重放的方法。

  2. RESEARCH · CL_271221 ·

    LLM 的注意力机制在新颖的语境和不同模型中表现出独特的行为 · 跟踪 3 个来源

    研究人员正在探索大型语言模型(LLM)的内部机制,特别是注意力函数,如何影响它们在新颖语境下的行为。一项研究提出了一种“函数混合注意力”(MoFA),该模型为 softmax 和 sigmoid 头分配固定的比例,发现这种比例对分布内任务的影响很小,但对分布外性能有显著影响,并根据比例区分文本类型。另一篇论文回顾了 LLM 中注意力机制的演变,通过记忆表示、更新、访问、读出和整合等视角分析了上下文记忆的发展,强调了深度和异构架构如何协…

  3. COMMENTARY · CL_269971 ·

    机器学习社区辩论 softmax 优化以减少参数

    r/MachineLearning 子版块上的一场讨论探讨了神经网络中 softmax 函数的一种理论优化。该提议基于 softmax 输出总和为一的数学特性,暗示有 N-1 个自由度,建议将输入到 softmax 的特征数量减少一个。这可能导致更少的参数和更快的模型收敛,尽管其实际效益受到质疑。

  4. TOOL · CL_269447 ·

    新的量化方法优化 Transformer 注意力输出

    研究人员开发了一种新的量化 Transformer 模型的方法,重点关注注意力机制的 Q、K 和 V 投影。这种方法称为 JAB,直接优化注意力输出而不是单个权重矩阵,在 Mistral-7B 的 3 位量化上表现出改进的性能。然而,当包含 MLP 层时,该方法的有效性会降低,在这种情况下,一种面向角色的偏移规则被证明更成功,在 Mistral-7B 上实现了接近全精度困惑度但压缩率很高。

  5. TOOL · CL_250095 ·

    TokenPrint:开源3D调试器可视化LLM计算

    TokenPrint是一款新的开源3D可视化和调试工具,旨在使Transformer和LLM模型内部的计算更易于探索。该工具由Sudharsanselvaraj开发,允许用户逐层跟踪模型中的token,检查嵌入、注意力分数和投影等元素。它旨在提供对模型如何处理信息的更清晰理解,超越静态图表,提供计算过程的交互式空间表示。

  6. TOOL · CL_245475 ·

    新的数学模型精确表示RoPE-softmax注意力前向传播

    研究人员为神经网络中RoPE-softmax注意力机制的前向传播开发了一种新颖的数学表示方法。该方法构建了一个依赖于查询的有效矩阵,该矩阵精确地将注意力头的输出建模为一个梯度步骤。该方法利用指数商差来精确保持softmax函数,并在Qwen2.5-0.5B层上进行了验证,证明了其在表示注意力计算和量化矩阵重用所需的校正方面的准确性。

  7. TOOL · CL_245120 ·

    Transformer模型可执行上下文内数据生成,模拟生成式采样器

    研究人员已证明,大型语言模型(特别是Transformer模型)可以充当数据生成的上下文内采样器。该研究证明,这些模型可以模拟迭代式生成采样器,将上下文内学习的范围从监督学习扩展到数据生成。这是通过识别softmax注意力在计算责任权重和经验平均值中的生成作用,以及前馈层执行欧拉更新来实现的。实证表明,当Transformer模型遇到与特定语义主题相关的提示时,它们可以近似能量模型采样器。

  8. COMMENTARY · CL_240477 ·

    工程师指南:理解 LLM 的数学之外的行为

    本文旨在为工程师提供对大型语言模型(LLM)如何运作的实际理解,侧重于心智模型而非复杂的数学。文章解释说,LLM 本质上是在预测序列中的下一个词元(token),而涌现的智能就源于这个过程数十亿次的重复。文章详细介绍了从提示(prompt)到词元化(tokenization)、模型前向传播(model forward pass)、采样(sampling)和反词元化(detokenization)的推理流程的核心组成部分,以帮助工程师理…

  9. TOOL · CL_235626 ·

    AI研究量化单层注意力模型中的头部复杂度

    研究人员分析了AI模型中单层注意力机制的计算能力,重点关注“头部复杂度”——即计算特定函数所需的最小注意力头数。他们建立了一个层级结构,表明k个头可以计算k位奇偶校验,但不能计算(k+1)位奇偶校验,这一发现无论嵌入维度或数值精度如何都成立。该研究还引入了一个紧凑性定理,证明嵌入维度和精度受限于任务的离散参数,并推导出了通用二元函数的界限,表明虽然2^n个头足以计算任何n位二元函数,但许多函数需要该数量的很大一部分。

  10. TOOL · CL_235276 ·

    源自广义统计熵的新注意力算子

    研究人员引入了源自广义统计熵的新型注意力算子,超越了标准的Softmax和entmax函数。Kaniadakis熵算子在权重敏感性方面提供代数衰减,与Softmax的指数衰减和entmax的截断形成对比。此外,经典的Abe熵算子提供了一个倒数对称机制,当一个参数接近某个值时,特定项与Softmax对齐。这些发展基于概率单纯形上的Fisher度量原理,其中Shannon扇区恢复了缩放点积Softmax。

  11. COMMENTARY · CL_228352 ·

    大型语言模型尽管拥有大型上下文窗口,但在处理长上下文时仍会遇到困难

    尽管声称拥有大型上下文窗口,但大型语言模型在处理超过一定阈值的信息时常常会遇到困难。注意力机制的计算成本随输入大小呈二次方增长,并且当关键信息被置于长提示的中间时,模型的性能往往会下降。此外,在大量上下文中区分相似但不正确的数据点会进一步降低性能,这表明发送较少、更集中的信息并利用提示结构可以改善结果。

  12. TOOL · CL_218269 ·

    新方法使 Vision Transformers 适应更快的物体检测

    研究人员开发了一种名为 Detector-Interface Distillation (DiD) 的新方法,将 Vision Transformers (ViTs) 从 Softmax 注意力适配到线性注意力,用于物体检测任务。这种无标签的方法侧重于保留检测器的预期特征张量,而不仅仅是模仿内部状态,从而在 DOTA-v1.5 等数据集上实现了显著的性能提升。适配过程速度很快,大约需要 87 分钟完成,推理延迟减少了约 62%,峰值内…

  13. TOOL · CL_210587 ·

    新的arXiv论文将Softmax注意力与扩散图联系起来

    一篇新的arXiv论文提出了机器学习中的softmax注意力机制与扩散图之间的联系。研究表明,注意力算子本质上是行归一化的扩散图算子,仅在学习到的分数的内涵上有所不同。通过分解这些分数,该论文确定了三个几何扇区:一个度量核心、一个节点势扇区和一个与传输或相位相关的循环扇区。

  14. TOOL · CL_210560 ·

    Lévy Attention 引入单通道预测不确定性用于连续时间注意力

    研究人员推出 Lévy Attention,这是一种专为不规则采样时间序列数据设计的新型注意力机制。这种新方法将预测不确定性直接集成到注意力层中,使模型能够量化其预测的可靠性,而无需额外的计算成本。Lévy Attention 通过将注意力输出表述为针对泊松随机测度的随机积分来实现这一点,该测度固有地捕获证据和分歧指标。经验上,与密集数据上的标准注意力机制相比,该方法在稀疏数据集上的准确性损失很小,并且性能显著优于 MC Dropou…

  15. TOOL · CL_209799 ·

    Transformer注意力掩码:因果掩码与填充掩码的必要性

    对Transformer模型中因果掩码和填充掩码必要性的技术深入分析表明,右填充使得填充掩码变得多余,因为因果关系已经排除了填充标记。然而,左填充(常用于仅解码器生成)需要填充掩码来防止注意力泄露到填充标记上。作者还强调了一个常见问题,即掩码行在softmax后可能导致无意义的均匀分布,并提出了解决方案,例如在填充查询位置掩码输出或将完全掩码的行置零。

  16. TOOL · CL_204830 ·

    复现StreamingLLM产生零结果,凸显模型学习到的行为

    一项试图复现大型语言模型StreamingLLM技术的尝试,该技术声称通过保留固定数量的初始token在KV缓存中来提高性能,但并未产生任何可辨别的影响。作者使用随机查询/键对进行的实验表明,当模型学习到的行为不存在时,StreamingLLM的所谓好处也随之消失。这表明StreamingLLM的有效性与其模型学习到的路由机制有关,而不是token位置的几何属性。

  17. RESEARCH · CL_198189 ·

    核注意力在最新研究中面临指数特征秩挑战

    一篇新的研究论文探讨了自然语言处理中核注意力机制的局限性。研究表明,虽然全注意力暴露了每个 Token 对,但核注意力将序列压缩成固定维度的草图。在出现竞争性候选的上下文长度下,这种区别呈指数级增长。论文显示,对于布尔输入上的 Min-IP,秩一归一化核注意力可以精确解决长度为两的序列,但任何单一归一化的非负核注意力头在处理三个 Token 的序列时,都需要指数数量的特征才能以最小的误差成功。

  18. TOOL · CL_193973 ·

    新的HSMLA方法提高了视觉Transformer在密集预测任务中的效率

    研究人员推出了一种名为HSMLA(分层Softmax多尺度线性注意力)的新方法,旨在提高视觉Transformer在处理高分辨率密集预测任务时的效率。该方法结合了用于全局上下文的线性注意力和用于局部特征和多尺度Token表示的选择性softmax细化。HSMLA在多种任务中展示了显著的加速效果,包括CT器官分割和病理WSI分析,推理时间速度提升高达4.2倍。

  19. TOOL · CL_191387 ·

    新研究界定 Transformer 注意力分布,以提高训练稳定性

    研究人员开发了一种新方法来分析 Transformer 自注意力块的局部 Lipschitz 常数,揭示了其对注意力图分布的依赖性。这项工作引入了 JaSMin,一种旨在控制该常数并增强 Transformer 训练稳定性的正则化器。研究结果还阐明了注意力图分布如何影响梯度动态。

  20. COMMENTARY · CL_188793 ·

    语言模型温度:它如何影响标记选择

    文章解释说,语言模型中的“温度”参数实际上并没有增加创造力,而是影响模型选择不太可能出现的标记的意愿。温度在 softmax 函数之前作为除数应用于 logits,softmax 函数将原始分数转换为概率。较低的温度会锐化概率分布,将质量集中在排名靠前的标记上,而较高的温度会使分布变平,从而为排名较低的标记赋予更多权重,但不会改变它们的根本排名。