Softmax
PulseAugur coverage of Softmax — every cluster mentioning Softmax across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
新的arXiv论文将Softmax注意力与扩散图联系起来
一篇新的arXiv论文提出了机器学习中的softmax注意力机制与扩散图之间的联系。研究表明,注意力算子本质上是行归一化的扩散图算子,仅在学习到的分数的内涵上有所不同。通过分解这些分数,该论文确定了三个几何扇区:一个度量核心、一个节点势扇区和一个与传输或相位相关的循环扇区。
-
Lévy Attention 引入单通道预测不确定性用于连续时间注意力
研究人员推出 Lévy Attention,这是一种专为不规则采样时间序列数据设计的新型注意力机制。这种新方法将预测不确定性直接集成到注意力层中,使模型能够量化其预测的可靠性,而无需额外的计算成本。Lévy Attention 通过将注意力输出表述为针对泊松随机测度的随机积分来实现这一点,该测度固有地捕获证据和分歧指标。经验上,与密集数据上的标准注意力机制相比,该方法在稀疏数据集上的准确性损失很小,并且性能显著优于 MC Dropou…
-
Transformer注意力掩码:因果掩码与填充掩码的必要性
对Transformer模型中因果掩码和填充掩码必要性的技术深入分析表明,右填充使得填充掩码变得多余,因为因果关系已经排除了填充标记。然而,左填充(常用于仅解码器生成)需要填充掩码来防止注意力泄露到填充标记上。作者还强调了一个常见问题,即掩码行在softmax后可能导致无意义的均匀分布,并提出了解决方案,例如在填充查询位置掩码输出或将完全掩码的行置零。
-
复现StreamingLLM产生零结果,凸显模型学习到的行为
一项试图复现大型语言模型StreamingLLM技术的尝试,该技术声称通过保留固定数量的初始token在KV缓存中来提高性能,但并未产生任何可辨别的影响。作者使用随机查询/键对进行的实验表明,当模型学习到的行为不存在时,StreamingLLM的所谓好处也随之消失。这表明StreamingLLM的有效性与其模型学习到的路由机制有关,而不是token位置的几何属性。
-
核注意力在最新研究中面临指数特征秩挑战
一篇新的研究论文探讨了自然语言处理中核注意力机制的局限性。研究表明,虽然全注意力暴露了每个 Token 对,但核注意力将序列压缩成固定维度的草图。在出现竞争性候选的上下文长度下,这种区别呈指数级增长。论文显示,对于布尔输入上的 Min-IP,秩一归一化核注意力可以精确解决长度为两的序列,但任何单一归一化的非负核注意力头在处理三个 Token 的序列时,都需要指数数量的特征才能以最小的误差成功。
-
新的HSMLA方法提高了视觉Transformer在密集预测任务中的效率
研究人员推出了一种名为HSMLA(分层Softmax多尺度线性注意力)的新方法,旨在提高视觉Transformer在处理高分辨率密集预测任务时的效率。该方法结合了用于全局上下文的线性注意力和用于局部特征和多尺度Token表示的选择性softmax细化。HSMLA在多种任务中展示了显著的加速效果,包括CT器官分割和病理WSI分析,推理时间速度提升高达4.2倍。
-
新研究界定 Transformer 注意力分布,以提高训练稳定性
研究人员开发了一种新方法来分析 Transformer 自注意力块的局部 Lipschitz 常数,揭示了其对注意力图分布的依赖性。这项工作引入了 JaSMin,一种旨在控制该常数并增强 Transformer 训练稳定性的正则化器。研究结果还阐明了注意力图分布如何影响梯度动态。
-
语言模型温度:它如何影响标记选择
文章解释说,语言模型中的“温度”参数实际上并没有增加创造力,而是影响模型选择不太可能出现的标记的意愿。温度在 softmax 函数之前作为除数应用于 logits,softmax 函数将原始分数转换为概率。较低的温度会锐化概率分布,将质量集中在排名靠前的标记上,而较高的温度会使分布变平,从而为排名较低的标记赋予更多权重,但不会改变它们的根本排名。
-
部分FC方法可实现千万级身份人脸识别模型训练
研究人员开发了一种名为部分FC(PFC)的新颖方法,可在单台机器上高效训练具有数百万身份的人脸识别模型。该技术通过在每个小批量中仅激活采样的一小部分负类中心来近似完整的softmax分类器,同时仍保留所有正类中心。PFC显著降低了内存、计算和通信开销,能够以具有竞争力的准确性和更高的效率进行大规模训练,支持数千万个类别。该方法还对标签噪声和长尾身份分布表现出鲁棒性。
-
LLM 温度:并非创造力,而是概率分布控制
LLM 温度参数常被误解为创造力旋钮,但它实际上控制着在采样下一个 token 之前如何重塑模型的概率分布。温度为 1.0 时按原样使用分布,而较低的温度会通过偏向更可能的 token 来锐化分布,较高的温度则通过让不太可能的 token 有更大的机会被选中来使分布变平。对于需要正确性的任务,如分类或结构化输出,开发者应默认使用温度 0,仅在需要方差时(如开放式生成)才增加它。
-
MoE模型可利用现有不确定性信号提高效率
一篇近期论文提出,混合专家(MoE)模型可以通过利用其路由器softmax中现有的每个token不确定性信号来提高效率。这些模型不是平均分配计算量,而是可以动态地将更多资源分配给需要更高置信度的token,而将较少资源分配给模型已经理解的token。这种方法旨在减少在模型已确定的token上浪费计算能力。
-
新型轻量级检测 Transformer 实现全整型推理
研究人员开发了 I-LW-DETR,这是一种新型轻量级检测 Transformer,可实现全整型推理。这对于在 NPU 和微控制器上部署此类模型来说是一个重大进展,因为这些设备传统上难以处理 Transformer 中常见的浮点运算。该系统包含一个保持比例的分割卷积、一个依赖符号的 GELU 近似(SD-ShiftGELU)和一个约束的 Shiftmax 函数,以确保包括非线性在内的所有运算都使用整数算术执行。这种方法使得模型尺寸减小…
-
GLIDE:新的注意力机制提升LLM推理效率
研究人员推出了一种名为GLIDE的新方法,旨在提高大型语言模型(LLM)在推理过程中的效率,尤其是在长上下文生成方面。GLIDE采用了一种引导式层级混合注意力机制,该机制巧妙地结合了滑动窗口softmax注意力和线性循环聚合。该方法利用了LLM中不同层对注意力机制敏感度不同的观察结果,使得GLIDE能够在模型中非均匀地压缩softmax的计算量。其结果是在不牺牲生成输出质量的情况下,显著降低了端到端延迟和KV缓存I/O。
-
新的注意力机制VIA增强了AI在科学任务中的应用
研究人员推出了一种名为变分伊辛注意力(VIA)的新型注意力机制,专为科学任务设计。与标准的softmax注意力不同,VIA整合了一个相互作用的伊辛模型,以捕捉实体之间的结构化耦合,这对于科学问题至关重要。在逆合成反应中心预测上的实验表明,VIA通过变分平均场推断从成对耦合中学习注意力模式,显著优于传统的注意力方法。这种方法表明,与通用效率相比,与领域特定结构对齐的定制化注意力对于科学应用更有效。
-
质量感知注意力机制提升了AI模型的信息保留能力
研究人员开发了一种名为质量感知注意力机制(Mass-Aware Attention, MAA)的新型注意力机制,旨在提高AI模型内部表征的信息量。标准的注意力机制在累积证据时会丢失信息,尤其是在模式重复的情况下。MAA通过将L1归一化推广到Lp族来解决这个问题,允许表征以不同的速率缩放,并保留有关输入数量的信息。该方法在各种时间图模型和数据集上显示出改进,增强了图统计和优先依附的恢复能力。
-
新的变分模型增强了弱边界图像分割
研究人员开发了一种新的图像分割变分模型,专门用于处理具有弱边界或模糊边界的均质结构。该模型基于Cahn-Hilliard方程,将基于softmax的区域拟合与相场正则化相结合,即使在图像驱动力较弱的情况下也能保持清晰的界面。提出的框架包括用于自适应质量变化的混合L2-H-1梯度流和用于高效计算的稳定标量辅助变量方案。在合成图像和医学图像上的实验表明,该方法能有效分离相邻的均质结构,并与现有的变分、相场和深度学习方法相比,提供了更高的准…
-
InstantSfM 为深度学习时代提供 GPU 原生运动恢复结构
研究人员开发了 InstantSfM,一个新颖的 GPU 原生运动恢复结构 (SfM) 系统,旨在与深度学习流水线无缝集成。该系统通过将度量深度先验直接嵌入其优化框架,解决了传统以 CPU 为中心的 SfM 方法的局限性,消除了尺度模糊并提高了数值稳定性。InstantSfM 展现了显著的速度提升,在大规模数据集上,其性能比 COLMAP 等成熟工具提高了 40 倍,同时保持了相当的重建精度。
-
论文解释了为何相对位置编码能提升 Transformer 的泛化能力
一篇新论文提出了一个基于优化的解释,说明为何具有相对位置编码的 Transformer 比具有绝对编码的 Transformer 在泛化到更长序列时表现更好。研究表明,梯度下降的隐式偏差在使用 Rotary Encodings 时倾向于有利于对相对位置具有等变性的解,从而在不同序列长度下实现一致的性能。相比之下,绝对编码倾向于记忆特定位置,阻碍了外插。该研究通过在最小检索任务和全序列长度泛化任务上的实验证实了这些发现,并指出线性注意力…
-
新研究质疑 Transformer 的通用性,发现特定任务架构表现更优
研究人员开发了一种方法,通过用可学习的替代方案替换 GELU 和 softmax 等非线性函数来优化特定数据集的 Transformer 架构。这种方法表明,标准的 Transformer 架构通常不是给定任务的最佳架构,新的设计在算法任务的学习速度、泛化能力和稳定性方面显示出显著的改进。虽然这些优化后的架构高度特定于任务,但它们也表明不同任务需要不同的归纳偏倚,这预示着未来架构可能更好地平衡通用性与专业能力。
-
Attention Sinks: Why Early Tokens Are Critical for LLM Stability
一项技术分析表明,序列中的早期标记(称为“注意力汇聚点”)对于基于 Transformer 的大型语言模型的稳定运行至关重要。这些汇聚点充当注意力概率质量的停泊点,防止其破坏真实标记的表示。当这些初始标记被移除时,尤其是在使用滑动窗口 KV 缓存的流式 LLM 架构中,模型性能会显著下降,这种现象被称为“注意力汇聚点”。