Sigmoid Attention
PulseAugur coverage of Sigmoid Attention — every cluster mentioning Sigmoid Attention across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能
研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…
-
新框架统一分析深度Transformer动力学
研究人员开发了一个新颖的框架来分析深度Transformer内部的复杂动力学,Transformer是许多机器学习任务的基础。通过将输入序列的演化建模为Vlasov方程,称为Transformer PDE,他们可以更好地理解注意力机制如何在层之间运作。该方法已推广到各种注意力变体,包括多头注意力、L2注意力、Sinkhorn注意力、Sigmoid注意力和掩码注意力,利用条件Wasserstein框架。该研究还独特地探索了非紧支撑的初始…
-
Sigmoid attention 改进了生物基础模型,实现了更快、更稳定的训练
研究人员开发了一种名为 Sigmoid Attention 的新注意力机制,该机制在训练生物基础模型方面提供了显著改进。与传统的 softmax attention 相比,这种新颖的方法能够学习到更好的表示,实现高出 25% 的细胞类型分离度和更高的内聚度指标。此外,Sigmoid Attention 能够实现更快的训练,模型完成速度最多可提高 10%,并通过缓解 softmax attention 中固有的问题来增强稳定性。该团队还…