Spiking Transformers
PulseAugur coverage of Spiking Transformers — every cluster mentioning Spiking Transformers across labs, papers, and developer communities, ranked by signal.
- 2026-05-22 research_milestone A new framework was proposed to approximate nonlinear operators in Transformers for compatibility with spiking neural networks. 来源
3 天有情绪数据
-
新的SAGE方法通过自适应梯度改进脉冲Transformer训练 · 跟踪2个来源
研究人员推出了一种新颖的代理梯度机制SAGE,旨在改进脉冲Transformer的训练。该方法利用注意力引导熵在训练过程中自适应调整代理梯度斜率,从而增强优化灵活性,而无需改变推理模型。在CIFAR-10和CIFAR-100数据集上的实验表明,SAGE相比传统的固定代理基线,能够实现1-2%的一致性准确率提升。
-
新的SCLA-BCP方法增强了脉冲神经网络Transformer的注意力局部性
研究人员开发了一种名为空间连续局部注意力与边界连续性通路(SCLA-BCP)的新方法,以提高脉冲神经网络Transformer的空间局部性。该方法解决了在脉冲驱动的视觉处理中建立局部化token交互的挑战。SCLA-BCP在相邻token区域内计算注意力,并使用卷积通路进行跨边界通信,在COCO 2017和ADE20K等数据集上展示了显著的准确性提升,且开销极小。
-
新的M-TTFS编码提升了SNN在LLM上的能效
研究人员开发了一种名为掩码首次脉冲时间(M-TTFS)的新编码方法,用于脉冲神经网络(SNN),以提高大型语言模型(LLM)的能效。M-TTFS编码重新分配了通常不传输任何信息的静默状态,以表示最常见的激活值,从而减少了与数据移动和权重读取相关的能耗。该方法被应用于一个名为Matterhorn的脉冲变压器模型,该模型在GLUE基准测试上取得了1.42个百分点的提升,并比之前的脉冲变压器消耗的能量减少了67%,同时在LLaMA模型上也显…
-
新框架使脉冲神经网络可用于大型语言模型
研究人员开发了一个新框架,使大型语言模型更能兼容神经形态硬件。该方法侧重于为Transformer中的非线性算子创建对脉冲友好的近似,这些算子通常对标准的脉冲神经元动力学具有挑战性。通过将这些非线性分解为重复的基本单元,并使用神经元群体的计算,该框架可以在最小的精度损失下近似Softmax和SiLU等常见非线性。
-
Vision SmolMamba 使用尖峰引导式剪枝实现能效型视觉模型
研究人员推出 Vision SmolMamba,这是一种新颖的、能效型的脉冲状态空间架构,专为视觉建模而设计。该架构将脉冲驱动动力学与线性时间选择性递归相结合,利用脉冲引导式时空令牌修剪器 (SST-TP) 根据脉冲激活和延迟来估计令牌重要性。通过逐步移除冗余令牌,Vision SmolMamba 保留了关键的时空信息,实现了高效扩展和改进的精度-效率权衡。在各种基准测试上的实验表明,与之前的脉冲 Transformer 和 Mamb…