Long-Range Arena benchmark
PulseAugur coverage of Long-Range Arena benchmark — every cluster mentioning Long-Range Arena benchmark across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究致力于稀疏注意力,以实现高效的长上下文大语言模型 · 跟踪 6 个来源
2026 年 8 月发布的多个研究论文探讨了用于大语言模型稀疏注意力机制的新方法,旨在提高效率和长上下文建模能力。这些研究引入了诸如学习到的 Tsallis 指数、具有流式处理能力的在线高效稀疏注意力以及输入自适应稀疏引擎等技术。目标是降低自注意力的二次计算复杂度,使模型能够更有效地处理更长的上下文并加速推理时间,尤其是在视频扩散模型和通用语言任务方面。
-
Naju模型引入了解耦的遗忘和写入功能,以实现长序列记忆
研究人员推出了一种名为Naju的新型原生离散状态空间模型,旨在增强长序列记忆能力。与以往在平衡信息遗忘和覆盖方面存在困难的模型不同,Naju将这两个功能解耦。这使得数据在长时间内能够近乎无损地保留,同时也能主动覆盖过时信息。Naju在记忆追踪、语言建模和联想回忆任务中表现出色,优于现有的Mamba模型,并在保持高效扩展性的同时,与Transformer架构相比也保持了竞争力。
-
新框架联合优化语音增强与响度控制
研究人员开发了SE-AGCNet,一个新颖的端到端框架,旨在联合优化会议场景下的语音增强(SE)和自动增益控制(AGC)。这种方法解决了传统流水线中离散的SE和AGC模块可能导致噪声放大或过度抑制轻声语音的局限性。通过集成这些功能,SE-AGCNet旨在在提高语音质量和自动语音识别(ASR)准确性的同时,保持一致的响度。
-
新的AI方法应对持续学习和函数梯度下降
研究人员提出了持续学习AI模型的新方法,解决了在不损害现有能力的情况下整合新知识的挑战。一种方法KeepLoRA++利用层缩放残差梯度自适应来平衡视觉-语言模型中的知识保留和可塑性。另一种方法ReGrad将梯度视为可检索单元,从而无需累积权重漂移即可进行参数化知识注入。此外,一种新的函数梯度下降算法可以自适应函数梯度表示,提供改进的收敛保证和性能。
-
LongSpike:新的SNN框架增强长序列学习能力
研究人员推出了一种新的脉冲神经网络(SNN)框架LongSpike,该框架利用分数阶状态空间模型(f-SSM)来增强长序列的学习能力。这种方法克服了传统一阶SNN在捕捉长距离依赖关系方面的局限性。LongSpike能够更有效地将神经元动力学与长记忆核相结合,并支持高效的并行训练。在Long Range Arena和WikiText-103等基准测试上的评估表明,LongSpike在保持计算效率的同时,实现了比现有SNN更高的准确性。
-
选择性更新RNN在效率上匹配Transformer的准确性
研究人员开发了一种新型循环神经网络(RNN),称为选择性更新RNN(suRNNs),它可以高效地处理长序列建模。与在每个时间步都进行更新的传统RNN不同,suRNNs在神经元层面使用二进制开关来学习何时保留记忆,将更新与序列长度解耦。这使得它们能够在冗余区间内保持精确的过去信息,从而在Long Range Arena等基准测试中以更高的效率实现Transformer级别的准确性。