研究人员推出了一种名为稀疏增量记忆(Sparse Delta Memory, SDM)的新型架构,旨在增强线性循环神经网络(RNN)的长上下文记忆能力。通过采用稀疏寻址方案,SDM显著提高了门控线性RNN的隐藏状态容量,在相似的计算约束下,其在上下文学习和长上下文检索任务上的表现优于传统的Transformer架构。该架构通过对显式内存进行稀疏读写来扩展门控增量网络(Gated DeltaNet),并且当其初始状态被参数化学习时,还能进一步提高常识推理任务的性能。 AI
影响 增强了RNN的长上下文记忆能力,可能为特定任务提供Transformer架构的替代方案。
排序理由 该集群描述了一篇详细介绍RNN新型架构的最新研究论文。
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gated DeltaNet
- Gotit.pub
- Hugging Face
- IArxiv
- Linear RNNs
- ScienceCast
- Sparse Delta Memory
- transformer architectures
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →