研究人员推出了一种新颖的架构DART(Decoded Attention over Recurrent States),它结合了Transformer和状态空间模型(SSMs)的优势,用于高效的长上下文序列建模。DART基于Mamba-2,通过从SSM的压缩状态解码token条件化的键和值来实现状态-记忆注意力(SMA)。与传统的注意力机制相比,这种方法显著降低了推理缓存需求,并在保持语言建模质量的同时增强了联想回忆和检索能力。 AI
影响 增强了长上下文建模的效率和检索能力,可能提高复杂NLP任务的性能。
排序理由 该集群描述了一篇详细介绍序列建模新颖架构的研究论文。
- Dart
- Flashattention
- Mamba-2
- State Space Models
- transformers
- Associative recall of memory without errors
- Retrieval
- state space duality
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →