Associative recall of memory without errors
PulseAugur coverage of Associative recall of memory without errors — every cluster mentioning Associative recall of memory without errors across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Transformer训练方法影响电路可移除性
一篇新研究论文探讨了训练轨迹如何影响退火软先验Transformer中电路的可移除性。研究发现,特定的训练方法,如平滑渐零训练,对于在移除位置先验后保留检索电路的功能至关重要。这种效应在不同任务中都得到了观察,包括联想回忆和马尔可夫归纳,这表明训练路径,而不仅仅是最终架构,决定了小型离散检索任务中电路的可移除性。
-
通过哈希和缩放定律分析Mamba架构的召回机制
一篇新的研究论文深入探讨了Mamba架构的联想召回能力,这是评估自然语言处理中上下文记忆的关键基准。研究表明,Mamba通过隐式学习线性哈希函数来进行召回,并确定了负责这种行为的底层电路。研究人员开发了一个名为召回缩放定律(Recall Scaling Laws)的理论框架,该框架受到诸如Johnson-Lindenstrauss引理等哈希技术的启发,用于预测模型实现完美召回所需的维度,并分析召回能力如何随各种参数进行缩放。
-
DART架构通过融合Transformer和SSM来增强长上下文序列建模
研究人员推出了一种新颖的架构DART(Decoded Attention over Recurrent States),它结合了Transformer和状态空间模型(SSMs)的优势,用于高效的长上下文序列建模。DART基于Mamba-2,通过从SSM的压缩状态解码token条件化的键和值来实现状态-记忆注意力(SMA)。与传统的注意力机制相比,这种方法显著降低了推理缓存需求,并在保持语言建模质量的同时增强了联想回忆和检索能力。