PulseAugur
实时 09:44:28
English(EN) Maglev: Sliding Recurrent Memory

Maglev:新的循环 Transformer 架构提高了效率

研究人员推出 Maglev,这是一种新颖的循环 Transformer 架构,旨在提高效率和性能。Maglev 使用双模型系统:一个预填充模型,该模型访问完全注意力以生成内存目标;以及一个解码器模型,该模型采用滑动窗口注意力并进行循环键/值注入,以进行下一个 token 预测。该架构旨在泛化滑动窗口注意力,同时在训练期间保持并行性,与现有的循环和滑动窗口 Transformer 基线相比,在验证损失和下游预训练基准测试中均有所提高。 AI

影响 引入了一种更高效的循环 Transformer 架构,可以改进大型语言模型的训练和推理。

排序理由 该条目描述了一种新的架构及其在 arXiv 学术论文中展示的性能改进。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Maglev:新的循环 Transformer 架构提高了效率

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Bo Liu, Qiang Liu ·

    Maglev: Sliding Recurrent Memory

    arXiv:2608.02870v1 Announce Type: new Abstract: We introduce \ours{}, a recurrent Transformer architecture with fixed-size memory that generalizes sliding-window attention while remaining parallelizable during training. \ours{} consists of two coupled models: a prefiller $Q$, whi…