PulseAugur
实时 10:03:29
English(EN) MoNe: Modular Neural Memory for Efficient Long Context Inference

MoNe系统为Transformer实现高效长上下文推理

研究人员开发了MoNe,一种新颖的模块化神经内存系统,旨在增强现有Transformer模型的长上下文推理能力,而无需重新训练。MoNe通过分割上下文并在测试时使用局部梯度更新进行学习,从而实现线性的预处理成本和恒定的查询成本。这种方法显著降低了计算和峰值GPU内存使用量,在128K token时减少了80%,且参数开销极小。该系统在needle-in-a-haystack和word extraction等基准测试中表现强劲,其性能优于上下文长度通常会导致性能下降的标准方法。 AI

影响 这种模块化内存系统可以显著降低处理大型语言模型长上下文的计算成本。

排序理由 该集群包含一篇详细介绍改进AI模型推理新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

MoNe系统为Transformer实现高效长上下文推理

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Wonguk Cho, Kyubyung Chae, Tribhuvanesh Orekondy, Sunghyun Park, Hyoungwoo Park, Jeongho Kim, Arash Behboodi, Kyuwoong Hwang, Sungrack Yun ·

    MoNe:用于高效长上下文推理的模块化神经内存

    arXiv:2608.17616v1 Announce Type: new Abstract: We present MoNe, a lightweight modular neural memory that attaches to any frozen pretrained Transformer to enable long-context inference without retraining. MoNe reads context in fixed-size segments via test-time learning of fast-we…