研究人员开发了MoNe,一种新颖的模块化神经内存系统,旨在增强现有Transformer模型的长上下文推理能力,而无需重新训练。MoNe通过分割上下文并在测试时使用局部梯度更新进行学习,从而实现线性的预处理成本和恒定的查询成本。这种方法显著降低了计算和峰值GPU内存使用量,在128K token时减少了80%,且参数开销极小。该系统在needle-in-a-haystack和word extraction等基准测试中表现强劲,其性能优于上下文长度通常会导致性能下降的标准方法。 AI
影响 这种模块化内存系统可以显著降低处理大型语言模型长上下文的计算成本。
排序理由 该集群包含一篇详细介绍改进AI模型推理新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →