研究人员推出了一种名为测试时上下文蒸馏(TTCD)的新型长上下文语言建模框架,该框架可在推理过程中优化参数更新。与以往的方法不同,TTCD引入了一个自监督目标,以策略性地分配有限的内存容量来存储未来可能相关的信息。实验表明,TTCD,特别是其就地变体(IP-TTCD),在长上下文语言建模任务中优于DeltaNet和滑动窗口注意力等现有方法。该方法使预训练的Transformer模型能够在推理过程中持续适应其参数,从而以最小的架构更改获得增强的长上下文能力。 AI
影响 这项研究通过在推理过程中实现适应性,有望带来更高效、更强大的长上下文语言模型。
排序理由 该集群包含一篇详细介绍语言建模新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- DeltaNet
- Gated DeltaNet
- Hugging Face
- IP-TTCD
- multilayer perceptron
- Test-Time Context Distillation
- Transformer Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →