PulseAugur
实时 09:16:26
English(EN) Learning What to Remember: Test-Time Training via Context Distillation

新的TTCD框架在推理过程中增强长上下文语言模型

研究人员推出了一种名为测试时上下文蒸馏(TTCD)的新型长上下文语言建模框架,该框架可在推理过程中优化参数更新。与以往的方法不同,TTCD引入了一个自监督目标,以策略性地分配有限的内存容量来存储未来可能相关的信息。实验表明,TTCD,特别是其就地变体(IP-TTCD),在长上下文语言建模任务中优于DeltaNet和滑动窗口注意力等现有方法。该方法使预训练的Transformer模型能够在推理过程中持续适应其参数,从而以最小的架构更改获得增强的长上下文能力。 AI

影响 这项研究通过在推理过程中实现适应性,有望带来更高效、更强大的长上下文语言模型。

排序理由 该集群包含一篇详细介绍语言建模新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的TTCD框架在推理过程中增强长上下文语言模型

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Zixuan Wang, Xingyu Dang, Rui-Jie Zhu, Zixin Wen, Hengyu Fu, Wenhao Chai, Jason D. Lee ·

    Learning What to Remember: Test-Time Training via Context Distillation

    arXiv:2608.01672v1 Announce Type: new Abstract: Effective long-context modeling is not merely about retaining more of the past, but about preserving the information that may prove relevant later. Test-time training (TTT) is an appealing approach that performs online parameter upd…