研究人员推出了一种名为分块因果记忆 Transformer (BCMT) 的新颖架构,旨在增强长上下文语言建模。BCMT通过在局部块内应用密集自注意力,并使用通过指数因果记忆聚合的自适应摘要来传播全局上下文,从而解决了传统Transformer模型的二次复杂度问题。这种方法可以在没有远距离标记之间密集交互或学习到的记忆状态的情况下,实现高效的长距离依赖建模,从而在验证性能上与密集Transformer相当,但提高了训练吞吐量并减少了内存消耗。 AI
影响 这种新架构可能导致需要长上下文的任务的大型语言模型训练和部署更加高效。
排序理由 该集群描述了一篇关于新颖AI模型架构的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →