Language Modeling
PulseAugur coverage of Language Modeling — every cluster mentioning Language Modeling across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新原理解释AI模型在数据影响下仍能收敛
一篇新论文引入了“稳定信号原理”,以解释机器学习模型在重新训练过程中如何收敛,即使它们对数据的影响很大。该原理认为,模型的收敛是由预测目标的少量、与模型无关的成分引导的,例如物品的内在质量。研究表明,通过适当的正则化,重复的风险最小化可以几何收敛到这个稳定信号,从而为语言模型在生成数据上的表现力和训练动力学提供了新的见解。
-
Flexformer 引入可学习注意力核以实现高效Transformer
研究人员推出了一种新颖的线性Transformer架构Flexformer,旨在克服传统Transformer的二次复杂度限制。Flexformer通过以数据驱动的方式学习注意力核来实现这一点,利用具有可训练频谱频率的随机傅里叶特征。这种方法具有更强的表达能力,并在语言建模和序列分类任务上展现出优于现有方法的性能。此外,Flexformer可以从预训练Transformer中蒸馏,并有望实现高效的长序列处理。
-
研究人员使用形式文法分析Transformer的表达能力
一篇新研究论文通过检查深度Transformer模型表示分层结构的能力来分析其表达能力。该研究使用有界深度、非递归上下文无关文法来构建具有位置注意力的Transformer。研究结果表明,这些架构可以将抽象的语法状态编码到残差流中的线性可分子空间,支持了深度神经网络的力量来源于分层表示的假设。
-
Transformer 研究发现 QKV 投影共享可大幅减少内存使用
研究人员调查了 Transformer 模型中三个独立投影(查询、键和值)的必要性。他们的研究发现,共享投影,特别是 Q-K=V 变体,可以在对性能影响极小的情况下显著减少 KV 缓存内存使用。这种方法,特别是与分组查询注意力结合使用时,可提供可观的内存节省,可能支持更高效的设备端推理。
-
Switch Attention 在全注意力与滑动窗口注意力之间动态路由
研究人员引入了 Switch Attention (SwiAttn),这是一种新颖的混合Transformer架构,旨在解决长上下文语言建模中标准全注意力机制的计算瓶颈问题。SwiAttn 动态地将每个 token 的计算路由到用于全局上下文的全注意力分支或用于局部模式的滑动窗口分支,从而实现更有效的资源分配。该方法通过持续预训练进行了优化,并在常规和长上下文长度的众多基准测试中进行了测试,证明了其有效性。