lambada
PulseAugur coverage of lambada — every cluster mentioning lambada across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
研究发现:Transformer 模型使用“离轴”计算来处理概念
一项新的研究论文探讨了 Transformer 模型内部的工作机制,揭示了其中间状态并非随机噪声,而是计算概念的功能性组成部分。研究发现,一个 12 层模型分两个不同阶段处理信息:首先,写入一个“离轴”子空间,然后在过程后期将答案“带回轴上”。这种离轴计算对于将概念组合与词汇隔离开至关重要,对其进行操作会严重损害模型的处理信息能力,即使困惑度和其他基准测试不受影响。
-
新的线性化注意力模型实现了更高的准确率和更低的困惑度
研究人员开发了一种 2-单纯复形注意力的线性化版本,将三线性分数重写为内积。这种新形式允许在序列长度上实现线性成本,同时保持全局覆盖范围,这与传统的窗口注意力机制不同。通过使用正随机特征近似求和并将过去的信息存储在固定大小的状态中,该方法可以使用自定义 Triton 内核实现,并与 Kimi Delta Attention 集成。最终的模型完全省略了 softmax 注意力,在 LAMBADA 等基准测试中展示了优越的下游准确率和更高的困惑度。
-
新的SCSE方法改进了用于文本任务的循环Transformer
研究人员引入了以源为中心的态演化(SCSE),这是一种旨在增强循环Transformer的新颖方法。SCSE通过确保精确的锚点不变性,解决了在不同循环深度下保持一致的隐藏状态的挑战。这种方法允许输入条件化,同时保留参考点,从而在文本补全和迁移学习等任务上提高了性能。
-
HOLA 为线性注意力模型增强了互补记忆系统
研究人员开发了一种名为 HOLA(海马体线性注意力)的新方法,以增强线性注意力和状态空间语言模型的记忆能力。该方法引入了一个互补的“海马体”组件,用于存储精确的键值关联,解决了传统循环状态可能覆盖早期事实的损失性质。HOLA 在有界精确缓存旁边维护一个压缩记忆,从而能够高效存储线性可压缩结构,同时保留关键关联。这种半参数记忆系统在 Wikitext 和 LAMBADA 基准测试中的困惑度方面取得了显著改进,并在“针尖麦芒”召回测试中表…
-
新的HOLA架构通过双记忆系统增强线性注意力语言模型
研究人员开发了HOLA(海马体线性注意力)架构,这是一种通过引入互补记忆系统来增强线性注意力语言模型的新型架构。该系统解决了标准线性注意力模型中信息丢失的问题,在这些模型中,由于固定大小的循环状态,早期事实可能会被覆盖。HOLA在保持压缩状态的同时,增加了精确的KV缓存来存储关键关联,从而提高了召回率并降低了困惑度。
-
新的NC-FFN架构增强了Transformer的可解释性和效率
研究人员开发了一种新颖的、参数中性的Transformer前馈网络替代方案,称为NC-FFN,它利用显式的模糊集运算。这种新架构在N位奇偶校验任务上表现出强大的参数效率,并在OpenWebText等更大模型的困惑度上与GELU基线相匹配。NC-FFN还提高了语法许可和量词理解能力,使得前馈层的计算更加清晰和可解释。