WikiText-103
PulseAugur coverage of WikiText-103 — every cluster mentioning WikiText-103 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的CurveFP数据类型有望降低语言模型的成本并提高性能
研究人员推出了一种新颖的低精度数据类型系列CurveFP,旨在降低语言模型的成本。CurveFP通过一个闭合乘积码本来优化标量保真度和乘积引起的算术,该码本将量化幅度分布在对数曲线上。这种方法将乘积形成简化为精确的符号XOR和整数索引更新,从而在训练和部署中实现更好的数值行为和效率。
-
新研究解耦专家混合模型的路由与聚合以提升性能
研究人员正在探索优化稀疏专家混合(MoE)模型的新方法,超越传统手段。一项研究引入了MOSAIC框架,该框架整合了架构和系统协同设计,通过考虑硬件约束和算法选择来提高模型效率和性能。另一篇论文研究了解耦MoE路由器中专家调度(选择)和聚合(加权)的角色,提出了一种可以独立优化的后计算头,以增强语言建模目标。
-
无注意力机制的架构在语言生成和扩展方面展现出潜力
一篇新的研究论文《Kathleen Writes: 无注意力机制的自回归生成与数据扩展》探讨了一种用于语言建模的无注意力机制架构。该研究表明,这种架构在分类任务上可以媲美强大的基线模型,并在生成方面展现出潜力。论文引入了一个名为 FORM DISTANCE 的新指标来评估文本质量,并提出解码策略对生成性能有显著影响,甚至比架构改变的影响更大。
-
TextNCA:探索用于语言建模的神经元胞自动机
研究人员开发了TextNCA,一种基于神经元胞自动机的语言模型,该模型利用分层局部注意力机制。虽然在WikiText-103基准测试中其性能并未超过同等规模的Transformer模型,但TextNCA可作为分析工具,用于理解驱动其行为的组成部分。研究发现,分阶段的窗口大小递增、GRU门的使用以及学习到的嵌入对于性能至关重要,而迭代次数带来的收益是有限的。
-
新的SCSE方法改进了用于文本任务的循环Transformer
研究人员引入了以源为中心的态演化(SCSE),这是一种旨在增强循环Transformer的新颖方法。SCSE通过确保精确的锚点不变性,解决了在不同循环深度下保持一致的隐藏状态的挑战。这种方法允许输入条件化,同时保留参考点,从而在文本补全和迁移学习等任务上提高了性能。
-
新研究探索文本和图像的高效几步生成
两篇新研究论文介绍了生成模型的新方法,重点在于提高文本和图像几步生成的效率和质量。第一篇论文《Latent-Kernel Discrete Flow Maps for Few-Step Generation》提出了一种名为 LKF 的方法,该方法原生表达了相关步骤,显著提高了文本基准上的生成困惑度。第二篇论文《Flow Map Learning via Nongradient Vector Flow》介绍了 SGFlow,一种通过模型…
-
新研究解决了掩码扩散语言模型的评估和架构问题
两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。
-
Naju模型引入了解耦的遗忘和写入功能,以实现长序列记忆
研究人员推出了一种名为Naju的新型原生离散状态空间模型,旨在增强长序列记忆能力。与以往在平衡信息遗忘和覆盖方面存在困难的模型不同,Naju将这两个功能解耦。这使得数据在长时间内能够近乎无损地保留,同时也能主动覆盖过时信息。Naju在记忆追踪、语言建模和联想回忆任务中表现出色,优于现有的Mamba模型,并在保持高效扩展性的同时,与Transformer架构相比也保持了竞争力。
-
SHUFFLESPARSE学习的置换可提高结构化稀疏网络的准确性
研究人员开发了SHUFFLESPARSE,一种新颖的置换原语,旨在增强神经网络中的结构化权重稀疏性。该方法旨在缩小结构化和非结构化稀疏训练之间的准确性差距,尤其是在高稀疏度水平下。通过与权重矩阵一起学习置换矩阵,SHUFFLESPARSE在ViT-B16和GPT-2等模型的准确性方面显示出显著的改进,并显著将LLaMA-2 7B的零样本准确性提高了4.6个百分点。
-
新框架通过动态聚类和压缩解决 MoE LLM 的三难困境
研究人员开发了一个新框架,以解决混合专家(MoE)大型语言模型(LLM)面临的三难困境,该困境涉及负载不平衡、参数冗余和通信开销。他们的方法使用动态专家聚类和结构化压缩,根据参数和激活相似性定期重新组合专家以稳定利用率。这种方法将每个组的参数减少多达五倍,同时保持专业化,从而带来显著的效率提升。在 GLUE 和 WikiText-103 上的评估表明,该框架在保持标准 MoE 模型质量的同时,总参数减少了约 80%,吞吐量提高了 10…
-
新的Split-FG方法以35%的内存节省训练深度网络
研究人员开发了一种名为分裂前向梯度(Split-FG)的新颖方法,通过减少内存使用来更有效地训练深度神经网络。该技术将网络分为一个干式部分和一个输出头,精确计算头的梯度,同时使用雅可比向量积估计干式部分的梯度。这种方法减轻了前向梯度中的噪声,并避免了通过干式部分的后向传播,与传统的后向传播相比,内存节省高达35%。实验表明,Split-FG与干式部分较小的学习率相结合,在WikiText-103和CIFAR-10/100等基准测试中取…
-
揭示用于函数保持持续学习的新几何框架
研究人员推出了一种新颖的函数保持算子,用于持续学习,称为门零增长(gate-zero growth)。该方法通过零初始化的门添加新的残差块,在特定条件下,这会导致函数雅可比矩阵的秩分离。这个几何框架允许受控的函数漂移和先前学习信息的最小遗忘,如在跨 WikiText-103 和 BookCorpus 数据集上调整的 Transformer 模型上所证明的。分析还包括 LoRA 和 ReZero 等其他技术,将门零增长定位为在持续学习中…
-
新的tPC-RTRL方法学习循环系统中的长距离依赖
研究人员开发了一种名为时间预测编码结合实时循环学习(tPC-RTRL)的新方法,以增强循环神经网络的学习能力。该方法通过引入一个考虑长距离时间依赖的在线影响矩阵,克服了标准时间预测编码的局限性,而长距离时间依赖对于需要长时间信用分配的任务至关重要。研究表明,tPC-RTRL方法能够精确复制反向传播随时间反向传播的梯度,并在包括语言建模和翻译在内的各种基准测试中展现出近乎等效的性能,同时还为实时应用中的学习和过滤提供了一个统一的框架。
-
高斯混合注意力提供线性时间序列混合
研究人员引入了高斯混合注意力(GMA),这是一种新颖的序列混合技术,旨在克服标准Transformer注意力的二次扩展瓶颈。GMA用通过学习到的高斯混合分量的概率路由机制取代了显式的token到token比较,将内存复杂度从O(N^2)降低到O(NK),其中K是固定的。虽然GMA在长上下文分类任务上表现出竞争力,并在因果设置中显示出潜力,但它在特定基准测试中目前落后于优化的softmax注意力和Mamba等状态空间模型。
-
新的IGLU激活函数提供了改进的梯度流
研究人员推出IGLU,一种新颖的深度神经网络参数化激活函数,旨在改善梯度流和优化稳定性。IGLU源自半正态分布下GELU门的混合体,通过单个参数在类似恒等和类似ReLU的行为之间提供连续插值。其重尾柯西门确保所有有限输入的梯度非零,增强了对梯度消失的鲁棒性。一种高效的近似方法IGLU-Approx仅使用ReLU运算,在保持视觉和语言数据集上具有竞争力的性能的同时,降低了计算成本。
-
新型混合架构提升长上下文语言模型效率
研究人员引入了一种并行混合架构(PHA),它结合了门控状态空间(GSS)、分组查询注意力(GQA)和前馈网络(FFNs),以改进长上下文语言建模。该架构并行运行这些组件,允许每个组件专注于序列建模的不同方面,这与之前迫使SSM近似注意力或串行化这两种范例的方法不同。PHA在困惑度方面与标准Transformer具有竞争力,同时在吞吐量和内存使用方面提供了显著更高的效率,尤其是在长上下文方面。
-
新的RAG和长上下文模型利用知识图谱
两篇新的研究论文介绍了改进检索增强生成(RAG)和长上下文语言模型的先进方法。第一篇论文《用于上下文感知和关系感知的图检索增强生成的统一框架》(HyGRAG)提出了一个分层图RAG框架,该框架整合了上下文和关系信息,以在不同抽象级别上实现更有效的知识融合和检索。第二篇论文《用于长上下文建模的知识图增强记忆增强检索》(KGERMAR)提出了一个在推理过程中构建动态、上下文特定的知识图谱的框架,以增强对长上下文模型中实体状态和关系的理解,…
-
LongSpike:新的SNN框架增强长序列学习能力
研究人员推出了一种新的脉冲神经网络(SNN)框架LongSpike,该框架利用分数阶状态空间模型(f-SSM)来增强长序列的学习能力。这种方法克服了传统一阶SNN在捕捉长距离依赖关系方面的局限性。LongSpike能够更有效地将神经元动力学与长记忆核相结合,并支持高效的并行训练。在Long Range Arena和WikiText-103等基准测试上的评估表明,LongSpike在保持计算效率的同时,实现了比现有SNN更高的准确性。
-
Chiaroscuro Attention 通过动态令牌路由优化 Transformer 计算
研究人员开发了 CHIAR-Former,这是一种新颖的 4 层 Transformer 模型,通过动态路由令牌来优化计算使用。CHIAR-Former 不会统一应用自注意力,而是分析令牌的频谱熵,将每个令牌导向三个算子之一:DCT 频谱混合、RBF 核混合或全自注意力。这种方法在大型自然语言文本上显著提高了性能,在 WikiText-103 上实现了 45% 的困惑度改进,同时注意力 FLOPs 比标准 Transformer 减少…
-
Kan Extension Transformers 统一了注意力、扩散和自条件化
研究人员推出了一种名为 Kan Extension Transformers (KETs) 的新框架,该框架通过范畴论的视角统一了各种 Transformer 实现。KETs 将 Transformer 层视为加权的结构化扩展算子,涵盖了标准注意力、Geometric Transformers 和高阶单纯形情况。该框架还连接到扩散式补全,并通过作用于分离的预测载体来引入自条件机制,从而在不泄露未来 token 的情况下揭示非因果结构。…