Recurrent Neural Networks
PulseAugur coverage of Recurrent Neural Networks — every cluster mentioning Recurrent Neural Networks across labs, papers, and developer communities, ranked by signal.
- competes with State Space Models 70%
- instance of Long Short-Term Memory Networks to Predict One-Step Ahead Reference Evapotranspiration in a Subtropical Climatic Zone 70%
- used by Long Short-Term Memory Networks to Predict One-Step Ahead Reference Evapotranspiration in a Subtropical Climatic Zone 60%
- other State Space Models 50%
13 天有情绪数据
-
Transformer注意力机制中位置编码技术的映射
本文探讨了Transformer架构中的位置编码技术,重点关注位置信息如何以及在何处被整合到注意力机制中。文章超越了按时间顺序的呈现方式,而是根据方法在注意力公式中的注入点进行分类。作者提出了一个2x2的网格(绝对与相对,固定与学习)来映射这些技术,并将其与原始Transformer在注意力层之前将位置向量添加到token嵌入中的方法进行了对比。
-
Transformer架构凭借自注意力机制革新大型语言模型
Transformer架构,特别是其自注意力机制,通过实现并行处理和卓越的远距离依赖建模,彻底改变了大型语言模型。这与旧的循环神经网络(RNN)形成对比,后者顺序处理数据,导致在较长序列中信息丢失。Transformer允许每个单词同时关注所有其他单词的能力提供了全局视角,这对于理解细微关系和大规模生成连贯文本至关重要。
-
新的神经架构搜索(NAS)方法优化神经网络的紧凑性和性能
研究人员开发了一个新的神经架构搜索(NAS)框架,该框架使用连续松弛来更有效地优化神经网络架构。这种方法,包括NAS-NG和NAS-MA等方法,允许在复杂、组合式搜索空间上进行可微分优化。在MNIST和CIFAR-10数据集上使用MLP和CNN模型进行的实验表明,这些方法可以识别出具有竞争力或改进的预测性能的紧凑型架构,其性能优于DARTS等现有方法,并减少了参数数量。
-
研究人员发布“Attention Is All You Need”论文,彻底改变大语言模型架构
2017年,来自Google Brain和Google Research的八位研究人员发表了题为“Attention Is All You Need”的论文,提出了一种革命性的自然语言处理方法。该论文解决了之前像循环神经网络(RNN)和长短期记忆(LSTM)网络等模型存在的关键内存限制问题,这些模型按顺序处理信息,并饱受梯度消失和训练缓慢等问题的困扰。新的架构基于注意力机制的概念,旨在通过一种更有效的方法取代传统的内存机制来克服这些挑…
-
LSTM网络克服了AI中的梯度消失问题
两位研究人员Sepp Hochreiter和Jürgen Schmidhuber于1997年开发了长短期记忆(LSTM)网络,以解决循环神经网络(RNN)中的梯度消失问题。该问题阻止了RNN在反向传播过程中因重复乘法而从序列中较远的信息中学习。LSTM引入了一条独立的信息通道,使用可训练的门来控制其流动,使网络能够长时间保留相关数据。尽管最初推广缓慢,但LSTM论文变得极具影响力,在注意力机制和Transformer出现之前,为自然语…
-
AI研究探索模型和数据的先进压缩技术
研究人员正在探索机器学习模型和数据的先进压缩技术。曼彻斯特大学的一项研究调查了基于机器学习的数据压缩的环境可持续性,将训练和推理的碳足迹与存储减少带来的节省进行了比较。另一篇论文介绍了循环神经网络的动态压缩,允许模型选择性地重新访问过去的信息以减小状态大小并提高效率。此外,一个名为BRIDGE 的新框架将模型压缩重新表述为边界搜索问题,使模型能够从性能崩溃中恢复并在不同架构中扩展压缩限制。最后,正在进行关于抗损耗学习图像压缩的研究,以…
-
状态空间模型:从S4到Mamba的综述
本文全面回顾了结构化状态空间模型(SSMs),追溯了它们从最初的S4架构到Mamba和Mamba-2等更先进模型的演进。文章分析了输入依赖选择性、循环和卷积视图之间的相互作用、对角化和缓存机制等关键设计维度。该回顾强调了SSMs在长上下文场景下的效率和有效性,使其成为Transformer的有力竞争替代品,同时也承认了Transformer在需要精确检索的任务中的优势。
-
新的RNN框架从多个有序数据投影中学习
研究人员引入了一个新的循环神经网络(RNN)框架,该框架超越了传统的时间序列学习。该框架基于有序结构依赖假设(OSDH),提出同一数据的多个有效排序可以揭示单一序列组织所遗漏的互补结构依赖。为了实现这一点,他们提出了独立结构专家原理(ISEP),其中特定投影的序列模型被单独训练,并通过融合模型整合它们的表示。一个具体的实现,结构演化RNN(SE-RNN),使用标准的RNN作为特定投影的专家,而不改变核心的循环计算。
-
新的深度残差回声状态网络增强了RNN的记忆容量
研究人员推出了一种新型未训练循环神经网络——深度残差回声状态网络(DeepResESNs),旨在提高记忆容量和长期时间建模能力。通过在未训练循环层层次结构中引入时间残差连接,DeepResESNs提高了时间序列任务的性能。该研究探讨了这些连接的各种正交配置,并提供了网络动力学稳定的数学条件,在不牺牲计算效率的情况下,展示了优于传统Reservoir Computing方法的预测精度。
-
新的神经注意力电路增强了表示学习
研究人员引入了神经注意力电路 (NAC),这是一种受生物系统启发的、新颖的连续时间注意力机制。NAC 使用具有非线性门的线性常微分方程重新构建注意力logit计算,这与秀丽隐杆线虫的神经布线有相似之处。该方法旨在通过实现更有效和自适应的动力学来改进循环神经网络中的表示学习,特别适用于连续时间建模。
-
乐高积木类比解析现代GPT架构及效率提升
本文使用乐高积木类比解释现代GPT架构的内部工作原理,详细说明了单个token如何从输入处理到输出。文章分解了RoPE、RMSNorm和SwiGLU等关键改进,解释了这些进步如何比GPT-2等旧模型提高效率。解释侧重于Transformer Blocks和注意力机制,这对于理解GPT模型如何通过预测下一个token来生成文本至关重要。
-
新研究探索脉冲神经网络的高级训练方法
近期 arXiv 上的两篇论文探讨了训练脉冲神经网络(SNNs)的高级技术。第一篇论文介绍了一个通用框架,通过引入额外的状态变量来整合延迟到 SNNs 中,增强其捕捉时间依赖性的能力,并在较小网络中显示出效率提升。第二篇论文提出了 Phase State Space Models,它将状态空间模型(State Space Models)适配于 SNNs 的并行和无替代训练,在一个与脉冲兼容的架构中整合了短时傅里叶变换(STFT)、循环…
-
新生物学上合理的循环神经网络修剪规则得到验证
研究人员评估了一种新的、具有生物学合理性的循环神经网络修剪规则,称为 noise-prune。这个无监督的局部规则利用噪声波动来确定连接的重要性。研究表明,noise-prune 在针对特定功能训练的网络中能有效保持任务性能,优于基于幅值的修剪,并能与非局部策略相媲美。研究结果验证了 noise-prune 在功能性循环架构中的有效性,并确定了最佳参数设置,强调了采样和重缩放连接的重要性。
-
新的生物学上可行的循环神经网络修剪规则得到验证
研究人员评估了一种新的、生物学上可行的循环神经网络修剪规则,称为“噪声修剪”。该方法使用噪声波动来确定连接的重要性,并已证明在保持训练网络中的任务性能方面是有效的。研究发现,噪声修剪的性能显著优于基于幅度的修剪,并可与使用二阶信息的策略相媲美,验证了其在功能性循环架构中的实用性。
-
可解释机器学习预测受 COVID-19 影响的交通拥堵
研究人员开发了可解释的机器学习模型来预测加利福尼亚州阿拉米达县的交通拥堵,并考虑了 COVID-19 大流行的独特影响。通过纳入与天气、季节性和 COVID-19 病例相关的变量,研究发现新的 COVID-19 病例在封锁和封锁后期间通常会减少拥堵。然而,在大流行后时期,住院率上升减少了出行,而汽油价格上涨则增加了拥堵,因为人们选择了私家车。
-
新型循环神经网络模型模仿大脑计算以实现工作记忆
研究人员介绍了一种新型人工神经网络模型——循环分裂归一化网络(RDNN),该模型受生物学分裂归一化的启发。该模型旨在克服传统循环神经网络(RNN)和连续吸引子网络在鲁棒地维护和更新连续变量方面的局限性,而这正是工作记忆的关键方面。RDNN的生物物理约束使其能够学习高保真慢流形,防止状态空间分裂成离散点。此外,网络在随时间反向传播(BPTT)过程中的梯度动力学导致其有效秩的自压缩,将动力学限制在低维子空间内,从而避免优化问题。
-
开发者用 PyTorch 从头开始构建 Transformer 模型
Sparsh Sharma 详细介绍了使用 PyTorch 从头开始构建 Transformer 模型的过程,强调了理解底层机制的重要性,而不仅仅是使用预训练模型。该教程涵盖了自注意力机制、多头注意力和位置编码等关键组件,并指出了常见的陷阱,例如 RNN 中的梯度消失以及注意力机制中进行缩放的必要性。Sharma 的动机源于在为 Manshverse 项目微调 Groq、Gemini 和 Mistral AI 等 API 时遇到问题后…
-
Hugging Face 综述介绍了用于交通预测的自动化 AI
这篇来自 Hugging Face 的综述论文探讨了神经架构搜索(NAS)作为一种自动化深度学习模型设计方法在交通预测中的应用。文章回顾了各种 NAS 策略,包括基于梯度、进化和单次权重共享的方法,并讨论了它们如何应用于捕捉交通数据的时空特性。论文还强调了当前的挑战,如计算可扩展性、跨城市泛化能力以及 NAS 在时空基础模型上的应用,并提出了未来的研究方向。
-
综述详述交通预测模型的神经架构搜索
一篇新发表在arXiv上的综述论文探讨了神经架构搜索(NAS)在交通预测中的应用。该论文详细介绍了NAS如何自动化深度学习模型(如图卷积网络、循环神经网络和Transformer)的设计,以更好地捕捉交通数据的时空结构。它将NAS方法分为基于梯度、进化和一次性权重共享方法,同时还强调了计算可扩展性和跨城市泛化等挑战。
-
新框架使用可控记忆函数评估序列模型性能
研究人员开发了一个新的合成基准测试框架,用于评估各种序列建模架构的性能,包括循环神经网络、卷积模型、Transformers 和结构化状态空间模型。该框架利用由 \(\\alpha\) 参数化的可控记忆函数,生成具有特定时间结构(如指数衰减、多项式衰减、用于长程依赖的脉冲函数以及用于稀疏性的 Airy 函数)的合成数据集。使用该框架进行的实验证实了现有的理论见解,并揭示了关于这些模型的近似能力、优化动态和架构权衡方面的新发现。