Recurrent Neural Networks
PulseAugur coverage of Recurrent Neural Networks — every cluster mentioning Recurrent Neural Networks across labs, papers, and developer communities, ranked by signal.
- competes with State Space Models 70%
- instance of Long Short-Term Memory Networks to Predict One-Step Ahead Reference Evapotranspiration in a Subtropical Climatic Zone 70%
- used by Long Short-Term Memory Networks to Predict One-Step Ahead Reference Evapotranspiration in a Subtropical Climatic Zone 60%
- other State Space Models 50%
14 天有情绪数据
-
新研究解决了循环神经网络的记忆和效率问题
两篇新研究论文探讨了用于处理序列数据的循环神经网络的进展。第一篇论文“DeltaTTT”介绍了一种用于非线性循环记忆网络的层优化技术,旨在通过解决优化难题来提高其在语言建模和检索任务中的性能。第二篇论文“MemKD”提出了一种专门为紧凑型循环神经网络设计的知识蒸馏框架,使小型模型能够在资源受限的环境中为时间序列分析保留大型模型的性能。
-
RNN、Transformer 和 SSM:AI 内存的真正归宿
本次讨论探讨了循环神经网络(RNN)、Transformer 和状态空间模型(SSM)在内存管理方面的根本区别。RNN 使用紧凑的循环隐藏状态,这可能成为瓶颈。相比之下,Transformer 将过去的表示形式存储为键值对,创建了一个大型但动态的上下文缓存,与固定权重分开。SSM(如 Mamba)提供了一个折衷方案,具有依赖输入的状体压缩,这引发了关于内存压缩是固有局限性,还是架构可以更好地将内存与内部网络结构集成(如 BDH (Dr…
-
进化的循环神经网络在股票预测中优于Transformer
研究人员开发了进化的循环神经网络,其在股票回报预测和交易策略盈利能力方面优于Transformer架构。这些进化的网络不仅更准确,而且计算效率也更高,仅需CPU和Raspberry Pi Zero等极少资源即可进行训练和预测。这与需要大量GPU资源的大型Transformer模型形成了鲜明对比。
-
面向深度学习的时序数据新一致性预测方法
本文介绍了三种新颖的时序数据一致性预测方法,解决了时序数据固有的可交换性假设被违反的挑战。所提出的方法利用了深度序列模型,包括循环神经网络(RNN)和Transformer,以实现渐近条件覆盖保证。在真实数据集上的实验结果证明了这些深度学习增强的一致性预测技术的有效性。
-
LSTM 详解:神经网络如何记住长期信息
本文详细介绍了长短期记忆(LSTM)网络,这是一种循环神经网络(RNN),旨在克服基本RNN在记忆长序列信息方面的局限性。文章分解了LSTM的核心组件,包括细胞状态和三个关键门(遗忘门、输入门和输出门),它们负责调节信息流。该博文旨在揭开梯度消失问题的神秘面纱,并提供分步指南,包含方程、数值示例和用于训练LSTM的Keras代码。
-
RNNs详解:神经网络如何理解序列数据
循环神经网络(RNN)旨在处理序列数据,而传统的神经网络则独立处理每个输入。RNN维护一个“隐藏状态”,充当记忆,总结先前步骤的信息以告知当前步骤。这使得它们能够理解数据中的上下文,其中顺序至关重要,例如文本、时间序列和语音。
-
新框架分析 Transformer 和 RNN 在高级 MRI 神经束成像中的应用
研究人员开发了一个新框架,用于系统分析 Transformer 和循环神经网络 (RNN) 模型在弥散性 MRI (dMRI) 神经束成像中的有效性。该研究引入了一个生成-验证阶段,允许在训练期间进行流线级监督,解决了局部损失函数与全局流线质量对齐的挑战。利用 ISMRM2015 神经束成像挑战数据集,所提出的模型取得了最先进的性能,并证明了其在 TractoInferno 数据库的体内数据上的适用性。研究结果为神经束成像的序列式深度…
-
新方法将混沌系统RNN训练速度提高了100倍以上
研究人员开发了一种新颖的方法,用于在混沌动力系统的长时序数据上训练循环神经网络(RNN)。他们的方法在NeurIPS 2026的重点论文中进行了详细介绍,该方法结合了DEER(一种用于RNN前向传播并行化的技术)和广义教师强制(GTF)。这种组合显著稳定了训练并减少了暴露偏差,与传统方法相比,速度提高了100倍以上。新技术允许在超过100万个时间步的时序数据上进行高效的并行时间训练,在动力系统重构任务中表现优于Mamba等模型。
-
新的注意力机制提升长上下文序列建模能力
两篇新论文介绍了增强循环神经网络长上下文序列建模能力的新方法。第一篇论文“SMat-Attention”提出了结构化矩阵注意力(Structured Matrix Attention),该方法使用结构化因果掩码来实现具有可调复杂度的灵活标记交互,实现了亚二次填充和恒定时间解码。第二篇论文“Triadic Linear Attention”通过使用三元外积创建3D张量状态来泛化线性注意力,显著提高了长上下文语言建模和回忆准确性。
-
Triadic Linear Attention 增强 RNN 长上下文建模
研究人员推出了一种新颖的方法——Triadic Linear Attention,它通过利用三阶张量状态来增强循环神经网络(RNN)的记忆状态。该方法通过将键和值的三角外积写入,并通过两个查询从中读取,从而在参数量极少增加的情况下实现了状态大小的 E 倍增长。Triadic Linear Attention 与各种训练技术兼容,并在应用于 Gated DeltaNet 和标量门控线性注意力等模型时,在长上下文语言建模和回忆方面显示出显著改进。
-
研究发现AI模型开发与生物进化相似
一篇新研究论文提出了一个种群遗传学框架来理解人工智能模型的演化。该研究将AI开发实践(如在同伴输出上重新训练模型或平均权重)与有性生殖和无性生殖等生物学概念进行了类比。研究使用包括循环神经网络、前馈网络和大型语言模型在内的各种AI架构测试了这些类比,发现该框架普遍适用,但存在一些特定架构的偏差。
-
机器学习通过先进的人工智能技术革新鱼类养殖业
一篇新发表在arXiv上的章节详细介绍了机器学习(ML)技术在革新鱼类养殖业中的应用。文章探讨了包括随机森林、卷积神经网络、循环神经网络、图神经网络以及大型语言模型在内的各种ML模型如何改进水产养殖运营。该章节重点介绍了生物量估算、物种识别、行为分析和环境预测等关键应用,并强调了ML与物联网的集成,以实现实时监控和决策支持,从而促进更可持续和更具生产力的实践。
-
神经控制微分方程推动文本到语音合成发展
研究人员提出了一种使用神经控制微分方程(CDE)进行文本到语音(TTS)合成的新颖方法。该方法将音素表示建模为连续时间控制路径,使隐藏状态能够根据音素内容和持续时间推导出的时间演变。实验表明,基于CDE的模型可以通过调整时间分辨率来提高情感强度对齐,并提供对风格跟踪与绝对校准的细致控制。
-
新的多任务学习模型可预测葡萄耐寒性
研究人员开发了使用循环神经网络(RNN)的多任务学习(MTL)方法,以从时间序列天气数据预测葡萄耐寒性。该方法解决了不同植物栽培品种的地面真实数据稀疏和有限的挑战。研究表明,某些MTL架构的性能优于单任务学习和现有科学模型,并且在相关的物候期预测任务方面也显示出潜力。
-
为带部分观测的LTI系统开发了新的PAC-贝叶斯界
研究人员为包含输入和亚高斯噪声的带部分观测的随机线性时不变状态空间系统开发了新的PAC-贝叶斯误差界。这些界将预期预测误差与模型在其训练数据上产生的误差联系起来,还可以用于推导参数估计误差的界。鉴于线性时不变系统是RNN的子集,这项工作可以作为建立循环神经网络PAC-贝叶斯界的基础步骤。
-
AF-Mamba模型使用TCN和Mamba进行心房颤动早期预测
研究人员开发了AF-Mamba,一种新颖的深度学习架构,用于心房颤动(AF)发作的早期预测。该模型集成了时间卷积网络(TCN)和Mamba(一种选择性状态空间模型),以高效处理长序列的RR间期。AF-Mamba在提前一小时预测AF方面表现出强大的预测性能,实现了高灵敏度和特异性,优于现有模型,同时提供了有利的性能-效率权衡。
-
多头注意力机制:现代大语言模型的核心
多头注意力机制是Transformer架构中的一项关键创新,它使现代大语言模型(LLMs)能够并行处理序列并理解长距离依赖关系。与之前的RNN和CNN等方法不同,它允许模型通过多个注意力头同时关注输入的不同部分,每个注意力头都能学习到数据中不同的视角。这种基于缩放点积注意力(Scaled Dot-Product Attention)的机制显著提高了在GPU上的训练效率,并增强了模型理解复杂语言细微差别以完成机器翻译等任务的能力。
-
AI 的下一个前沿:Mamba、JEPA 和 Diffusion 模型有望取代 Transformer
自 2017 年以来占据主导地位的 Transformer 架构正经历着 AI 领域的周期性转变,可能被状态空间模型(Mamba)和联合嵌入预测架构(JEPA)等新架构取代。这种转变是由 Transformer 的局限性驱动的,例如长上下文的二次方扩展问题、训练数据收益递减、高昂的能源成本以及超越模式匹配实现真正理解的基本能力不足。Gemini Diffusion、Nvidia 的 Nemotron 3 和 Qwen 3.5 等新兴模…
-
MLOps 研究使用计算机视觉进行老年人跌倒检测
本文详细介绍了一个专注于开发使用计算机视觉和 MLOps 原理的跌倒检测系统的研究项目。该系统采用深度学习模型,特别是卷积神经网络和循环神经网络,来实时分析视频源。目标是通过可靠的跌倒检测来加强老年人护理和公共安全。
-
计算池记忆回忆中发现新的“章鱼状”盆地几何结构
研究人员在用于联想记忆的计算池系统中发现了吸引盆内一种新颖的“章鱼状”结构。该结构在吸引子附近有一个稳健的“头部”,并有跨越状态空间的细长、交织的“触手”。尽管触手内的状态不可预测,但一种称为广义同步的机制允许时间线索可靠地将系统引导至吸引子的头部,从而实现有效的记忆回忆。