实体
linear recurrent networks
linear recurrent networks
PulseAugur coverage of linear recurrent networks — every cluster mentioning linear recurrent networks across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的AI方法应对持续学习和函数梯度下降
研究人员提出了持续学习AI模型的新方法,解决了在不损害现有能力的情况下整合新知识的挑战。一种方法KeepLoRA++利用层缩放残差梯度自适应来平衡视觉-语言模型中的知识保留和可塑性。另一种方法ReGrad将梯度视为可检索单元,从而无需累积权重漂移即可进行参数化知识注入。此外,一种新的函数梯度下降算法可以自适应函数梯度表示,提供改进的收敛保证和性能。
-
新论文证明AI模型面临“不可能性三角”权衡
研究人员发现长上下文模型中存在根本性的权衡,证明没有单一架构能够同时实现效率、紧凑性和召回率。该研究使用在线序列处理器(Online Sequence Processor)抽象形式化了这一“不可能性三角”,该抽象统一了各种现有模型,如Transformers和状态空间模型。数学不等式表明,优先考虑效率和紧凑性的模型在回忆历史信息的能力方面受到限制,这一发现已通过在合成召回任务上的实验得到验证。