PulseAugur
实时 09:58:55
English(EN) How can we solve long-range recall in linear attention? [D]

研究人员寻求解决线性注意力模型中的长距离记忆问题

一位来自 r/MachineLearning 的用户正在寻求解决线性注意力模型中的长距离记忆问题,特别是在处理可达数百万 token 的 DNA 序列建模时。标准的 softmax 注意力对于如此长的序列在计算上是不可行的。用户发现他们的线性注意力模型,甚至 HyenaDNA,在“针尖麦芒”基准测试中的表现不佳,召回率约为 25%,这表明存在根本性限制而非实现错误。较小的上下文窗口显示出更好的召回率,但性能随着序列变长而显著下降。 AI

影响 突出了在扩展 Transformer 架构以处理极长序列方面的一个关键挑战。

排序理由 用户正在就特定 AI 技术的局限性提出技术性问题。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/MachineLearning 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究人员寻求解决线性注意力模型中的长距离记忆问题

报道来源 [1]

  1. r/MachineLearning TIER_1 English(EN) · /u/No-Coffee-8227 ·

    线性注意力中的长程记忆如何解决?[D]

    <!-- SC_OFF --><div class="md"><p>Recently, I started working on DNA sequence modeling and decided to explore <strong>linear attention</strong>, mainly because DNA sequences can easily reach <strong>1M tokens</strong>, making standard softmax attention extremely expensive in term…