一位来自 r/MachineLearning 的用户正在寻求解决线性注意力模型中的长距离记忆问题,特别是在处理可达数百万 token 的 DNA 序列建模时。标准的 softmax 注意力对于如此长的序列在计算上是不可行的。用户发现他们的线性注意力模型,甚至 HyenaDNA,在“针尖麦芒”基准测试中的表现不佳,召回率约为 25%,这表明存在根本性限制而非实现错误。较小的上下文窗口显示出更好的召回率,但性能随着序列变长而显著下降。 AI
影响 突出了在扩展 Transformer 架构以处理极长序列方面的一个关键挑战。
排序理由 用户正在就特定 AI 技术的局限性提出技术性问题。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →