研究人员开发了一种新的核注意力机制,该机制表明在某些非负核注意力模型中,特征秩要求呈指数级增长。具体来说,在布尔输入上的Min-IP上,秩为一的归一化核注意力可以精确地处理长度最多为两个的序列。然而,任何试图以小于1/2的误差解决三个Token序列的归一化非负核注意力头,即使具有任意的Token值和查询相关的读出,也需要指数级的特征数量。这与密集softmax形成对比,后者以显著更少的维度完成了相同的任务。 AI
影响 这一理论发现突出了某些核注意力架构的潜在局限性,表明需要更有效的特征表示来处理更长的上下文。
排序理由 该集群包含一篇详细介绍核注意力机制新理论发现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- Boolean
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- IArxiv
- Min-IP
- Nonnegative Kernel Attention
- ScienceCast
- Softmax
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →