一项新的研究论文表明,标准的 softmax 注意力 Transformer 可以在其前向传播过程中近似高斯核岭回归 (KRR) 预测器。该研究构建了一个单头 Transformer,能够实现预条件 Richardson 迭代,这是一种求解核系统的方法。这项工作揭示了 Transformer 内部的功能分解,其中注意力层处理跨 token 交互,MLP 层管理 intra-token 算术。在 GPT-2 风格的 Transformer 上的实证测试表明,随着网络深度的增加,其与精确高斯 KRR 估计器逐渐对齐。 AI
影响 展示了 Transformer 架构与核方法之间的理论联系,可能为未来的模型设计提供信息。
排序理由 学术论文,详细介绍了关于 Transformer 架构能力的理论和实证发现。 [lever_c_demoted from research: ic=1 ai=1.0]
- Gaussian Kernel Regression
- GPT-2
- kriging
- Mingsong Yan
- multilayer perceptron
- Preconditioned Richardson Iteration
- softmax-attention transformer
- transformers
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →