PulseAugur
中
实时 00:46:32

研究表明 Transformer 可实现高斯核回归

一项新的研究论文表明,标准的 softmax 注意力 Transformer 可以在其前向传播过程中近似高斯核岭回归 (KRR) 预测器。该研究构建了一个单头 Transformer,能够实现预条件 Richardson 迭代,这是一种求解核系统的方法。这项工作揭示了 Transformer 内部的功能分解,其中注意力层处理跨 token 交互,MLP 层管理 intra-token 算术。在 GPT-2 风格的 Transformer 上的实证测试表明,随着网络深度的增加,其与精确高斯 KRR 估计器逐渐对齐。 AI

影响 展示了 Transformer 架构与核方法之间的理论联系,可能为未来的模型设计提供信息。

排序理由 学术论文,详细介绍了关于 Transformer 架构能力的理论和实证发现。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究表明 Transformer 可实现高斯核回归

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Mingsong Yan, Dongyang Li, Charles Kulick, Sui Tang ·

    Transformer 可实现预处理 Richardson 迭代用于上下文高斯核回归

    arXiv:2605.08475v3 Announce Type: replace-cross Abstract: In this paper, we study in-context kernel ridge regression (KRR) with Gaussian kernels and show, both theoretically and empirically, that a standard softmax-attention transformer can approximate the KRR predictor during it…