研究人员证明,在适当的软提示引导下,具有随机、未训练权重的单层 softmax 注意力网络可以近似紧致流形上的任何 Hölder 函数。这一发现表明,对于某些近似任务,预训练可能是可选的。该研究将 softmax 注意力与核方法联系起来,构建了显式的软提示,使冻结的 Transformer 能够模拟经典的 Nadaraya-Watson 核估计器。核回归的理论保证得以继承,从而实现了依赖于内在维度的速率的通用逼近定理,并揭示了提示范数、长度和隐藏维度之间的权衡。 AI
影响 表明预训练对于 Transformer 中的某些近似任务可能不是必需的,从而可能简化模型开发。
排序理由 该集群包含一篇详细介绍 Transformer 模型理论发现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Gaussian initialization
- Hölder function
- Hugging Face
- kernel method
- kernel regression
- Nadaraya-Watson kernel estimator
- softmax attention
- soft prompt
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →