PulseAugur
实时 10:14:15
English(EN) Training-Free Universal Approximation by Prompting Random Transformers

软提示可使随机 Transformer 近似函数

研究人员证明,在适当的软提示引导下,具有随机、未训练权重的单层 softmax 注意力网络可以近似紧致流形上的任何 Hölder 函数。这一发现表明,对于某些近似任务,预训练可能是可选的。该研究将 softmax 注意力与核方法联系起来,构建了显式的软提示,使冻结的 Transformer 能够模拟经典的 Nadaraya-Watson 核估计器。核回归的理论保证得以继承,从而实现了依赖于内在维度的速率的通用逼近定理,并揭示了提示范数、长度和隐藏维度之间的权衡。 AI

影响 表明预训练对于 Transformer 中的某些近似任务可能不是必需的,从而可能简化模型开发。

排序理由 该集群包含一篇详细介绍 Transformer 模型理论发现的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

软提示可使随机 Transformer 近似函数

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Alexander Hsu, Rongjie Lai ·

    通过提示随机 Transformer 实现无需训练的通用近似

    arXiv:2608.09558v1 Announce Type: new Abstract: How expressive is prompting a transformer? Answering this question is important for separating the roles of prompting, architecture, and pretraining in transformer models, and for determining whether task-specific behavior must be s…