PulseAugur
实时 12:08:48
English(EN) The Entropic Bound for Transformers: Why Static Rank Fails and Attention-Native Rank Recovers

新的熵界衡量 Transformer 容量

研究人员引入了熵界(Entropic Bound),这是一种新的谱度量,用于确定 Transformer 架构中解决特定任务所需的最小模型容量。该界限,表示为 $r^*$,代表了 token 混合算子的内在秩,并被证明是一个紧密的下界,意味着秩较低的模型将不可避免地产生过度的风险。研究表明,梯度下降可以恢复这种秩,并且 $r^*$ 可以在训练开始之前从数据中估计出来。该研究进一步将这一概念提炼为注意力原生内在秩(attention-native intrinsic rank),它为线性和 softmax 注意力机制恢复了熵界的结构,从而提供了更精确的容量衡量。 AI

影响 引入了一个新的理论框架,用于理解和潜在地优化 Transformer 模型容量。

排序理由 该集群包含一篇介绍分析 Transformer 模型新理论概念的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的熵界衡量 Transformer 容量

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Byeong Hoon Yoon ·

    Transformer 的熵界限:为何静态秩失效而注意力原生秩恢复

    arXiv:2607.23050v1 Announce Type: new Abstract: Neural scaling laws describe how loss decreases as models, data, and compute grow, but they do not answer a prior question: for a fixed task, what is the minimum model capacity required to solve it? We study this through the Entropi…