实体
Autoregressive Transformers
Autoregressive Transformers
PulseAugur coverage of Autoregressive Transformers — every cluster mentioning Autoregressive Transformers across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新指标量化语言模型的“认知疲劳”
研究人员引入了一个名为疲劳指数(FI)的新指标,用于测量和诊断自回归语言模型中的“认知疲劳”。这种现象以长距离生成过程中性能下降为特征,可能导致文本重复和指令遵循能力丧失。FI 指标不依赖于特定模型且轻量级,它汇集了与提示注意力衰减、表征漂移和熵校准失误相关的信号。在从 1B 到 13B 参数的九个模型上,FI 有效地预测了任务退化和重复现象,揭示了非单调的缩放行为,并确定了加速疲劳发生的因素。
-
研究人员分析 Transformer 在语言建模中的表达能力
研究人员分析了自回归 Transformer 可以表达的概率分布,超越了它们作为语言识别器的常见处理方式。研究表明,使这些模型自回归有时可以增强它们的表达能力。此外,引入概率元素可以改变非概率 Transformer 模型中存在的等价关系,从而阐明 Transformer 在其作为语言生成器的典型角色中的功能能力。
-
论文:Transformer 的图灵完备性取决于上下文管理
一篇新论文认为,人工智能研究中常被引用的自回归 Transformer 的图灵完备性常常被误解。作者区分了固定的 Transformer 系统和扩展系列设置,并声称现有的图灵完备性证明主要适用于后者。他们提出,上下文管理,而不是 Transformer 架构本身,是决定现实世界大型语言模型计算能力的关键因素。