Autoregressive Transformers
PulseAugur coverage of Autoregressive Transformers — every cluster mentioning Autoregressive Transformers across labs, papers, and developer communities, ranked by signal.
-
新研究解决了掩码扩散语言模型的评估和架构问题
两篇新研究论文介绍了掩码扩散语言模型(MDLM)的新型评估协议和架构。第一篇论文“CaRE”提出了一个计算感知的框架来标准化评估,揭示了温度和步数等因素会显著影响报告的收益,常常颠覆之前的策略排名。第二篇论文“PreDiff-LM”提出了一种混合注意力机制,该机制可以使预训练的自回归Transformer适应双向生成,在困惑度和MAUVE等指标上比标准扩散模型有所改进,但在同等规模下仍落后于优化的自回归模型。
-
新指标量化语言模型的“认知疲劳”
研究人员引入了一个名为疲劳指数(FI)的新指标,用于测量和诊断自回归语言模型中的“认知疲劳”。这种现象以长距离生成过程中性能下降为特征,可能导致文本重复和指令遵循能力丧失。FI 指标不依赖于特定模型且轻量级,它汇集了与提示注意力衰减、表征漂移和熵校准失误相关的信号。在从 1B 到 13B 参数的九个模型上,FI 有效地预测了任务退化和重复现象,揭示了非单调的缩放行为,并确定了加速疲劳发生的因素。
-
研究人员分析 Transformer 在语言建模中的表达能力
研究人员分析了自回归 Transformer 可以表达的概率分布,超越了它们作为语言识别器的常见处理方式。研究表明,使这些模型自回归有时可以增强它们的表达能力。此外,引入概率元素可以改变非概率 Transformer 模型中存在的等价关系,从而阐明 Transformer 在其作为语言生成器的典型角色中的功能能力。
-
论文:Transformer 的图灵完备性取决于上下文管理
一篇新论文认为,人工智能研究中常被引用的自回归 Transformer 的图灵完备性常常被误解。作者区分了固定的 Transformer 系统和扩展系列设置,并声称现有的图灵完备性证明主要适用于后者。他们提出,上下文管理,而不是 Transformer 架构本身,是决定现实世界大型语言模型计算能力的关键因素。