decoder-only transformer
PulseAugur coverage of decoder-only transformer — every cluster mentioning decoder-only transformer across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
RecPFN 将上下文学习引入推荐系统
研究人员推出 RecPFN,这是一种用于顺序推荐系统中上下文学习的新型网络。该模型在合成数据上进行预训练,使其能够以最少的数据进行贝叶斯风格的推理。然后,一个轻量级的仅解码器 Transformer 在单次传递中生成下一项预测,而无需更新权重。RecPFN 在八个基准测试中展示了最先进的零样本性能,在低计算和低数据场景中优于监督方法,并为可泛化和数据高效的推荐器提供了一种实用的方法。
-
量子电路在理论上显示出优于经典大语言模型的优势
研究人员已经证明了量子电路与经典大语言模型(LLMs)之间的理论分离。该研究证明,某些量子计算,特别是涉及低深度量子电路(如QNC^0)的计算,可以执行当前大语言模型架构(如Transformer和扩散语言模型)在计算上不可行的任务。这些分离在分布和功能背景下都得到了证明,表明了未来量子计算在AI方面可能超越经典AI的潜在领域。
-
大型语言模型受竞争性导演身份引导,斯皮尔伯格占主导地位
研究人员开发了一种名为“创意碰撞”的方法,通过两种对立的导演身份——史蒂文·斯皮尔伯格和马丁·斯科塞斯——来引导大型语言模型。通过在代表他们独特风格的向量之间进行插值,研究发现斯皮尔伯格的身份表现出方向性主导地位,在很大程度上压制了斯科塞斯的影响。有趣的是,中间碰撞点却悖论式地提高了生成连贯性,并且发现两种身份都最大程度地局限于Transformer模型中的特定层,这表明存在一个共享的“道德-语调基底”。
-
图记忆Transformer用学习到的记忆图替换FFN,以提高可解释性
研究人员开发了一种图记忆Transformer (GMT),它用显式的学习记忆图替换了仅解码器语言模型中的标准前馈网络 (FFN) 子层。这种新架构 GMT v7 在其 16 个 Transformer 块中的每一个块内使用了 128 个质心和一个有向转移矩阵。虽然参数量为 8220 万的 GMT 模型在零样本基准测试性能上与更大的 GPT 风格基线相当,但在验证损失和困惑度方面落后,这表明未来有优化的潜力和扩展性。