PulseAugur
实时 10:57:00
English(EN) Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining

新的Transformer架构优化自监督学习

研究人员通过将LeJEPA自监督学习框架与优化算法相结合,开发了一种仅注意力白盒Transformer模型。该方法优化了稀疏率降低目标,从而形成了一种仅注意力的架构,无需ISTA结构或MLP层。该模型在CIFAR-10和CIFAR-100数据集上实现了具有竞争力的分类精度,同时显著减少了参数数量。对标准ViTs的进一步研究表明,MLP模块可能是多余的,因为在知识蒸馏下用ReLU激活替换它们也可以减少参数而不会牺牲精度。 AI

影响 这项研究通过质疑MLP层的必要性,可能导致更参数高效的Transformer模型。

排序理由 这是一篇详细介绍新模型架构和训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的Transformer架构优化自监督学习

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Yang Bai, Linyuan Wang, Haoyang Jiang, Nuolin Sun, Libin Hou, Bin Yan ·

    Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining

    arXiv:2608.04213v1 Announce Type: new Abstract: Existing studies on self-supervised learning for white-box networks typically decouple the derivation of white-box networks via optimization algorithms from self-supervised learning paradigms. In this work, we instead revisit the tw…