研究人员通过将LeJEPA自监督学习框架与优化算法相结合,开发了一种仅注意力白盒Transformer模型。该方法优化了稀疏率降低目标,从而形成了一种仅注意力的架构,无需ISTA结构或MLP层。该模型在CIFAR-10和CIFAR-100数据集上实现了具有竞争力的分类精度,同时显著减少了参数数量。对标准ViTs的进一步研究表明,MLP模块可能是多余的,因为在知识蒸馏下用ReLU激活替换它们也可以减少参数而不会牺牲精度。 AI
影响 这项研究通过质疑MLP层的必要性,可能导致更参数高效的Transformer模型。
排序理由 这是一篇详细介绍新模型架构和训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →