ViT-Small/16
PulseAugur coverage of ViT-Small/16 — every cluster mentioning ViT-Small/16 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新框架分析 Vision Transformers 中的语义几何
研究人员推出了 TGO-III:语义几何观测器,这是一个旨在分析 Vision Transformers (ViTs) 内部表征行为的框架。这项新框架通过关注语义几何和类别可分性在整个训练过程中的演变,扩展了先前的工作。TGO-III 利用多个观测器来量化区分性表征如何涌现,揭示类别表征变得更具线性可分性,并组织成越来越不同的语义结构。
-
Muon 优化器在理论和实践神经网络训练中展现出潜力
两篇新的研究论文探讨了 Muon 优化器,这是一种旨在更好地处理神经网络中矩阵结构参数的方法。第一篇论文介绍了一种用于 Sharpness-Aware Minimization (SAM) 的矩阵感知几何,将谱内扰动与 Muon 结合,以提高 ImageNet-1K 上的鲁棒性和验证准确性。第二篇论文对 Muon 进行了理论收敛性分析,证明了它通过利用神经网络训练中 Hessian 矩阵的低秩结构,有潜力超越传统的梯度下降。
-
新框架TGO-II揭示Vision Transformer表征在训练过程中的演变方式
研究人员开发了Transformer Geometry Observatory-II (TGO-II),一个用于分析监督训练过程中Vision Transformer (ViT)内部表征的几何演变的新框架。使用Centered Kernel Alignment (CKA)和Singular Vector Canonical Correlation Analysis (SVCCA)等方法,TGO-II揭示了随着训练的进行,表征的专业化程…
-
新框架探究 Vision Transformer 的几何结构和表征动态
研究人员引入了 Transformer Geometry Observatory (TGO) 框架,旨在探索 Vision Transformers (ViTs) 的表征几何结构。首个版本 TGO-I 专门研究 ViT 表征的光谱几何结构。在 ImageNet-100 上训练的 ViT-Small/16 模型实验表明,随着训练的进行,维度利用率增加,而各向异性降低。与预期相反,信息在表征维度之间重新分配,而不是集中在少数几个主导方向上…