Tejas Pradeep Shirodkar
PulseAugur coverage of Tejas Pradeep Shirodkar — every cluster mentioning Tejas Pradeep Shirodkar across labs, papers, and developer communities, ranked by signal.
-
新方法测量神经网络中的奇异结构
研究人员开发了一种新方法,可以在不依赖下降或对齐的情况下测量和分类已训练神经网络中的奇异结构。该技术在新的arXiv论文中有所详述,可以恢复死方向的顺序,并将真正的奇点与规范对称性区分开来。该方法已在各种层类型上进行了演示,包括Transformer和MLP,并在构造和训练网络中成功恢复了架构预测的顺序。
-
新的Dead-Direction Conditioners改进深度网络优化
研究人员开发了Dead-Direction Conditioners (DDC),一种用于深度神经网络的新型预处理方法,旨在提高优化稳定性和性能。DDC利用规范等变性将优化轨迹保持在对称商上,从而提高学习率的可读性。与AdamW等标准优化器相比,该方法在抵抗语言模型过拟合崩溃和在视觉Transformer中实现更低验证损失方面取得了显著改进。
-
新的谱方法为深度网络复杂性分析提供更廉价的方案
研究人员推出了一种名为Dead-Direction Signatures (DDS) 的新方法,用于分析深度神经网络的复杂性。DDS 提供了一种计算成本更低的替代方案,可替代现有的局部学习系数 (LLC) 等技术,后者需要大量的校准和前向-后向传播。通过检查激活矩阵或每样本梯度 Fisher-Grams 的谱属性,DDS 提供了网络奇异结构的闭式谱读数。这种新方法已被证明在跟踪奇异值和区分不同任务的模型复杂性方面非常有效,它通过提供层…
-
新的诊断工具可识别 LayerNorm Transformer 中的“死方向”
研究人员已识别出一种代数方法来检测 LayerNorm Transformer 中的“死方向”,这些方向是 Fisher 信息度量消失的参数空间方向。这项发表在 arXiv 上的新诊断技术仅使用 LayerNorm 尺度参数即可查明这些死方向,无需进行计算密集型的前向传播或特征值分解。该方法已在 14 个预训练 Transformer 上成功测试,准确预测了 LayerNorm 模型中的死方向,并正确识别了 RMSNorm 模型中死方…