ResNet-20
PulseAugur coverage of ResNet-20 — every cluster mentioning ResNet-20 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新指标预测神经网络宽度缩放带来的性能提升
研究人员引入了“有效对齐维度”来更好地理解神经网络宽度缩放如何影响模型在未见过数据上的性能。这一新指标量化了激活梯度的信噪几何,为失配概率提供了有限样本界限。使用 LLaMA 风格的 Transformer、Pythia 和 ResNet-20 模型进行的实验表明,更宽的网络通常具有更大的有效对齐维度,并且表现出更少的经验性失配,直接干预证实了该统计量对损失变化的预测能力。
-
Transformer引导的群体智能用于节俭的神经架构搜索
研究人员开发了一个新的神经架构搜索(NAS)框架,该框架显著降低了计算要求,使其可以在NVIDIA RTX 3060等消费级硬件上运行。该方法结合了通过强化学习训练的Transformer控制器和人工蜂群算法,以实现高效的架构设计。该系统成功地为CIFAR-10上的图像分类识别出了一种参数高效的架构,以紧凑的网络实现了84.85%的准确率,并将其应用于信用卡欺诈检测,针对不平衡的表格数据优化了F1分数。
-
新的IGLU激活函数提供了改进的梯度流
研究人员推出IGLU,一种新颖的深度神经网络参数化激活函数,旨在改善梯度流和优化稳定性。IGLU源自半正态分布下GELU门的混合体,通过单个参数在类似恒等和类似ReLU的行为之间提供连续插值。其重尾柯西门确保所有有限输入的梯度非零,增强了对梯度消失的鲁棒性。一种高效的近似方法IGLU-Approx仅使用ReLU运算,在保持视觉和语言数据集上具有竞争力的性能的同时,降低了计算成本。
-
SPARX框架加速边缘RISC-V芯片上的CNN
研究人员开发了SPARX,一个用于在边缘设备上加速卷积神经网络(CNN)的框架。该系统将近似计算与安全和隐私功能集成到RISC-V片上系统中。SPARX利用自定义RISC-V指令扩展和近似对数CNN加速器,并通过差分噪声隐私引擎和认证机制进行增强。评估显示,在特定CNN模型的精度影响极小的情况下,面积和功耗显著降低,吞吐量也有所提高。
-
神经崩溃动力学与特征范数阈值相关
研究人员确定了一个关键的特征范数阈值 fn*,它在很大程度上决定了深度学习模型中神经崩溃发生的时间。该阈值特定于每个模型-数据集对,并且在很大程度上不受训练条件的影响,尽管训练速度可能会有所不同。研究发现,跨越该阈值始终是神经崩溃的前兆,可作为实际的预测指标。网络深度、激活函数、权重衰减和宽度等因素都会影响崩溃的速度和 fn* 的值。