ImageNet ILSVRC-2012
PulseAugur coverage of ImageNet ILSVRC-2012 — every cluster mentioning ImageNet ILSVRC-2012 across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
ImageNet ILSVRC-2012 is a recurring benchmark for diverse vision model optimizations
The recent cluster evidence shows ImageNet ILSVRC-2012 being used to evaluate advancements in model scaling (FractalMamba++), quantization (Colinearity Decay), resource-constrained deployment (optimized ViTs), adversarial robustness (HyCAS), and inference speed (Hyperspherical Forward-Forward). This indicates its continued relevance across a wide spectrum of vision model research.
ImageNet ILSVRC-2012 benchmarks will see adoption of Hilbert curve serialization for high-res vision models
The FractalMamba++ paper introduces Hilbert curve serialization for high-resolution image patches. As ImageNet ILSVRC-2012 is a common benchmark for vision models, it's plausible that future research will evaluate models using this technique on ImageNet, especially for tasks involving fine-grained details.
ViT quantization techniques like Colinearity Decay will be evaluated on ImageNet ILSVRC-2012
Colinearity Decay is presented as a method to improve low-bit quantization for Vision Transformers. Given ImageNet ILSVRC-2012's role as a standard dataset for evaluating vision model performance, it is highly likely that this quantization technique will be benchmarked against it to demonstrate its effectiveness.
-
ZeroPur 方法提供无训练对抗性净化
研究人员推出了一种新颖的对抗性净化方法 ZeroPur,该方法无需额外训练。该技术将对抗性图像视为自然图像流形中的异常值,并通过将其投影回该流形来净化它们。ZeroPur 分为两个步骤:引导偏移以找到偏移的嵌入,以及自适应投影以创建用于投影的方向向量。在 CIFAR-10、CIFAR-100 和 ImageNet-1K 数据集上使用各种分类器架构进行的实验证明了其最先进的鲁棒性能。
-
在 Android 设备上训练的 MLP 分类器在 Imagenet-1k 上达到 4.59% 的准确率
一位用户已成功在 Android 设备上完全训练了一个用于 Imagenet-1k 数据集的 MLP 分类器。该模型拥有约 50 万个参数,在数据集的缩小版 32x32 版本上训练 5 个 epoch 后,达到了 4.59% 的验证准确率。训练过程利用了设备的 CPU,特别是 Dimensity 9300+ 的四个 Arm Cortex-X4 核心,耗时约 30 分钟。用户指出,与 CNN 相比,选择 MLP 是因为其在移动设备上的稳…
-
SpecDrop 引入用于专业化 AI 模型的无参数路由
研究人员推出 SpecDrop,一种新颖的、用于专家混合(MoE)模型的无参数路由方法,该方法利用类别标签进行专业化。与依赖学习型路由器的传统 MoE 方法不同,SpecDrop 使用一种固定方案,其中每个分支为其类别分配一个概率,并为其他类别分配少量泄露。该方法在 CIFAR-100 和 ImageNet-1K 等视觉任务上取得了优异的成绩,在没有路由的情况下性能优于参数匹配的基线。研究表明,训练信号的粒度和它们与目标类别的对齐是路…
-
基础模型预训练策略影响视网膜成像迁移能力
一篇新的arXiv论文探讨了基础模型不同的预训练策略如何影响其在超广角视网膜成像任务上的迁移效果。研究人员比较了使用监督学习、掩码自编码器(MAE)和自蒸馏目标训练的Vision Transformer编码器。结果表明,监督学习和自蒸馏方法的表现优于MAE,其中大规模DINOv3模型在诊断糖尿病视网膜病变方面表现最佳。研究还发现,预训练策略会影响模型如何聚合来自不同图像块的证据,并且部分微调可以提高MAE的性能。
-
新型 HMoE Transformer 推进 INR 权重空间分类
研究人员开发了一种新颖的层级专家混合 (HMoE) Transformer,用于直接在隐式神经表示 (INR) 的权重空间中进行分类任务。该方法解决了 INR 权重高维度和复杂参数结构的挑战。HMoE Transformer 利用与 INR 底层网络结构对齐的条件计算,并结合元学习框架,在包括 ImageNet-1K 在内的基准测试中取得了最先进的准确率。该研究还引入了权重空间归因和剪枝方法,以理解 INR 如何编码判别性信息,揭示了…
-
新方法TOOD改进了持续学习中的分布外检测
一篇新论文介绍了一种名为TOOD的方法,旨在改进持续学习系统中的分布外(OOD)检测。该研究确定了两个关键问题:“置信度差距”,即基于能量的检测器会看到logit尺度的下降;以及影响基于特征的检测器的“流形拥挤”。TOOD通过使用重放缓冲区统计信息分解和重新校准每个任务的能量分数来解决这些问题,在CIFAR-10、CIFAR-100和ImageNet-1K等数据集上显示出OOD检测性能的显著提升。
-
新的AI归因方法以最小的准确率损失提高了稳健性
研究人员开发了一个新框架,以提高AI模型归因方法的忠实度和一致性,尤其是在几何变换下。这种无需标注的方法使用子模搜索来识别驱动模型预测的证据,并引入子模排序损失来对齐跨变换输入的这些选择。在ImageNet数据集上的实验表明,对于ViT、ResNet-50和ConvNeXt-B等架构,在模型准确率影响极小的情况下,归因稳定性和稳健性得到了显著改善。
-
SHUFFLESPARSE学习的置换可提高结构化稀疏网络的准确性
研究人员开发了SHUFFLESPARSE,一种新颖的置换原语,旨在增强神经网络中的结构化权重稀疏性。该方法旨在缩小结构化和非结构化稀疏训练之间的准确性差距,尤其是在高稀疏度水平下。通过与权重矩阵一起学习置换矩阵,SHUFFLESPARSE在ViT-B16和GPT-2等模型的准确性方面显示出显著的改进,并显著将LLaMA-2 7B的零样本准确性提高了4.6个百分点。
-
编译器重写缓解移动NPU功率突发
一篇新的研究论文详细介绍了一种在移动NPU推理过程中缓解功率突发的方法,尤其是在设备电池电量低时。该研究在搭载MobileNetV4的Snapdragon 8 Gen 3处理器上进行,发现激进的编译器融合可能导致执行集中和显著的峰值电流突发。提出的解决方案涉及一种预编译图重写,通过插入屏障来防止有害的超级层合并,将峰值电流从3.12 A降低到1.94 A,同时延迟开销极小。
-
新的SoftMoR技术使Vision Transformers更深入、更高效
研究人员推出了一种名为Soft Mixture-of-Recursions (SoftMoR) 的新方法,通过使Vision Transformers (ViTs) 能够利用所有递归步骤的中间表示来增强它们。这种方法以Soft Recursive Vision Transformer (SR-ViT) 的形式实现,可以在参数增加极少的情况下创建更深入、更强大的ViTs。在ImageNet-1K上的实验表明,将SR-ViT-S的递归深度…
-
新的 REDI 方法将 Vision Transformer 的 Token 数量减少 46.8%,同时提高了准确性
研究人员开发了一种名为 REDI(Relevance for DINOv3 Token Reduction)的新方法,通过减少 Patch Token 的数量来提高 Vision Transformer 的效率。REDI 将 DINOv3 Patch 表示量化为视觉词汇表,并使用源自 TF-IDF 的类条件语料库分数来对重要 Patch 进行排序和选择。当应用于 DINOv3 ViT-B/16 主干时,这种方法实现了 46.8% 的序…
-
新方法利用扩散模型实现高效数据集蒸馏
研究人员开发了一种新颖的数据集蒸馏框架,该框架利用预训练的扩散模型进行斑块选择,而不是直接生成图像。该方法通过预测扩散模型的噪声来识别独特的图像区域,从而解决了分布偏移和多步蒸馏等挑战。然后,该方法应用类内聚类和排序来确保斑块多样性,从而实现简化的单步蒸馏过程。实验表明,该方法在 ImageNet-1K 等大型数据集和 ResNet-101 等复杂网络上的指标和设置方面,始终优于现有技术。
-
新方法为神经网络提供更紧凑的泛化界
研究人员开发了一种新颖的方法,从优化角度为深度神经网络推导非空泛化界。该方法使用连续时间随机微分方程来模拟离散时间递归过程,这比传统方法提供了更紧凑的界限。研究表明,即使在ImageNet-1K等大型数据集上进行训练,该技术也能为ResNet和Vision Transformer等现代架构提供合理的泛化保证。
-
新的LEAP课程提高了Vision Transformer蒸馏的效率
牛津大学的研究人员推出了一种名为LEAP的新型训练课程,旨在提高Vision Transformer (ViT) 的知识蒸馏效率。LEAP采用渐进式方法,使用教师模型的中层特征作为学生模型越来越难的目标。该方法加速了收敛,并在ImageNet-100等数据集上显示出显著的准确性提升,ViT-S模型的准确率提高了+12.24%。此外,LEAP通过优化教师推理,将训练FLOPs减少了25.1%,训练时间减少了21%。
-
ITNet架构统一了卷积、注意力和循环
研究人员推出了一种新颖的神经网络架构ITNet,它将卷积、注意力和循环统一为一种可学习的积分变换。该架构使用一个可学习的核(实现为MLP)来模拟成对交互,使其能够根据数据调整其行为。通过调整参数,ITNet可以恢复各种现有架构的功能,包括LSTM、GRU、S4、Mamba和自注意力。该模型在ImageNet-1K、GLUE、ModelNet40、VQA v2和NLVR2等多个基准测试中都表现出具有竞争力或更优的性能。
-
CrossFlow 模型直接从潜在空间生成图像
研究人员推出了 CrossFlow,这是一种新颖的跨空间流公式,可将噪声潜在输入直接映射到像素空间图像。该方法通过优化一个预测图像而非潜在位移的单步目标,绕过了对单独解码器的需求。CrossFlow 可以作为独立的潜在空间到像素生成器,也可以作为现有潜在扩散管道的解码器替代品。在 256x256 分辨率的类条件 ImageNet-1k 上进行的实验中,CrossFlow-XL 在单次函数评估中达到了 1.62 的 FID 分数,证明了…
-
新型扩散模型优化图像压缩的权衡
研究人员开发了一种名为双约束扩散图像压缩(DCIC)的新型图像压缩技术。该方法集成了学习型编解码器和基于扩散的解码器,利用失真和幂等性约束来联合优化保真度和感知真实感。DCIC 允许从单个比特流连续调整这两个方面的权衡,与现有方法相比,在保真度和感知质量方面均表现出更优越的性能。
-
PODS框架将AI模型训练效率提升2倍
研究人员开发了一个名为PODS(即插即用振荡数据量调度)的新框架,以提高模型训练的效率。PODS动态调整训练过程中使用的数据量,在强调正则化和保持数据覆盖的阶段之间交替进行。该方法旨在与现有的数据选择方法兼容,并可应用于各种训练范式。实验表明,PODS可以显著降低ImageNet-1k等任务的训练成本,并加速LLM指令调优,而不会影响性能。
-
TINS方法增强了视觉-语言模型中的OOD检测能力
研究人员开发了TINS,一种用于视觉-语言模型中分布外(OOD)检测的新颖方法。TINS通过在测试时推理过程中学习动态负语义,解决了静态负标签的局限性。它采用图像到文本的模态反演和ID原型分离正则化,以防止受分布内概念的污染。实验表明,在Four-OOD基准测试上,FPR95从14.04%降低到6.72%,取得了显著的改进。
-
bViT 使用单块循环实现参数高效的视觉 Transformer
研究人员开发了 bViT,一种新颖的视觉 Transformer 架构,它使用单个 Transformer 块重复应用于图像识别。这种循环方法在 ImageNet-1K 上实现了与标准 ViT 相当的准确度,但参数却少得多。研究表明,ViT 的大部分深度可以通过循环计算来实现,尤其是在表示空间较宽的情况下,从而能够对下游任务进行参数高效的微调。