ImageNet ILSVRC-2012
PulseAugur coverage of ImageNet ILSVRC-2012 — every cluster mentioning ImageNet ILSVRC-2012 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
ImageNet ILSVRC-2012 is a recurring benchmark for diverse vision model optimizations
The recent cluster evidence shows ImageNet ILSVRC-2012 being used to evaluate advancements in model scaling (FractalMamba++), quantization (Colinearity Decay), resource-constrained deployment (optimized ViTs), adversarial robustness (HyCAS), and inference speed (Hyperspherical Forward-Forward). This indicates its continued relevance across a wide spectrum of vision model research.
ImageNet ILSVRC-2012 benchmarks will see adoption of Hilbert curve serialization for high-res vision models
The FractalMamba++ paper introduces Hilbert curve serialization for high-resolution image patches. As ImageNet ILSVRC-2012 is a common benchmark for vision models, it's plausible that future research will evaluate models using this technique on ImageNet, especially for tasks involving fine-grained details.
ViT quantization techniques like Colinearity Decay will be evaluated on ImageNet ILSVRC-2012
Colinearity Decay is presented as a method to improve low-bit quantization for Vision Transformers. Given ImageNet ILSVRC-2012's role as a standard dataset for evaluating vision model performance, it is highly likely that this quantization technique will be benchmarked against it to demonstrate its effectiveness.
-
受果蝇连接组启发的FlyVision模型展现出强大的视觉性能
研究人员开发了ConnectomeX,一种受果蝇视觉连接组启发的、可训练的架构,旨在改进通用计算机视觉。该模型名为FlyVision,保留了并行ON/OFF处理和循环计算等生物处理元素。FlyVision在MNIST、CIFAR-10和ImageNet-1K等各种基准测试中表现出具有竞争力,且参数量通常远少于ResNet18等成熟模型。此外,FlyVision已被应用于生物医学成像任务,在皮肤病分类和从脑部MRI扫描预测年龄方面显示出潜力。
-
新框架用模糊规则解释医学影像AI模型
研究人员开发了一个新框架来解释用于医学影像的基础模型的潜在特征。这个基于原型的模糊规则系统对特征进行聚类,生成人类可读的IF-THEN规则,从而提供模型如何组织临床信息的透明视图。该方法应用于在ImageNet-1K和GastroNet-5M上预训练的ViT-S/16模型,在未经微调的情况下实现了与黑盒分类器相当的准确率,并且还可以分析合成医学图像以了解生成器行为。
-
新论文发现AI训练数据的价值取决于学习者
一项新的研究论文探讨了训练数据样本的价值并非绝对,而是取决于所使用的特定机器学习模型。实验表明,改变模型的架构,例如增加其宽度或改变其输入处理方式,可以显著改变哪些数据样本被认为对训练最有价值。这表明数据选择策略必须针对目标学习者进行定制,而不是依赖于通用规则。
-
ShatterQuant为Transformer硬件实现块状混合精度
研究人员开发了ShatterQuant,一种用于神经网络混合精度量化的新颖框架,它允许在单个张量内的不同块分配独立的比特宽度。该方法与专为Transformer设计的定制硬件加速器集成,从而能够更精细地控制精度和计算效率。与现有方法相比,该系统在TOPS、面积效率和能效方面均有显著提升,同时在图像识别和生成任务上保持了可比的准确性。
-
量子启发式Transformer (QiT) 推进视觉识别
研究人员开发了QiT,一种用于视觉识别任务的量子启发式Transformer模型。QiT利用了量子模型的结构思想,例如角度启发式编码和周期性特征自注意力,来创建一个模仿量子神经网络特性的经典Transformer。虽然不使用量子计算,QiT旨在经典模型中分离和评估受量子启发的归纳偏差。该模型在图像分类基准测试中表现出竞争力,其QiT-B变体在ImageNet-1K上达到了78.3%的top-1准确率。
-
新的CTOAC方法改进了视觉状态空间对偶模型的低比特量化
研究人员开发了一种新的后训练量化(PTQ)方法,称为通道感知、Token平衡、输出感知裁剪(CTOAC),以解决视觉状态空间对偶(VSSD)模型中的低比特量化挑战。该研究确定激活量化是关键瓶颈,并提出CTOAC学习每输入通道的裁剪边界,从而最小化重建损失。该方法在各种VSSD模型尺寸的激进精度设置下成功保持了ImageNet-1K的准确性并提高了鲁棒性,同时在COCO和ADE20K数据集上的目标检测和分割任务中也保持了性能。在RTX …
-
新的AR-KD方法增强了AI模型的知识转移
研究人员推出了一种名为自适应互惠知识蒸馏(AR-KD)的新方法,旨在增强大型教师模型向小型学生模型的知识转移。与传统的单向蒸馏不同,AR-KD采用互惠适应过程,简化教师的输出分布,并将其类别相关性矩阵与学生的关联表示对齐。该方法旨在减轻类间知识的损失,并提供更兼容的监督信号。在CIFAR-100和ImageNet-1k数据集上的评估表明,AR-KD显著提高了学生模型的准确性,优于现有的知识蒸馏技术。
-
TailProp 提出用于视觉模型的自适应传播方法
研究人员推出了一种新颖的层次化视觉骨干网络 TailProp,该网络利用了尾传播算子 (TPO)。TPO 结合了高斯和柯西稳定过程传播器,能够根据内容实现自适应的空间影响。这种方法在图像分类、目标检测和语义分割等各种计算机视觉任务中取得了改进的性能,优于现有的传播基线。
-
准确性而非尺寸驱动视觉模型尺度鲁棒性
一篇新发表在arXiv上的研究分析了七个架构家族中20个视觉识别分类器的尺度鲁棒性。研究人员发现,模型的基线准确性与其特征尺度之间存在很强的负相关关系,特征尺度衡量的是当图像尺度减小时识别能力开始下降的临界点。这种准确性-尺度规律在不同模型尺寸和架构类型中都保持一致,表明性能而非尺寸或架构是尺度鲁棒性的主要驱动因素。
-
自监督学习模型在显微镜蛋白质定位方面展现出潜力
一篇新的arXiv论文探讨了自监督学习(SSL)模型在显微镜数据集蛋白质定位中的有效性。研究人员发现,在ImageNet-1k和HPA FOV等大型数据集上预训练的模型,特别是使用基于DINO的ViT骨干网络,即使未经微调,在OpenCell数据集上也能表现出强大的性能。进一步的微调提高了准确性,而经过HPA单细胞预训练的模型在k近邻分析中表现出最高的性能。
-
新方法解决AI模型解释中的旋转引起的漂移问题
研究人员发现,用于审计AI模型决策的后验显著性图(如Grad-CAM)存在一个显著问题:当输入图像旋转时,即使模型预测保持不变,这些图也会出现“漂移”。这种不稳定性在缺乏规范方向的医学和航空影像领域尤其成问题。研究发现,通道权重出奇地稳定,而空间激活张量是漂移的根源,这种移动会被分类器的池化机制丢弃。一种新方法EquiGrad-CAM已被开发出来,它是一种无需训练的包装器,通过重新定向旋转视图的显著性图后对其进行平均,从而显著提高了旋…
-
新的 CORD 适配器在事后校准中保持 top-1 预测
研究人员推出 CORD(Calibrator-Output Repair for Top-1 Decision Preservation,用于保持 top-1 决策的校准器输出修复),这是一种新颖的后拟合适配器,旨在改进机器学习模型的事后校准。CORD 确保在调整置信度分数的同时,原始的 top-1 预测保持不变。该方法修复校准后的概率向量以保持初始预测,从而通过设计实现零 Top-1 预测变化率(TPCR)。在 CIFAR-10、C…
-
Lapis 尖峰注意力机制降低了 vision transformers 的能耗
研究人员推出 Lapis,一种专为尖峰 vision transformers 设计的新型尖峰注意力机制。该新方法根据其查询和键的首次尖峰延迟向量之间的 L1 距离对 token 对进行评分,并通过拉普拉斯核映射此距离。Lapis 旨在通过降低注意力机制的计算成本来提高效率,在 CIFAR-10 和 ImageNet-1K 等基准测试中实现高精度,同时与传统的密集点积注意力相比显著降低了能耗。
-
ZeroPur 方法提供无训练对抗性净化
研究人员推出了一种新颖的对抗性净化方法 ZeroPur,该方法无需额外训练。该技术将对抗性图像视为自然图像流形中的异常值,并通过将其投影回该流形来净化它们。ZeroPur 分为两个步骤:引导偏移以找到偏移的嵌入,以及自适应投影以创建用于投影的方向向量。在 CIFAR-10、CIFAR-100 和 ImageNet-1K 数据集上使用各种分类器架构进行的实验证明了其最先进的鲁棒性能。
-
新方法增强 Spiking Transformer 在图像任务上的性能 · 跟踪 2 个来源
研究人员引入了尖峰局部交互 (SLI) 和自适应互补融合 (ACF) 来增强 Spiking Transformer。这些方法通过引入一个独立于注意力的通道,用于相邻尖峰令牌之间的直接信息交换,并自适应地平衡 SSA 和 SLI 的贡献,从而解决了标准尖峰自注意力 (SSA) 的局限性。在包括 ImageNet-1K 和 ADE20K 在内的各种数据集上的实验表明,在图像分类、基于事件的识别和语义分割方面取得了持续的改进。
-
在 Android 设备上训练的 MLP 分类器在 Imagenet-1k 上达到 4.59% 的准确率
一位用户已成功在 Android 设备上完全训练了一个用于 Imagenet-1k 数据集的 MLP 分类器。该模型拥有约 50 万个参数,在数据集的缩小版 32x32 版本上训练 5 个 epoch 后,达到了 4.59% 的验证准确率。训练过程利用了设备的 CPU,特别是 Dimensity 9300+ 的四个 Arm Cortex-X4 核心,耗时约 30 分钟。用户指出,与 CNN 相比,选择 MLP 是因为其在移动设备上的稳…
-
SpecDrop 引入用于专业化 AI 模型的无参数路由
研究人员推出 SpecDrop,一种新颖的、用于专家混合(MoE)模型的无参数路由方法,该方法利用类别标签进行专业化。与依赖学习型路由器的传统 MoE 方法不同,SpecDrop 使用一种固定方案,其中每个分支为其类别分配一个概率,并为其他类别分配少量泄露。该方法在 CIFAR-100 和 ImageNet-1K 等视觉任务上取得了优异的成绩,在没有路由的情况下性能优于参数匹配的基线。研究表明,训练信号的粒度和它们与目标类别的对齐是路…
-
基础模型预训练策略影响视网膜成像迁移能力
一篇新的arXiv论文探讨了基础模型不同的预训练策略如何影响其在超广角视网膜成像任务上的迁移效果。研究人员比较了使用监督学习、掩码自编码器(MAE)和自蒸馏目标训练的Vision Transformer编码器。结果表明,监督学习和自蒸馏方法的表现优于MAE,其中大规模DINOv3模型在诊断糖尿病视网膜病变方面表现最佳。研究还发现,预训练策略会影响模型如何聚合来自不同图像块的证据,并且部分微调可以提高MAE的性能。
-
新型 HMoE Transformer 推进 INR 权重空间分类
研究人员开发了一种新颖的层级专家混合 (HMoE) Transformer,用于直接在隐式神经表示 (INR) 的权重空间中进行分类任务。该方法解决了 INR 权重高维度和复杂参数结构的挑战。HMoE Transformer 利用与 INR 底层网络结构对齐的条件计算,并结合元学习框架,在包括 ImageNet-1K 在内的基准测试中取得了最先进的准确率。该研究还引入了权重空间归因和剪枝方法,以理解 INR 如何编码判别性信息,揭示了…
-
新方法TOOD改进了持续学习中的分布外检测
一篇新论文介绍了一种名为TOOD的方法,旨在改进持续学习系统中的分布外(OOD)检测。该研究确定了两个关键问题:“置信度差距”,即基于能量的检测器会看到logit尺度的下降;以及影响基于特征的检测器的“流形拥挤”。TOOD通过使用重放缓冲区统计信息分解和重新校准每个任务的能量分数来解决这些问题,在CIFAR-10、CIFAR-100和ImageNet-1K等数据集上显示出OOD检测性能的显著提升。