Imagenet 1k
PulseAugur coverage of Imagenet 1k — every cluster mentioning Imagenet 1k across labs, papers, and developer communities, ranked by signal.
14 天有情绪数据
-
新研究解决LLM量化鲁棒性和不确定性保持问题
两篇新研究论文探讨了在保持其性能和不确定性行为的同时,改进大型语言模型(LLMs)量化的方法。第一篇论文《Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models》提出了一种训练策略,将高斯噪声注入预注意力logit中,其方差由雅可比矩阵弗罗贝尼乌斯范数确定,在图像和文本基准测试中显示出显著的收益。第二篇论文《Target-…
-
新的多重叠头自注意力提升视觉 Transformer 性能
研究人员推出了一种名为多重叠头自注意力(MOHSA)的新机制,旨在增强视觉 Transformer。与隔离注意力头的标准多头自注意力(MHSA)不同,MOHSA 允许查询、键和值在相邻头之间进行软重叠划分。这种注意力计算中的头间通信可以改善特征表示。实验表明,MOHSA 在 CIFAR-10、CIFAR-100、Tiny-ImageNet 和 ImageNet-1k 等多个基准数据集上提供了性能提升,计算成本仅略有增加。
-
新方法通过稳定的矩阵对数归一化改进深度学习
研究人员开发了一种新颖的全局协方差池化(GCP)中矩阵对数归一化方法,用于深度学习模型。这种新方法使用正交多项式近似,特别是8次Chebyshev展开,来绕过矩阵对数通常需要的数值不稳定的特征值分解。该方法包括均值特征值预归一化和闭式后补偿,这使得梯度有界并避免了问题项。在包括ImageNet-1k在内的基准测试实验表明,这种无分解对数比现有的谱对数和平方根近似更快、更准确。
-
Haar之外的小波基团可提高AI模型的效率
研究人员探索了除常用的Haar和小波之外的不同小波基团在小波卷积层中的有效性。他们的研究侧重于滤波器长度和分解级别之间的权衡,发现像Coiflets这样具有更强近似特性的基团,与Haar相比,可以用更少的参数和FLOPs实现具有竞争力的准确性。这表明替代小波基团为构建基于小波的架构的实践者提供了更高效的设计选择,特别是在图像分类和语义分割任务中。
-
ImageNet-1k数据集重新标注,发现12%的标签错误
一篇新论文详细介绍了重新标注ImageNet-1k数据集的广泛过程,揭示了原始标签存在严重问题。研究人员发现,大约12%的标签不正确,33.3%的图像是多标签的,3.8%的图像不包含相关对象。这项名为ReImageNet的全面重新标注工作包括多标签校正、对象定位和修订的类别定义,使监督模型准确性提高了高达1.2%,多模态大模型(MLLMs)提高了5-6%。该研究表明,大规模标注需要迭代改进,并强调了人与大模型协作在实现高质量结果方面的有效性。
-
SSOG-Attention 提供可扩展的SDPA替代方案,降低了复杂性
研究人员开发了SSOG-Attention,这是一种新颖的方法,提供了标准缩放点积注意力(SDPA)的次二次方且可扩展的替代方案。通过学习高斯原子并基于查询令牌对其进行几何引导,SSOG-Attention将计算复杂度从O(N²·d)降低到O(N·√N·d)。实验表明,SSOG-Attention在CIFAR-100等较小数据集上优于SDPA,并在ImageNet-1K等较大数据集上以更快的收敛速度达到同等性能,同时在规模化时也更节省内存。
-
新的DECAF方法为AI模型扰动响应提供更深入的见解
研究人员开发了一种名为DECAF(Decomposition of Evidence, Contradiction, And Fragility,证据、矛盾和脆弱性分解)的新方法,以更好地理解AI模型如何响应扰动。与仅测量模型反应幅度(magnitude)的传统方法不同,DECAF将响应分解为证据、矛盾和脆弱性组件。这种分解提供了对模型行为更细致的解释,在各种视觉和表格设置中被证明比简单的幅度分析更准确。DECAF还展示了效率的提升,…
-
新方法增强 Spiking Transformer 在图像任务上的性能 · 跟踪 2 个来源
研究人员引入了尖峰局部交互 (SLI) 和自适应互补融合 (ACF) 来增强 Spiking Transformer。这些方法通过引入一个独立于注意力的通道,用于相邻尖峰令牌之间的直接信息交换,并自适应地平衡 SSA 和 SLI 的贡献,从而解决了标准尖峰自注意力 (SSA) 的局限性。在包括 ImageNet-1K 和 ADE20K 在内的各种数据集上的实验表明,在图像分类、基于事件的识别和语义分割方面取得了持续的改进。
-
新方法加速 Vision Transformer 在边缘设备的适配
研究人员开发了更有效地将 Vision Transformer (ViT) 适配到特定任务的新方法。一种方法使用遗传编程来演化层特定的标量函数,以近似归一化层,在 ImageNet-1K 上实现高精度,同时降低边缘设备的计算复杂度和内存流量。另一种方法,Circuit Fine-Tuning (CFT),使用电路发现来识别和微调 ViT 的关键模块,与标准参数高效微调技术相比,在各种基准测试中显著减少了训练时间和 FLOPs。
-
新型Transformer模型实现高效边缘动作识别
研究人员开发了CoDAT,一种用于边缘设备上高效动作识别的协作双注意力Transformer。该模型采用轻量级双分支注意力机制,结合用于局部特征聚合的空间卷积注意力(SCA)和用于全局上下文的跨步单头注意力(SSHA),显著降低了计算成本。CoDAT还包含一个无参数的TShift模块用于时间建模,实现了跨帧的高效通信。实验表明,CoDAT在各种基准测试中实现了优于现有方法的能耗-准确性平衡,为边缘物联网系统中的实时应用提供了更快的吞吐…
-
新的方法出现,用于AI模型中高效的视觉Token修剪 · 跟踪6个来源
研究人员正在开发新的方法来优化视觉Transformer (ViTs) 和多模态大语言模型 (MLLMs),通过修剪计算成本高昂的视觉Token。几篇论文提出了新颖的技术,以在不显著降低性能的情况下减少处理的Token数量。这些方法包括递归ViTs的训练后Token合并、使用专用寄存器的任务自适应修剪、预测中间层注意力以确定Token重要性、面向角色的区域分配以及用于设计修剪策略的AI驱动框架。
-
新的APQF框架通过LLM引导自动化AI模型压缩
研究人员开发了APQF,这是一个旨在优化深度神经网络在边缘设备上效率的自动化框架。该系统采用一种代理方法,由LLM规划器和剖析数据引导,以逐层确定最佳的结构化剪枝和混合精度量化策略。APQF旨在显著降低计算成本,同时保持高精度,在多个数据集上的各种视觉模型上展示了位运算的大幅减少。
-
新的最优传输框架统一冷启动主动学习方法
研究人员开发了一种新的冷启动主动学习框架,这是一种在没有先验知识的情况下选择有价值数据子集的方法。该方法利用最优传输理论来统一现有方法,并对涉及的权衡进行了理论分析。提出的算法 epsilon-Adaptive Selection (epsilon-AS) 使用数据自适应正则化规则,并在各种数据集上展示了最先进的性能,包括 ImageNet-1k,在该数据集上提高了准确性并减少了选择时间。
-
新的SAPER框架修剪Vision Transformer注意力头以提高效率
研究人员开发了SAPER,一种用于修剪Vision Transformer中注意力头的新颖框架。该方法利用基于注意力图的拉普拉斯特征向量的谱分析和可视化技术来识别和聚类冗余的注意力头。SAPER采用LapSum Soft Top-K方法,在ImageNet-1K上展示了有利的准确性-效率权衡,在FLOPs减少方面优于RAPTOR基线,同时保持了强大的分类性能。
-
新的CoCaRS方法增强了异构知识蒸馏
研究人员推出了一种新颖的异构知识蒸馏方法CoCaRS,旨在改善不同模型架构之间的知识迁移。CoCaRS通过混淆证据估计和强度分配控制来校准特征去相关性,从而更好地保留结构信息,解决了现有冗余抑制技术的局限性。此外,采用自适应系数调节来动态调整抑制目标,降低了对不同师生对和训练阶段的系数设置的敏感性。在CIFAR-100和ImageNet-1K数据集上的实验证明了CoCaRS在提高蒸馏性能和稳定性方面的有效性。
-
Muon 优化器在理论和实践神经网络训练中展现出潜力
两篇新的研究论文探讨了 Muon 优化器,这是一种旨在更好地处理神经网络中矩阵结构参数的方法。第一篇论文介绍了一种用于 Sharpness-Aware Minimization (SAM) 的矩阵感知几何,将谱内扰动与 Muon 结合,以提高 ImageNet-1K 上的鲁棒性和验证准确性。第二篇论文对 Muon 进行了理论收敛性分析,证明了它通过利用神经网络训练中 Hessian 矩阵的低秩结构,有潜力超越传统的梯度下降。
-
新的PTQ方法增强了Vision Transformer在边缘设备的效率
两篇新研究论文介绍了用于Vision Transformer(ViTs)的先进训练后量化(PTQ)技术,以提高在资源受限设备上的效率。MixFrag通过估计组件脆弱性并将比特分配制定为背包问题,专注于自适应的层级精度分配,在ImageNet-1K上取得了有竞争力的性能,并在COCO目标检测上取得了最先进的结果。DopQ-ViT通过将量化与激活分布对齐并处理异常值来解决性能下降问题,提出了一种Tan量化器和一种MAD引导的最优缩放因子,…
-
新 Bootleg 方法增强了 AI 模型自监督学习能力
研究人员开发了一种名为 Bootleg 的新自监督学习方法,旨在结合生成方法的稳定性和预测方法的效率。Bootleg 训练模型从教师模型的多个隐藏层预测潜在表示,使其能够同时捕获不同抽象级别的特征。在分类和语义分割的多个基准数据集上,这种方法显示出比 I-JEPA 等现有方法显著的改进。
-
AI研究进展:扩散模型在逆问题中的应用 · 追踪2个来源
两篇研究论文探讨了扩散模型在解决逆问题中的应用,特别是在图像超分辨率和去模糊等图像处理任务中。第一篇论文侧重于高斯数据分布,介绍了条件高斯扩散模型(CGDM),并分析了深度后验采样(DPS)和伪逆引导扩散模型(PiGDM)等现有算法的精度。第二篇论文提出了一种基于粒子滤波的潜在扩散(PFLD)方法,以更有效地探索解空间,并在FFHQ-1K和ImageNet-1K数据集上展示了优于最先进的PSLD求解器的性能。
-
VQ-Transplant 框架支持为视觉标记器有效集成 VQ 模块
研究人员开发了 VQ-Transplant,一个旨在将新的向量量化 (VQ) 模块高效集成到预训练视觉标记器中的框架,而无需进行广泛的重新训练。该方法保留了现有的编码器-解码器参数,并采用简短的解码器适应策略,将训练成本降低高达 95%,同时保持接近最先进的重建保真度。VQ-Transplant 旨在通过实现新颖量化技术的高效实验,使 VQ 研究更易于访问。