Imagenet 1k
PulseAugur coverage of Imagenet 1k — every cluster mentioning Imagenet 1k across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
ViTok 模型增强计算机视觉蒸馏中的密集语义
研究人员开发了 ViTok,一种新的模型,可改进计算机视觉任务中多教师蒸馏的密集语义。通过结合 SigLIP2 和 DINOv3-L 的见解,ViTok 解决了全局识别和密集语义准确性之间的权衡问题。该模型包含多项修改,包括拆分适配器头、不对称损失和掩码图像建模,在 ImageNet-1K 和 ADE20K 基准测试中取得了强劲的性能。
-
新的KCCA方法增强了VLM的视觉感知能力
研究人员通过提出一种基于核典型相关分析(KCCA)的新方法,重新审视了视觉语言模型(VLM)的视觉表示增强。该方法通过最大化投影相关性来表征特征子空间上的表示对齐。该方法被扩展到三视图(3vKCCA)公式,结合了文本编码器的投影以实现联合对齐。在CLIP ViT-L/14和ImageNet-1K上的实验表明,3vKCCA将MMVP-VLM的准确率从17.8%显著提高到25.9%,在保持零样本性能的同时优于现有方法。
-
新的脉冲自注意力方法减少了训练-推理不匹配
研究人员开发了一种名为并行时序对齐脉冲自注意力机制(PT-SSA)的新方法,以解决脉冲神经网络训练和推理中的差异。该方法重建虚拟脉冲切片并并行计算注意力,显著减少了训练和推理之间的不匹配。自适应版本Adaptive PT-SSA通过学习重缩放因子进一步提高了性能,在CIFAR-100和ImageNet-1K等基准测试中取得了显著的准确性提升。
-
函数空间Transformer自适应表示以应对科学和视觉任务
研究人员推出函数空间Transformer (FST),一个旨在从离散样本表示的函数中学习的新颖框架。与使用固定网格的传统方法不同,FST采用一种空间自适应的连续潜在表示,其锚点位置根据输入观测值进行预测和优化。这种自适应方法使表示能够更好地匹配输入的空间组织,从而提高性能。FST在PDE预测任务上展示了优于Perceiver IO的结果,并在ImageNet-1K上以更少的参数实现了比Vision Transformer更高的准确率。
-
VisionHOPE:发布新的视觉骨干模型及预训练权重
一篇新的研究论文介绍VisionHOPE,一个被设计为自修改学习系统的视觉骨干模型。该论文提供了VisionHOPE不同尺寸(T/S/B)检查点的官方预训练权重。这些检查点可用于ImageNet-1K分类、COCO目标检测和实例分割以及ADE20K语义分割等任务。用户可以使用Hugging Face CLI下载单个或所有检查点。
-
新的融合方法合并了不同的视觉模型
研究人员开发了一种名为黎曼-洛伦兹参数融合(RLPF)的新颖方法,用于合并独立训练的视觉模型,即使它们的架构不同。该技术通过对齐参数组并将它们投影到通用坐标系来解决合并Vision Transformers(ViTs)和状态空间模型(SSMs)等模型的挑战。RLPF方法然后利用一个学习到的门来组合这些混合分支的输出,在CIFAR-10、Oxford-IIIT Pet和ImageNet-1K等基准数据集上展示了改进的性能。
-
新的CTOAC方法改进了视觉状态空间对偶模型的低比特量化
研究人员开发了一种新的后训练量化(PTQ)方法,称为通道感知、Token平衡、输出感知裁剪(CTOAC),以解决视觉状态空间对偶(VSSD)模型中的低比特量化挑战。该研究确定激活量化是关键瓶颈,并提出CTOAC学习每输入通道的裁剪边界,从而最小化重建损失。该方法在各种VSSD模型尺寸的激进精度设置下成功保持了ImageNet-1K的准确性并提高了鲁棒性,同时在COCO和ADE20K数据集上的目标检测和分割任务中也保持了性能。在RTX …
-
新方法按需生成领域特定数据集,效果优于大型通用数据集
研究人员开发了一种名为 Precision at Scale (PaS) 的新方法,用于按需自动生成领域特定数据集。该方法挑战了这样一种传统观念:大规模通用数据集在自监督学习方面总是更优越。PaS 利用基础模型和生成模型,只需极少的人工干预即可创建任何规模和领域的的数据集,并在训练视觉 Transformer 和卷积神经网络方面被证明是有效的。
-
自监督模型在未见数据集上表现出强大的泛化能力
研究人员进行了一项实证研究,以评估自监督编码器在不重新训练的情况下对未见数据集的泛化能力。该研究部署了在ImageNet-1k上预训练的图像模型,并比较了监督和自监督技术。研究结果表明,监督编码器在其训练域内表现更好,而自监督编码器在远离其训练域的数据上表现更优。研究还表明,在UMAP降维空间中测量的轮廓系数可以有效预测在未标记数据上的聚类性能。
-
新的OOD基准测试Fi-ImageNet-1k挑战AI模型
研究人员开发了Fi-ImageNet-1k,这是一个旨在挑战AI模型分布外(OOD)检测能力的新数据集。该数据集源自ImageNet-1k验证集中的图像,这些图像经过重新标注后发现不属于任何ImageNet-1k类别。专家人工标注员在多模态大语言模型(MLLMs)、视觉语言模型(VLMs)和反向图像搜索的辅助下,识别出可以被分配到原始ImageNet-1k标签空间之外的特定类别的图像。由此产生的Fi-ImageNet-1k包含522个…
-
新的 CORD 适配器在事后校准中保持 top-1 预测
研究人员推出 CORD(Calibrator-Output Repair for Top-1 Decision Preservation,用于保持 top-1 决策的校准器输出修复),这是一种新颖的后拟合适配器,旨在改进机器学习模型的事后校准。CORD 确保在调整置信度分数的同时,原始的 top-1 预测保持不变。该方法修复校准后的概率向量以保持初始预测,从而通过设计实现零 Top-1 预测变化率(TPCR)。在 CIFAR-10、C…
-
图像增强技术被测试为深度学习图像检索系统的生成器
本文介绍了一种利用图像增强技术作为测试生成器来测试深度学习图像检索系统的新方法。该研究对50种增强方法进行了分类,并实证评估了它们在生成多样化测试用例方面的有效性。使用Amazon Titan和OpenCLIP模型在CIFAR-10、ImageNet-1K和March Networks数据集上进行的实验表明,天气模拟和SaSPA技术在保持真实性的同时,产生了最高的嵌入不确定性和故障率。相反,基于GAN的增强由于合成伪影而显示出较低的真实性。
-
Iwin Transformer 通过交错窗口和卷积解决了 ViT 的复杂性问题
研究人员推出了一种新颖的层次化视觉Transformer——Iwin Transformer,旨在克服现有视觉Transformer(ViTs)的局限性。这种新架构在一个块内结合了交错窗口注意力和深度卷积,有效降低了注意力机制的二次复杂度。Iwin Transformer 还实现了增强的可扩展性,能够支持在不同分辨率下的微调以及从2D到3D应用的权重迁移。初步结果显示,在ImageNet-1K上的准确率有所提高,在Kinetics-4…
-
新的通道专家混合层大幅削减CNN计算量
研究人员推出了一种名为通道专家混合(MoCE)的新型层,旨在取代卷积神经网络中的标准逐点投影。与难以实现并行卷积专家学习相似滤波器的传统专家混合(MoE)模型不同,MoCE将专家轴转移到通道选择上。该方法使用单个输出通道作为专家,具有学习到的稀疏输入通道支持和用于聚合的输入自适应softmax。MoCE在ImageNet-1K和CIFAR-100等基准测试中,显著降低了计算成本和延迟,同时达到了或超过了密集基线的性能。
-
发布新的视频预训练方法和千万小时级数据集
研究人员推出了一种新颖的视频预训练方法 LeVJEPA,该方法在保持或提高下游准确性的同时,显著降低了计算成本。该方法绕过了常见的启发式方法,如架构不对称和 EMA 目标编码器,而是使用单个编码器配合不变性损失和 SIGReg 正则化。同时,LAION-BVD 数据集已发布,提供千万小时的视频数据用于多模态预训练,这些数据源自通过 CommonCrawl 收集的 8000 万个视频。该数据集旨在通过提供大规模、开放访问的合成字幕资源来…
-
新的通道专家混合方法提高了CNN的效率
研究人员开发了一种名为通道专家混合(MoCE)的新方法,以提高卷积神经网络的效率。与将输入路由到不同专家的传统专家混合模型不同,MoCE为每个专家选择特定的输入通道。这种受MoE启发的模型用更高效的通道混合层取代了密集投影。MoCE在ImageNet-1K和CIFAR-100等基准测试中,表现与密集基线相当或更优,同时还降低了计算成本和延迟。
-
新的多重叠头自注意力提升视觉 Transformer 性能
研究人员推出了一种名为多重叠头自注意力(MOHSA)的新机制,旨在增强视觉 Transformer。与隔离注意力头的标准多头自注意力(MHSA)不同,MOHSA 允许查询、键和值在相邻头之间进行软重叠划分。这种注意力计算中的头间通信可以改善特征表示。实验表明,MOHSA 在 CIFAR-10、CIFAR-100、Tiny-ImageNet 和 ImageNet-1k 等多个基准数据集上提供了性能提升,计算成本仅略有增加。
-
新研究解决LLM量化鲁棒性和不确定性保持问题
两篇新研究论文探讨了在保持其性能和不确定性行为的同时,改进大型语言模型(LLMs)量化的方法。第一篇论文《Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models》提出了一种训练策略,将高斯噪声注入预注意力logit中,其方差由雅可比矩阵弗罗贝尼乌斯范数确定,在图像和文本基准测试中显示出显著的收益。第二篇论文《Target-…
-
新方法通过稳定的矩阵对数归一化改进深度学习
研究人员开发了一种新颖的全局协方差池化(GCP)中矩阵对数归一化方法,用于深度学习模型。这种新方法使用正交多项式近似,特别是8次Chebyshev展开,来绕过矩阵对数通常需要的数值不稳定的特征值分解。该方法包括均值特征值预归一化和闭式后补偿,这使得梯度有界并避免了问题项。在包括ImageNet-1k在内的基准测试实验表明,这种无分解对数比现有的谱对数和平方根近似更快、更准确。
-
Haar之外的小波基团可提高AI模型的效率
研究人员探索了除常用的Haar和小波之外的不同小波基团在小波卷积层中的有效性。他们的研究侧重于滤波器长度和分解级别之间的权衡,发现像Coiflets这样具有更强近似特性的基团,与Haar相比,可以用更少的参数和FLOPs实现具有竞争力的准确性。这表明替代小波基团为构建基于小波的架构的实践者提供了更高效的设计选择,特别是在图像分类和语义分割任务中。