Data Efficient Image Transformers
PulseAugur coverage of Data Efficient Image Transformers — every cluster mentioning Data Efficient Image Transformers across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的ZeBROD框架解决了物体检测中的灾难性遗忘问题
研究人员开发了一个名为ZeBROD(基于零重训练的识别与物体检测)的新框架,以解决物体检测模型中的灾难性遗忘问题。该方法集成了YOLO11n进行定位,并使用DeIT和Proxy Anchor Loss进行特征提取,利用Qdrant向量数据库的余弦相似度进行分类。在零售环境中的一个案例研究表明,ZeBROD在无需重新训练的情况下有效检测新旧产品,在训练时间效率上约为传统方法的3倍,并且在边缘设备上的平均推理时间为每张图像580毫秒。
-
ShatterQuant为Transformer硬件实现块状混合精度
研究人员开发了ShatterQuant,一种用于神经网络混合精度量化的新颖框架,它允许在单个张量内的不同块分配独立的比特宽度。该方法与专为Transformer设计的定制硬件加速器集成,从而能够更精细地控制精度和计算效率。与现有方法相比,该系统在TOPS、面积效率和能效方面均有显著提升,同时在图像识别和生成任务上保持了可比的准确性。
-
研究质疑视觉 Transformer 错误检测信号的可靠性
一篇新发表在 arXiv 上的研究论文调查了使用视觉 Transformer 中的路由信号来检测模型错误的可行性。研究发现,当考虑路由信号时,错误检测探测器中出现的改进,往往是检查点选择过程的产物,而不是路由机制所携带的真实信息。通过控制标签生成和检查点选择,研究人员证明了路由信号并不能可靠地指示模型直接输出之外的错误。
-
新型自适应视觉Transformer渐进式处理图像以提高效率
研究人员开发了ProgResViT,这是一种新颖的自适应视觉Transformer,它通过多个回合渐进式地处理图像。该方法从低分辨率图像和较窄的子网络开始,当置信度高时终止推理,或继续处理更高分辨率和更宽的子网络以进行精炼。该系统利用渐进式条件软门控(PSG)根据当前回合、块和输入分辨率来条件化token融合和层输出。ProgResViT在图像分类任务上展示了比现有自适应方法更好的准确性-计算权衡,并在自监督学习和语义分割方面显示出潜力。
-
新基准揭示AI知识融合何时有益或有害
一项新的基准研究探讨了在AI模型中结合手工知识与学习表征的有效性,特别是在训练数据稀缺的情况下。研究发现,不同类型的知识来源可以相互补充,从而带来显著的性能提升,例如ViT-B/16在ImageNet上的性能提高了26个百分点。然而,当知识来源过于相似时,它们倾向于相互替代,而过强的先验知识会干扰学习到的表征,导致性能下降。该研究还确定了追溯诊断这些结果并高精度预测未来收益的方法。
-
新的剪枝方法显著降低 Vision Transformer 的计算成本
研究人员开发了一种名为去噪方差基剪枝与最优脑偏差补偿 (DVBP + OB$^2$C) 的新方法,以降低 Vision Transformers (ViTs) 的计算开销。该技术利用随机矩阵理论过滤激活协方差中的噪声,以实现更鲁棒的神经元选择。DVBP + OB$^2$C 还利用为选择收集的相同统计数据来优化剩余权重,实现了最先进的免训练性能。实验表明,在 50% 的 MLP 剪枝下,该方法在各种架构上保留了超过 90% 的原始准确率…
-
深度学习模型用于乳腺癌检测的性能和排放基准测试
一篇新论文对七种用于乳腺癌检测的深度学习模型进行了基准测试,评估了它们的性能和环境影响。研究发现,虽然EfficientNet和ResNet提供了高准确率,但它们也产生了更高的二氧化碳排放。DeiT-Tiny、ViT和Swin Transformer等Transformer模型取得了有竞争力的结果,其中DeiT-Tiny在一个数据集上提供了准确率和能源效率的良好平衡,而ViT和Swin在另一个数据集上表现出色。研究强调,在选择医学应用…
-
新的APQF框架通过LLM引导自动化AI模型压缩
研究人员开发了APQF,这是一个旨在优化深度神经网络在边缘设备上效率的自动化框架。该系统采用一种代理方法,由LLM规划器和剖析数据引导,以逐层确定最佳的结构化剪枝和混合精度量化策略。APQF旨在显著降低计算成本,同时保持高精度,在多个数据集上的各种视觉模型上展示了位运算的大幅减少。
-
新的IPPRO框架提供尺度不变的神经网络剪枝
研究人员推出了一种新颖的神经网络压缩框架IPPRO,该框架解决了基于幅度的剪枝的局限性。通过利用投影几何,IPPRO定义了一个尺度不变的“PROscore”,能够准确地捕捉滤波器重要性。该方法在包括CNN、Vision Transformers和LLaMA等LLM在内的各种架构上都展现出卓越的性能,尤其是在高压缩率下且无需微调的情况下。
-
新的 ToaSt 框架提高了 Vision Transformer 的效率
研究人员开发了一个名为 ToaSt 的新框架,旨在提高 Vision Transformer (ViTs) 的计算效率。ToaSt 将策略分离应用于 ViT 架构的不同部分,对注意力模块应用头式结构化剪枝,并对前馈网络应用一种称为 Token 通道选择 (TCS) 的免训练方法。这种方法在图像分类、检测和分割等各种模型和下游任务中都展示了改进的准确性和效率权衡。
-
新的RAPID框架通过逐层令牌合并提高Vision Transformer效率
研究人员开发了RAPID,一个旨在提高Vision Transformer (ViTs) 计算效率的新框架。该方法根据令牌的层级特性智能地修剪和合并令牌,解决了自注意力机制的二次复杂度问题。在早期层,RAPID会移除冗余的局部模式;在更深的层,它则根据注意力权重,在保留重要令牌的同时合并不太关键的令牌。在ImageNet-1K上的实验表明,RAPID在准确率-压缩权衡方面优于现有方法,尤其是在高压缩率下。
-
AI模型注意力拓扑映射至人脑网络
研究人员开发了一种新颖的方法,通过将Transformer模型注意力拓扑映射到人脑网络,来比较AI模型的组织特性。该方法实现了跨视觉、语言和多模态系统的、与模态无关且无任务的分析。他们对151个模型的研究揭示了一种连续的弧形拓扑对齐分布,其中侧重全局抽象的模型与更高级别的大脑网络对齐,而侧重局部细节的模型则与低级别网络对齐。意外的发现包括DINOv2的对齐度降低以及蒸馏DeiT模型的尺度反转,这表明模型架构、训练和类大脑组织之间存在复杂的关系。
-
新算法通过低秩适应增强神经网络压缩
研究人员开发了一种名为 GPTQ-intrinsic LoRA 的新算法,以提高大型神经网络压缩的效率。该方法将低秩校正直接集成到量化过程中,旨在最大限度地减少激进的低比特量化通常会看到的质量下降。对 Qwen3 和 DeiT 等模型的理论分析和实验结果表明,这种方法优于现有方法,并通过改进进一步带来收益。
-
SnapViT 可在无需重新训练的情况下实现弹性 Vision Transformer
研究人员开发了 SnapViT,这是一种创建弹性 Vision Transformer (ViTs) 的新颖方法,该方法可以在不重新训练的情况下适应各种计算预算。这种预训练后的结构化剪枝技术有效地结合了梯度信息和跨网络结构相关性,并通过进化算法进行近似。在多个预训练模型上的实验表明,SnapViT 在不同稀疏度下优于现有方法,并且可以在单个 A100 GPU 上在五分钟内生成可调模型。
-
新的RBDC协议将视觉模型训练成本降低了30%
研究人员开发了一种名为RBDC的新训练协议,以提高训练大型视觉模型的可资源效率。该方法通过无参数的块对角线方式递归地耦合独立训练的、更窄的模型。在ImageNet上使用Vision Transformers和ResNets进行的评估表明,与现有的增长方法相比,FLOPs减少了30%,准确率相当,并且在相同的训练FLOPs下性能有所提高。RBDC训练的模型在作为对象检测和实例分割等下游任务的骨干网络方面也显示出增强的效用。
-
FAIR-Pruner框架支持自适应逐层神经网络剪枝
研究人员开发了FAIR-Pruner,一个用于深度神经网络自动、逐层结构化剪枝的新框架。该方法通过使用移除导向和保护导向的信号,自适应地在网络层之间分配稀疏度。在包括视觉模型和Qwen1.5-MoE模型在内的各种数据集和模型架构上的实验表明,FAIR-Pruner实现了强大的精度-压缩权衡。该框架可作为一个开源包使用。
-
AI模型FusionCell利用布局和拓扑预测电路性能
研究人员开发了FusionCell,这是一种新颖的AI模型,旨在预测数字电路中标准单元的性能。该模型独特地整合了布局几何和网表拓扑,克服了以往常常忽略物理布局的预测器的局限性。FusionCell采用一种双模态方法,使用DeiT编码器处理布局,使用图Transformer处理网表,并通过拓扑引导机制进行融合。在7nm数据集上的实验表明,FusionCell显著降低了回归误差,平均MAPE达到0.92%,并且与传统电路仿真相比,将特征提…
-
新方法QFlash和ELSA提升Vision Transformer的注意力效率
研究人员开发了两种新方法来提高vision transformer中注意力机制的效率。QFlash专注于为FlashAttention实现纯整数运算,在某些模型上实现了显著的加速和能耗降低,而没有精度损失。另一方面,ELSA重新构建了注意力机制,以在实数运算中保留精确的softmax语义,在各种平台和精度上提供硬件无关的性能提升和内存减少。