PulseAugur
实时 10:48:07
实体 VTAB-1k

VTAB-1k

PulseAugur coverage of VTAB-1k — every cluster mentioning VTAB-1k across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
关系
最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_194008 ·

    新方法加速 Vision Transformer 在边缘设备的适配

    研究人员开发了更有效地将 Vision Transformer (ViT) 适配到特定任务的新方法。一种方法使用遗传编程来演化层特定的标量函数,以近似归一化层,在 ImageNet-1K 上实现高精度,同时降低边缘设备的计算复杂度和内存流量。另一种方法,Circuit Fine-Tuning (CFT),使用电路发现来识别和微调 ViT 的关键模块,与标准参数高效微调技术相比,在各种基准测试中显著减少了训练时间和 FLOPs。

  2. TOOL · CL_165188 ·

    新的PIB框架增强视觉模型适应性

    研究人员推出了一种名为提示信息瓶颈(PIB)的新框架,旨在改进冻结的视觉基础模型在下游任务中的适应性。PIB通过调节压缩与充分性之间的权衡来解决逐层信息分配的挑战,目标是在早期层保留与任务相关的信息,并在更深的层逐步丢弃不相关细节。该方法在众多数据集上表现出强大的性能,在FGVC和VTAB-1k等基准测试中以最小的参数调整实现了高准确率。

  3. TOOL · CL_158551 ·

    新框架支持光子视觉 Transformer 的片上微调

    研究人员开发了 Opto-ViT-v2,这是一个新颖的框架,能够直接在光子加速器上对视觉 Transformer 进行参数高效的微调。该系统通过张量化低秩分解来减少激活存储和权重更新,从而解决了片上训练的挑战。Opto-ViT-v2 还包含一个通过真实设备测量校准的噪声模型,证明了其对光子噪声的鲁棒性,并实现了边缘视觉系统的高能效。

  4. TOOL · CL_111796 ·

    新的可微分搜索方法增强了视觉Transformer的提示调优

    研究人员开发了一种新颖的方法,通过采用可微分架构搜索来优化视觉Transformer(ViTs)中的视觉提示调优。该方法联合优化可学习的提示及其融合方案,引入了仿射变换和交叉注意力等新的融合技术,以及传统的拼接和加法。在34个数据集上的实验表明,与现有的提示调优基线相比,在准确性、延迟和参数效率方面均有持续的改进,突显了提示融合策略在利用ViT层语义方面的重要性。

  5. TOOL · CL_93711 ·

    VIOLIN 通过空间先验增强了有限数据的视觉 Transformer

    研究人员开发了 VIOLIN,一种用于视觉 Transformer (ViTs) 的新型掩码注意力机制,它增强了它们处理有限数据或较小模型容量图像的能力。通过空间填充曲线 (SFCs) 编码空间结构,VIOLIN 增加了最少的参数和计算开销,同时显著提高了各种计算机视觉任务的性能。评估显示,在需要空间信息的任务上准确率提高了高达 8.7%,在像素级任务上提高了高达 7.2%,证明了其在微调和预训练场景中的有效性。

  6. RESEARCH · CL_11856 ·

    PVeRA 适配器通过概率矩阵改进参数高效的模型适配

    研究人员推出了一种新颖的概率适配方法 PVeRA,用于大型基础模型,可增强参数高效的微调。PVeRA 通过引入概率方法修改 VeRA 适配器中使用的低秩矩阵,从而能够更好地处理输入歧义和灵活的采样配置。在 VTAB-1k 基准测试上的评估表明,PVeRA 在性能上优于包括 VeRA 在内的现有适配器。