PulseAugur
中
实时 18:28:56
实体 ViT-B/16

ViT-B/16

PulseAugur coverage of ViT-B/16 — every cluster mentioning ViT-B/16 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
43
90 天内 43
发布 · 30天
0
90 天内 0
论文 · 30天
43
90 天内 43
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/3 页 · 共 45 条
  1. TOOL · CL_275496 ·

    新研究探讨视觉 Transformer 中适配器放置的最优解

    研究人员探索了两种不同的方法来优化持续学习模型(特别是在视觉 Transformer 中)中特定任务适配器的放置。一种方法是放置搜索,涉及在各种块配置中训练适配器,并观察到倒 U 形的准确率曲线,在中间深度达到峰值。另一种受神经科学启发的方法,利用来自视觉皮层的脑功能成像 (fMRI) 读出数据来指导适配器分配,无需广泛搜索,即可在减少存储和运行时间的情况下实现具有竞争力的性能。

  2. TOOL · CL_273261 ·

    新的SRTS-BCE方法在数据有限的情况下提高了AI分类器的校准性能

    研究人员开发了一种名为信号路由温度缩放(SRTS-BCE)的新方法,用于提高AI分类器的校准性能,特别是在验证数据有限的情况下。该技术引入了一种低容量、风险条件的校准器,在校准预算较小时,其性能优于传统的标量方法,甚至优于更高容量的自适应方法。SRTS-BCE在CIFAR-100等数据集上使用ViT-B/16等模型取得了更好的性能,证明了其在数据受限场景下的有效性。

  3. RESEARCH · CL_273452 ·

    新方法学习函数子空间以实现高效神经网络压缩

    研究人员开发了一种名为可学习子空间投影(LSP)的新方法来压缩大型神经网络,特别是Transformer和LLM。与使用局部标准的先前技术不同,LSP针对全局目标(例如与原始模型输出分布的KL散度)进行端到端子空间优化。这种方法在更高的压缩率下能更好地保留性能。与现有基线相比,LSP在LLaMA-2 7B和ViT-B/16等模型上表现出更优越的结果,显著降低了困惑度并提高了准确性,同时还实现了更快的解码和更少的内存使用。

  4. TOOL · CL_286010 ·

    新的LSP方法通过端到端学习子空间来增强神经网络压缩

    研究人员开发了一种名为可学习子空间投影(LSP)的新方法来压缩神经网络,特别是Transformer。与之前使用局部标准的旧技术不同,LSP通过联合优化正交投影仪以实现全局目标,来端到端地学习要丢弃的子空间。这种方法旨在防止深层网络中的误差累积,并在各种LLM和视觉Transformer上展现出优越的性能,尤其是在更高的压缩率下。该方法还提高了注意力机制的解码速度和内存使用效率。

  5. TOOL · CL_268956 ·

    权重对编码减小神经网络语法大小

    研究人员开发了一种名为权重对编码(WeightPE)的新技术,旨在通过诱导更小的语法来减小神经网络权重的尺寸。该方法将Re-Pair压缩器集成到直通估计器中,允许显式微调网络权重以进行语法压缩。在CIFAR-10上微调的Vision Transformer模型上的实验表明,与标准量化方法相比,WeightPE实现了显著更小的Re-Pair语法,尽管准确性略有下降。

  6. RESEARCH · CL_282886 ·

    新的机器学习遗忘方法有望提高效率和准确性

    研究人员正在开发新的机器学习遗忘方法,旨在在不完全重新训练的情况下,从已训练模型中移除特定数据的影响。一种方法是量化充分统计量(QSS),它使用冻结的模式和可变的內容进行精确的数据减法,从而降低删除延迟。另一种方法是UnAct,它采用一种无梯度技术,仅使用前向传播来衰减单元激活,即使在遗忘数据稀缺的情况下也有效,并且在效率和准确性保持方面优于现有方法。第三种技术是逆向蒸馏遗忘(IDU),它结合了数据遗忘和模型蒸馏,能够实现高效的一步生…

  7. TOOL · CL_245643 ·

    预训练和蒸馏在细胞分类中优于架构选择

    一篇新发表在arXiv上的研究调查了不同深度学习架构在无标签单细胞分类中的有效性。研究发现,预训练和微调策略比架构选择(如CNN与Vision Transformers (ViTs))更关键。具体来说,预训练模型即使参数更少,也显著优于从头开始训练的模型。研究还强调,知识蒸馏可以为实际部署带来更高效、性能更好的紧凑型模型。

  8. TOOL · CL_245171 ·

    新的MCANet模型改进了无人机图像的飓风后损害评估

    研究人员开发了MCANet,一个新颖的多标签分类框架,用于使用无人机图像评估飓风后的损害。该网络集成了Res2Net骨干网络进行多尺度特征提取,以及类别特定的残差注意力,以提高识别各种损害类别的准确性。在Michael飓风的RescueNet数据集上进行测试,MCANet实现了91.37%的平均精度均值(mAP),优于Vision Transformer (ViT-B/16)等现有模型,同时需要更少的计算资源。

  9. TOOL · CL_244914 ·

    CLIP 模型使用更大的文本编码器可能会导致性能下降

    一篇新的 arXiv 论文揭示,在 CLIP 模型中增加文本编码器的大小会负面影响零样本性能,即使总参数数量增加也是如此。研究人员发现,对于大多数视觉编码器而言,存在一个最佳的文本编码器大小,超过该大小后,由于过拟合会导致性能下降。该研究表明,特定模态的权重衰减系数可以在这些性能下降的配置中恢复并提高性能。研究结果突显了嵌入均匀性和跨模态对齐之间的权衡,这两种特性可以预测零样本性能,并旨在指导更有效和可靠的 CLIP 架构扩展。

  10. TOOL · CL_244779 ·

    加州大学伯克利分校研究人员为Transformer开发基于Bandit的剪枝方法

    加州大学伯克利分校的研究人员开发了一种新颖的方法来剪枝大型Transformer模型,包括用于视觉和语言任务的模型。该技术被构建为一个损伤感知的多臂老虎机(multi-armed bandit)问题,旨在识别并移除Transformer内的完整功能单元,同时将性能下降降至最低。该方法通过掩码注意力头(attention heads)和MLP通道组来衡量它们对模型损失的影响,然后使用Thompson sampling等采样策略依次选择要…

  11. TOOL · CL_233378 ·

    新方法解决AI模型解释中的旋转引起的漂移问题

    研究人员发现,用于审计AI模型决策的后验显著性图(如Grad-CAM)存在一个显著问题:当输入图像旋转时,即使模型预测保持不变,这些图也会出现“漂移”。这种不稳定性在缺乏规范方向的医学和航空影像领域尤其成问题。研究发现,通道权重出奇地稳定,而空间激活张量是漂移的根源,这种移动会被分类器的池化机制丢弃。一种新方法EquiGrad-CAM已被开发出来,它是一种无需训练的包装器,通过重新定向旋转视图的显著性图后对其进行平均,从而显著提高了旋…

  12. RESEARCH · CL_227167 ·

    新研究探索先进的机器学习遗忘技术 · 追踪4个来源

    研究人员正在开发新的机器学习遗忘方法,即从AI模型中移除特定数据或知识的过程。一种名为源无关类别遗忘审计(SFRA)的方法,专注于在无法访问原始训练数据的情况下,利用合成探针和置信度过滤来恢复已遗忘类别的模型。另一种方法,CONfession-to-Forget-Set(CONFS),通过构建与模型对齐的遗忘集来解决大型语言模型(LLMs)中的遗忘集不对齐问题,以提高隐私性和可用性。此外,GRACE(梯度引导核心集选择)解决了从有限示…

  13. TOOL · CL_219126 ·

    新方法可实现三元变换器的高效微调

    研究人员开发了一种名为三元乘法自适应的新方法,用于微调量化为三元权重的变换器。该方法使用低秩Kronecker分解来表示三元权重的离散更新,从而无需反量化即可实现参数高效自适应。在ternarized LLaMA-3和ViT-B/16等模型上的实验表明,该方法与现有的低比特和三元基线相比,显著提高了性能。

  14. RESEARCH · CL_221168 ·

    新的审计方法揭示语言模型中的真实交互

    研究人员开发了一种名为位点不对称审计的新方法,以更好地理解神经网络中的交互。该审计有助于区分真实的交互效应与由干预位置引起的效应。在六个开源语言模型上,单一干预基线解释了绝大多数观察到的效应,这表明真实的交互比之前认为的要少。该方法也应用于 ViT-B/16 和 ResNet-50 等非语言模型,显示了其在分析表示几何方面的广泛适用性。

  15. TOOL · CL_218325 ·

    新方法使用SVD检测Vision Transformers中的分布外数据

    研究人员开发了一种新颖的方法,通过分析Vision Transformers (ViTs) 的学习参数的几何形状来检测其分布外 (OOD) 数据。该方法涉及使用奇异值分解 (SVD) 对每个仿射层的权重矩阵进行分解,并将激活投影到前导奇异向量上。这个过程会生成贯穿网络的类条件典型性分数,形成典型性图谱。从这些图谱中,派生出两个新分数:原型对齐分数 (PAS) 和多层软投票 (MLSV),分别用于衡量与类原型的一致性和跨层共识。

  16. TOOL · CL_216189 ·

    新基准揭示AI知识融合何时有益或有害

    一项新的基准研究探讨了在AI模型中结合手工知识与学习表征的有效性,特别是在训练数据稀缺的情况下。研究发现,不同类型的知识来源可以相互补充,从而带来显著的性能提升,例如ViT-B/16在ImageNet上的性能提高了26个百分点。然而,当知识来源过于相似时,它们倾向于相互替代,而过强的先验知识会干扰学习到的表征,导致性能下降。该研究还确定了追溯诊断这些结果并高精度预测未来收益的方法。

  17. TOOL · CL_216103 ·

    SPARCL方法解决了解析持续学习中的谱干扰问题

    研究人员推出了一种新颖的解析持续学习方法SPARCL,该方法解决了现有方法中存在的谱干扰问题。与容易因共享谱分量而遗忘旧类别的先前方法不同,SPARCL对自相关矩阵进行划分。这使得它能够在高能核心子空间中冻结旧类别的分类器分量,而仅更新残差块。在CIFAR-100和ImageNet-R等数据集上的实验表明,SPARCL显著提高了性能,缩小了经典解析学习器与最先进的表示匹配器之间的差距。

  18. TOOL · CL_210606 ·

    AI 管道助力识别古代埃兰楔形文字符号

    研究人员开发了 EpigraphNet,一个用于从退化碑文图像中识别埃兰楔形文字符号的新型管道。该系统利用零样本 SAM2 分割来创建干净的符号掩码,然后由经过微调的 Vision Transformer (ViT-B/16) 进行分类处理。EpigraphNet 的性能显著优于现有的 CNN 和 Transformer 基线模型,在 132 类基准测试中取得了 86.41% 的 top-1 准确率,并展示了对常见和罕见符号更均衡的识别能力。

  19. RESEARCH · CL_206462 ·

    新方法改进工业异常检测的校准和评估

    研究人员开发了用于校准工业异常检测系统的新方法,特别是在面对分布偏移和标记异常稀缺的情况下。一种方法 SPARC 使用少量已验证的正常图像来调整斑块特征,从而提高 Image AUROC 和 AU-PRO 等性能指标。另一种方法侧重于无分布误报校准和机会校正空间评估,通过考虑异常图与缺陷掩模的空间重叠并考虑机会因素,对检测器性能进行更精确的评估。

  20. RESEARCH · CL_205650 ·

    DCA-MoE框架通过自适应融合和路由增强人群计数

    研究人员推出了一种新颖的DCA-MoE框架,旨在通过使特征融合和专家路由依赖于内容来提高人群计数精度。该方法利用空间自适应层融合(SALF)动态加权来自不同骨干层的特征,并利用密度路由多感受野专家(DR-MoE)为每个位置选择最合适的专家。该框架保留了冻结的DINOv3编码器,在NWPU-Crowd基准测试上取得了有竞争力的结果,展示了自适应方法在复杂视觉分析任务中的潜力。