CLIP ViT-B/32
PulseAugur coverage of CLIP ViT-B/32 — every cluster mentioning CLIP ViT-B/32 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AI研究揭示蒸馏瓶颈,标签感知方法提升性能
研究人员在Vision Transformer与小型CNN之间的知识蒸馏中发现了一个显著的几何瓶颈。标准的余弦蒸馏会导致学习到的表示坍缩到低维空间,而与CNN的参数数量无关。虽然一个辅助的InfoNCE目标可以扩展这种维度,但它却会使下游准确率降低15-18个百分点。然而,一种标签感知的监督对比蒸馏方法通过在保持或提高准确率的同时增加维度,显示出潜力,这表明维度扩展的效用取决于目标是否为标签感知。
-
新 AI 框架可实现 51 FPS 的实时视频异常检测
研究人员开发了一种新的两阶段框架,用于实时视频异常检测,该框架利用 YOLO 姿态估计和基于 CLIP 的语义评分。该方法在 NVIDIA Titan XP GPU 上实现了约 51 FPS 的吞吐量,与现有基线相比速度显著提升。该系统在各种数据集上表现出强大的性能,保持高 AUROC 值,同时无需光流或基于密度的评分模块。
-
基础模型在面部攻击检测方面展现出潜力,但在跨数据集迁移方面存在困难
研究人员通过统一的线性探测协议评估了24个冻结编码器,以研究基础模型在面部呈现攻击检测(PAD)方面的有效性。研究发现,虽然这些模型包含通过最少训练即可访问的PAD相关信息,但由于领域漂移,这些信息在不同数据集之间无法可靠地迁移。模型规模在某些家族内显示出优势,但性能也受到架构和预训练方法的影响。InternViT-6B在数据集内误差最低,而CLIP ViT-B/32在测试探针中提供了最佳的跨数据集迁移-计算权衡。
-
研究:特征对齐决定多模态融合策略
一项新的研究论文提出,特征对齐而非数据规模是多模态融合中选择跨注意力(cross-attention)还是拼接(concatenation)的关键因素。研究表明,当特征通过视觉-语言预训练(vision-language pretraining)预先对齐时,拼接在各种数据集规模下均显著优于跨注意力。这一发现得到了理论分析的支持,该分析显示了拼接更高的样本效率,为设计多模态大语言模型(multimodal large language …
-
论文挑战神经网络表示的余弦相似度指标
一篇新发表在arXiv上的论文认为,用于比较神经网络表示的常用指标——均值池化余弦相似度——并非长度不变的。研究人员证明,仅序列长度就可能严重影响该指标,从而可能扭曲跨语言和跨模态比较的结果。他们提出使用中心核对齐(CKA)作为一种更鲁棒、长度不变的替代方案来评估表示相似度。