实体
CLIP ViT-B/32
CLIP ViT-B/32
PulseAugur coverage of CLIP ViT-B/32 — every cluster mentioning CLIP ViT-B/32 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
基础模型在面部攻击检测方面展现出潜力,但在跨数据集迁移方面存在困难
研究人员通过统一的线性探测协议评估了24个冻结编码器,以研究基础模型在面部呈现攻击检测(PAD)方面的有效性。研究发现,虽然这些模型包含通过最少训练即可访问的PAD相关信息,但由于领域漂移,这些信息在不同数据集之间无法可靠地迁移。模型规模在某些家族内显示出优势,但性能也受到架构和预训练方法的影响。InternViT-6B在数据集内误差最低,而CLIP ViT-B/32在测试探针中提供了最佳的跨数据集迁移-计算权衡。
-
研究:特征对齐决定多模态融合策略
一项新的研究论文提出,特征对齐而非数据规模是多模态融合中选择跨注意力(cross-attention)还是拼接(concatenation)的关键因素。研究表明,当特征通过视觉-语言预训练(vision-language pretraining)预先对齐时,拼接在各种数据集规模下均显著优于跨注意力。这一发现得到了理论分析的支持,该分析显示了拼接更高的样本效率,为设计多模态大语言模型(multimodal large language …
-
论文挑战神经网络表示的余弦相似度指标
一篇新发表在arXiv上的论文认为,用于比较神经网络表示的常用指标——均值池化余弦相似度——并非长度不变的。研究人员证明,仅序列长度就可能严重影响该指标,从而可能扭曲跨语言和跨模态比较的结果。他们提出使用中心核对齐(CKA)作为一种更鲁棒、长度不变的替代方案来评估表示相似度。