研究人员提出了ComCLIP,一个用于精炼CLIP视觉编码器的新框架,该编码器是LLaVA等模型的基础。与之前的发现相反,他们证明了当对比温度设置得当时,对比预训练是有效的。ComCLIP冻结文本编码器,并使用有温度的对比损失、MSE锚定损失以及来自DINOv2的关系蒸馏。该方法在零样本分类上与现有基线相匹配,并提高了视觉特征的可迁移性,同时保持了与LLaVA的下游兼容性。 AI
影响 增强了基础的视觉-语言模型,可能提高了LLaVA等下游应用的性能。
排序理由 该集群描述了一篇提出新框架以改进现有模型的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →