Contrastive vision-language models
PulseAugur coverage of Contrastive vision-language models — every cluster mentioning Contrastive vision-language models across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
球面插值提高了视觉语言模型的向后兼容性
研究人员开发了一种称为球面插值的创新方法,以解决对比式视觉语言模型中保持向后兼容性的挑战。当这些模型升级时,它们的表示空间通常会变得不兼容,需要昂贵的数据重新索引。新技术涉及沿着球面测地线在旧模型和新模型表示之间进行插值。实验表明,这种后对齐插值可以在不重新索引整个数据集的情况下提高检索准确性,为大规模多模态系统提供了实用的解决方案。
-
新游戏化框架揭示AI色彩感知偏差
研究人员开发了一个新的评估框架,使用游戏Hues and Cues来评估对比视觉语言模型(CVLMs)与人类之间的感知对齐。该框架将颜色单元映射到色度图,以计算100个单词词汇的感知距离。研究发现,虽然CVLMs可以复制人类对具体概念的偏见,但在抽象领域它们会产生分歧,表现出语义误分类或塌缩到默认的蓝色坐标。研究结果表明,精心策划的预训练数据集比海量、未策划的数据集在减少这些错位方面更有效,并强调目前的CVLMs仍然难以捕捉细微的人类色彩记忆。
-
新的日本图像文本数据集提升AI文化理解能力
研究人员推出了WAON,这是一个大规模的日本图像文本数据集,包含约1.55亿个来自日本本土网络内容的示例。该数据集旨在提高对比视觉语言模型的文化理解能力。同时,他们开发了WAON-Bench,一个包含374个类别的精选日本文化理解基准。实验表明,在WAON上微调的模型在执行日本文化任务时,其表现优于在翻译的英文数据上训练的模型。