Google发布了TIPS v2 ViT-g/14,这是一款用于零样本图像分类的新模型。该模型包含一个40层图像编码器(带有两个CLS token)和一个12层文本编码器。它在224px的原始分辨率下运行,并根据Apache 2.0许可证发布,其预处理过程显著省略了ImageNet归一化。 AI
影响 该模型的架构和零样本能力有望推动图像分类任务和多模态AI研究的进步。
排序理由 前沿实验室模型发布,附带系统卡。[lever_c_降级自frontier_release: ic=1 ai=1.0]
在 Mastodon — mastodon.social 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →