研究人员开发了 Omni-Embed-Mini,这是一款紧凑型全模态嵌入模型,旨在集成多种数据类型而不损害文本检索质量。该模型提供 0.9B 和 2.3B 参数版本,通过训练媒体编码器匹配媒体本身生成的密集字幕的嵌入,将文本、语音、音频、图像和视频映射到共享空间。这种方法保留了原始文本嵌入功能,同时增加了新的模态,使得较小版本适用于设备端应用,并可与更大、闭源的模型竞争。 AI
影响 通过在不牺牲文本检索性能的情况下减小模型尺寸,实现了更高效的多模态 AI 系统。
排序理由 该集群描述了一篇关于新颖多模态嵌入模型架构和训练方法的新研究论文。
- arXiv
- BEIR-8
- Gemini
- Gemini Embedding 2
- Hugging Face
- LoRA+
- Mohamed bin Zayed University of Artificial Intelligence
- Mohammed Irfan Kurpath
- MTEB-v2
- Omni-Embed-Mini
- Omni-Embed-Mini-0.9B
- SigLIP
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →