universal multimodal embedding
PulseAugur coverage of universal multimodal embedding — every cluster mentioning universal multimodal embedding across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新框架通过改进信用分配和效率来增强LVLM推理能力
两篇新研究论文提出了一种增强大型视觉语言模型(LVLM)推理能力的新型框架。第一篇论文PIVOT引入了一个双层学习框架,该框架使用自校准经验回放和视觉引导的优势分配来加强关键的视觉推理步骤。第二篇论文ReWAM专注于通用多模态嵌入的检索式推理,采用检索感知自蒸馏和检索自适应推理来提高准确性和效率。这两个框架都旨在使LVLM在大型部署中更有效、更实用。
-
MoEMB 使用高效的专家混合模型扩展多模态嵌入
研究人员推出 MoEMB,一种使用高效专家混合(MoE)架构来扩展通用多模态嵌入的新方法。该方法允许增加编码器容量,同时保持单向量、非自回归编码,这对于嵌入模型至关重要。MoEMB 在 MMEB-V2 和 MRMR 等基准测试中取得了最先进的性能,优于参数量和计算量都显著更多的模型。该研究还探讨了自适应计算策略,以进一步提高基于 MoE 的嵌入模型在大规模应用(如检索和推荐系统)中的效率。
-
新模型统一稀疏和密集多模态嵌入,提升搜索效率
研究人员推出 UEmbed,一种新颖的仅解码器多模态嵌入模型,能够在单次因果前向传播中生成稀疏词汇和密集表示。该模型旨在将对现代搜索系统至关重要的稀疏检索与多模态输入统一起来。UEmbed 以 2B、4B 和 9B 的规模发布,其中 9B 版本在 MMEB-v2 和 BEIR 等基准测试中取得了有竞争力的结果,性能优于 RzenEmbed 等现有模型。此外,另一篇独立的研究论文提出了 ReLoop-UME 方法,该方法通过在模型深度上…