PulseAugur
中
实时 20:54:08
实体 MMEB-V2

MMEB-V2

PulseAugur coverage of MMEB-V2 — every cluster mentioning MMEB-V2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
13
90 天内 13
发布 · 30天
0
90 天内 0
论文 · 30天
12
90 天内 12
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. RESEARCH · CL_254217 ·

    新框架通过改进信用分配和效率来增强LVLM推理能力

    两篇新研究论文提出了一种增强大型视觉语言模型(LVLM)推理能力的新型框架。第一篇论文PIVOT引入了一个双层学习框架,该框架使用自校准经验回放和视觉引导的优势分配来加强关键的视觉推理步骤。第二篇论文ReWAM专注于通用多模态嵌入的检索式推理,采用检索感知自蒸馏和检索自适应推理来提高准确性和效率。这两个框架都旨在使LVLM在大型部署中更有效、更实用。

  2. RESEARCH · CL_245107 ·

    MoEMB 使用高效的专家混合模型扩展多模态嵌入

    研究人员推出 MoEMB,一种使用高效专家混合(MoE)架构来扩展通用多模态嵌入的新方法。该方法允许增加编码器容量,同时保持单向量、非自回归编码,这对于嵌入模型至关重要。MoEMB 在 MMEB-V2 和 MRMR 等基准测试中取得了最先进的性能,优于参数量和计算量都显著更多的模型。该研究还探讨了自适应计算策略,以进一步提高基于 MoE 的嵌入模型在大规模应用(如检索和推荐系统)中的效率。

  3. TOOL · CL_221135 ·

    新的MMEmb-R1框架通过自适应推理增强多模态嵌入

    研究人员推出了一种新颖的MMEmb-R1框架,旨在通过自适应地整合推理能力来增强多模态嵌入。该方法通过仅在有益时选择性地应用思维链推理来解决MLLM中的挑战,从而防止不必要的计算和潜在的语义模糊。在MMEB-V2基准上的实验表明,MMEmb-R1使用4B参数模型取得了最先进的性能,显著降低了推理开销和推理延迟。

  4. TOOL · CL_225307 ·

    腾讯发布WeMM-Embedding多模态模型用于微信

    腾讯推出了WeMM-Embedding,这是一个新的通用多模态嵌入模型系列,旨在将文本、图像和视频等多样化内容表示在共享空间中。该模型有2B、4B和9B版本,经过两阶段训练,并在公开基准测试中展现了最先进的性能,其中2B版本在MMEB-v2上的表现优于之前的8B开源模型。WeMM-Embedding已部署到微信的各项应用中,包括推荐和搜索服务,实际性能有显著提升。

  5. RESEARCH · CL_219179 ·

    微信发布WeMM-Embedding多模态模型,达到SOTA性能

    微信推出了WeMM-Embedding,这是一个新的通用多模态嵌入模型系列,旨在将文本、图像、视频和交错的多模态输入表示在共享空间中。该模型有2B、4B和9B版本,经过两阶段训练,并在公开基准测试中展示了最先进(SOTA)的性能,其中2B版本在MMEB-v2上优于8B基线。WeMM-Embedding已部署到微信的多个应用中,包括视频号、公众号和朋友圈,在推荐和搜索功能方面取得了显著的提升。

  6. TOOL · CL_210394 ·

    UMER框架统一嵌入和排序以实现多模态检索

    研究人员推出UMER,一个旨在统一嵌入和排序以实现通用多模态检索任务的新框架。该方法采用感知对的判别性推理,通过对比查询-候选对来识别相关的匹配和差异证据,这与以往孤立推理的方法不同。UMER在一个多模态大语言模型(MLLM)中联合学习用于高效全局匹配的对比嵌入和用于成对相关性判断的判别性排序。该框架在MMEB-V2基准测试中展示了最先进的性能。

  7. RESEARCH · CL_186966 ·

    新的UniME-R1框架通过反馈驱动的推理改进多模态检索 · 跟踪2个来源

    研究人员开发了UniME-R1,这是一个新颖的框架,旨在通过将检索反馈纳入推理过程来增强统一多模态检索。与以往仅依赖基于查询的思维链(CoT)的方法不同,UniME-R1的顾问分析初步检索到的候选对象,以识别混淆点并生成检索中心化思维链(RC-CoT)。这种方法可以优化检索方向,并在MMEB-V2等基准测试中提高性能。

  8. RESEARCH · CL_180564 ·

    抖音发布先进多模态嵌入模型,用于搜索和推荐 · 跟踪2个来源

    研究人员开发了抖音多模态嵌入(DME)模型,这是一个为高效、细粒度多模态搜索和推荐设计的两阶段系统。该模型首先进行大规模对比预训练,以建立统一的嵌入空间,然后进行第二阶段,通过基于证据的潜在推理和跨条件重构来增强语义充分性。这种方法使DME在MMEB-v2基准测试中取得了最先进的成果,其9B变体得分为78.4。在抖音的生产环境中,DME在离线评估中显示出2.92%的相对提升,在搜索场景的在线A/B测试中显示出0.1%的生命周期增益。

  9. TOOL · CL_191487 ·

    抖音发布新型多模态嵌入模型,提升搜索和推荐效果

    研究人员发布了抖音多模态嵌入(DME),这是一个新颖的两阶段框架,旨在增强抖音、小红书和YouTube等大型平台的跨模态表示学习能力。第一阶段涉及广泛的对比预训练,以在各种模态之间创建统一的嵌入空间;第二阶段通过基于证据的类型化潜在推理和跨条件重构来提高语义准确性。该方法使DME在MMEB-v2等基准测试中取得了最先进的成果,并在抖音的搜索场景中展现了实际效益,包括离线增益2.92%和在线增益0.1%。

  10. RESEARCH · CL_178510 ·

    新模型统一稀疏和密集多模态嵌入,提升搜索效率

    研究人员推出 UEmbed,一种新颖的仅解码器多模态嵌入模型,能够在单次因果前向传播中生成稀疏词汇和密集表示。该模型旨在将对现代搜索系统至关重要的稀疏检索与多模态输入统一起来。UEmbed 以 2B、4B 和 9B 的规模发布,其中 9B 版本在 MMEB-v2 和 BEIR 等基准测试中取得了有竞争力的结果,性能优于 RzenEmbed 等现有模型。此外,另一篇独立的研究论文提出了 ReLoop-UME 方法,该方法通过在模型深度上…

  11. TOOL · CL_154581 ·

    Eddy-VL 1.9B: 用于边缘部署的压缩多模态模型

    研究人员开发了Eddy-VL 1.9B,这是一种压缩的多模态嵌入模型,专为无云访问环境中的边缘部署而设计。Eddy-VL基于Qwen3-VL-Embedding-2B构建,利用结构化剪枝和分层蒸馏,将参数数量减少了约9.5%,同时在MMEB-V2基准测试中保持了超过91%的教师模型性能。这种压缩还将前向延迟降低了10%,使其适用于需要低延迟和离线功能的应用程序,例如法证调查。虽然在组合推理方面表现强劲,但在Winoground等任务上…

  12. RESEARCH · CL_50522 ·

    新的SMART框架通过潜在多向量能力增强多模态检索

    研究人员推出SMART框架,旨在通过释放标准单向量嵌入模型中隐藏的多向量能力来增强多模态检索。该方法在推理过程中使用对比训练和后期交互,以提高跨各种模态的性能。SMART可以作为即插即用升级或通过轻量级后期训练应用,提供一种提高检索准确性并优于现有模型的有效方法。

  13. RESEARCH · CL_14352 ·

    FreeRet 框架将多模态大语言模型转变为无训练检索器

    研究人员开发了 FreeRet,一个新颖的框架,使多模态大语言模型 (MLLMs) 能够在无需额外训练的情况下有效充当检索器。这个即插即用系统从现成的 MLLMs 中提取语义基础的嵌入,用于初步候选搜索,然后利用其推理能力进行精确的重排序。FreeRet 在 MMEB 和 MMEB-V2 基准测试中,展示了比在数百万对数据上训练的模型显著的性能提升,显示了其在单一模型内统一检索、重排序和生成功能的潜力。

  14. RESEARCH · CL_04939 ·

    新的RIME框架通过优化生成和检索来增强多模态嵌入。

    研究人员推出了一种名为重写驱动的多模态嵌入(RIME)的新框架,旨在增强生成式多模态嵌入。RIME通过一个检索友好的重写过程优化生成和嵌入,从而解决了思维链推理的局限性。该框架还整合了跨模态对齐(CMA)以连接生成式和判别式嵌入空间,并采用精炼强化学习(Refine-RL)使用稳定的语义锚点来指导优化。实验表明,RIME在缩短思考步骤长度的同时,性能优于现有的生成式嵌入模型。