multi-modal retrieval augmented generation
PulseAugur coverage of multi-modal retrieval augmented generation — every cluster mentioning multi-modal retrieval augmented generation across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
M3Prune框架通过剪枝通信来提高多模态AI智能体的效率
一个名为M$^3$Prune的新框架已被开发出来,用于提高多模态检索增强生成(mRAG)系统的效率。该框架通过剪枝冗余通信路径来解决多智能体mRAG的高token开销和计算成本问题。M$^3$Prune首先独立地稀疏化文本和视觉模态,然后构建动态的跨模态通信拓扑,最后进一步剪枝以创建高效的层级结构。实验表明,M$^3$Prune的性能优于单智能体和其他多智能体mRAG系统,同时显著降低了token消耗。
-
MMAgent-R^2 通过视觉重排和拒绝增强多模态检索 · 跟踪 2 个来源
研究人员推出 MMAgent-R$^2$,这是一个新颖的 Agentic 框架,旨在增强多模态检索增强生成 (mRAG) 系统。该框架解决了现有 mRAG 方法在知识库中处理视觉相似实体时存在的局限性,这些局限性会导致问答错误。MMAgent-R$^2$ 结合了视觉重排,通过比较查询和候选图像来精确识别目标实体,并结合主动拒绝机制,在必要时丢弃不可靠的结果或检索新候选。该系统通过具有复合奖励函数的 GRPO 训练进行优化,在 Info…
-
新的“Ground Then Rank”方法提升了知识型视觉问答能力
研究人员开发了一个名为“Ground Then Rank”(GTR)的新框架,以提高知识型视觉问答(KB-VQA)的性能。该方法将实体识别与证据排序解耦,解决了现有跨模态检索增强生成(MM-RAG)方法的局限性。通过首先提示一个跨模态大语言模型(MLLM)从候选列表中识别高置信度实体,然后使用现成的重排序器进行证据选择,GTR在Encyclopedic-VQA和InfoSeek等基准测试中取得了优异的结果,同时降低了计算复杂度。
-
MEG-RAG框架改进了LLM的多模态证据选择
研究人员推出了一种新颖的框架MEG-RAG,旨在改进多模态检索增强生成(MRAG)系统。当前的MRAG模型常常难以准确评估检索到的多模态数据与答案核心含义的相关性。MEG-RAG通过采用一种称为多模态证据基础(MEG)的语义感知度量来解决此问题,该度量量化了证据的实际贡献。这种方法基于语义基础优先考虑高价值内容,从而在M$^2$RAG基准测试的实验中证明了更准确和一致的输出。
-
新框架在多模态AI生成中匿名化人脸,同时保留视觉线索
研究人员开发了一个名为Identity-Decoupled MRAG的新框架,以解决多模态检索增强生成(MRAG)系统中的隐私问题。该框架旨在匿名化检索图像中的人脸,同时不损害对模型推理至关重要的视觉线索。它利用了一个解耦变分编码器、一个用于合成身份替换的拒绝采样器以及一个条件潜在扩散生成器来合成匿名化的人脸。