multimodal RAG
PulseAugur coverage of multimodal RAG — every cluster mentioning multimodal RAG across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的RAG方法通过选择性升级模态使用来降低VLM成本
研究人员开发了一种新的多模态检索增强生成(RAG)方法,称为后验选择性模态升级。该方法通过首先尝试仅使用文本和表格回答查询,然后仅在必要时选择性地启用昂贵的视觉语言模型(VLM)来优化成本。验证器识别缺失的模态,校准后的路由器决定视觉信息带来的准确性提升是否值得成本。该技术在MultiModalQA等基准测试中,显著减少了VLM调用,同时保持了始终开启的VLM流水线的准确性。
-
新研究揭示 AI 检索系统中的关键漏洞
两篇新研究论文探讨了检索增强生成(RAG)系统中的漏洞,特别是关于知识投毒攻击。第一篇论文 MM-PoisonRAG 提出了一个研究多模态 RAG 中此类攻击的框架,详细介绍了局部和全局投毒策略,即使攻击者访问有限,也能显著操纵或破坏模型响应。第二篇论文 Through the Stealth Lens 专注于开发针对 RAG 投毒的注意力感知防御措施,提出一种利用注意力权重检测异常段落并提高对此类攻击的鲁棒性的方法,同时也承认了创建…
-
新研究通过视觉-文本集成和块级RAG推进多模态文档检索
两篇新研究论文介绍了多模态文档检索和检索增强生成(RAG)的先进方法。第一篇“Unveil”提出了一个视觉-文本嵌入框架,集成了文本和视觉特征,并使用知识蒸馏来创建一个保留语义保真度的有效仅视觉模型。第二篇“LFRAG”通过基于布局分割文档并将语义和布局信息融合,将多模态RAG从页面级提升到块级检索。LFRAG还引入了一个新的基准LFDocQA,用于评估细粒度检索和问答。