Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond
PulseAugur coverage of Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond — every cluster mentioning Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond across labs, papers, and developer communities, ranked by signal.
- instance of alphaXiv 90%
- instance of ScienceCast 90%
- instance of CatalyzeX 90%
- instance of Gotit.pub 90%
- instance of CORE Recommender 90%
- instance of Qwen2.5-VL 90%
- instance of Qwen2.5-VL-7B 90%
- developed Multimodal Continual Instruction Tuning 90%
- used by ScienceCast 70%
- used by Gotit.pub 70%
- instance of train of thought 70%
- used by train of thought 70%
14 天有情绪数据
-
新的MLLM框架通过图检索增强推荐系统
研究人员开发了MGRASRec,一个利用多模态大语言模型(MLLMs)的顺序推荐新框架。该方法通过整合协同过滤信号和多模态相似性,从用户-物品交互图中检索结构化路径,从而增强推荐效果。通过将这些信号直接整合到MLLM提示中,MGRASRec避免了循环MLLM推理的计算开销,并在多个数据集上取得了卓越的性能。
-
新的CiteVQA基准测试揭示了LLM中的“归因幻觉”
引入了一个名为CiteVQA的新基准,用于评估多模态大语言模型(MLLM)的证据归因能力。当前的文档问答(Doc-VQA)评估仅评估最终答案,忽略了模型可能引用错误来源的情况。CiteVQA要求模型在答案的同时提供元素级边界框引用,并评估两者准确性。该基准包含711个PDF文件中的1897个问题,涵盖各种领域和语言,并有一个用于生成地面真实引用(ground-truth citations)的自动化流程。测试揭示了显著的“归因幻觉”,…
-
FreshMem 为流式视频大语言模型引入脑启发式记忆
研究人员推出 FreshMem,这是一种新颖的记忆网络,旨在增强多模态大语言模型(MLLMs)的流式视频理解能力。FreshMem 受到人脑记忆过程的启发,采用频率-空间混合记忆方法来维持连续视频流中的短期细节和长期连贯性。该系统包括一个用于表示历史上下文的多尺度频率记忆模块和一个用于情景聚类的空间缩略图记忆模块,在应用于 Qwen2-VL 模型时,显著提高了在 StreamingBench 和 OV-Bench 等基准测试上的性能。
-
新流水线为大型语言模型生成多模态指令数据集
研究人员开发了UniData,一个旨在为大型语言模型生成多模态指令数据集的通用流水线。该流水线通过将简单的用户需求转化为多轮、跨多种模态的指令,解决了创建此类数据集的高昂人力成本挑战。UniData集成了任意输入输出的大型模型,并通过纠正不相关信息和利用指令轮次间的相关性来提高数据质量。为支持该流水线,还构建了一个名为UniDataset的新数据集,包含跨九种模态的20,000条条目。实验表明,UniData在数据质量方面达到了最先进…
-
新方法解决多模态AI模型中的关系幻觉问题
研究人员在多模态大语言模型(MLLMs)中发现了一种称为“视觉惯性”的现象,即模型倾向于固定在先前关注过的视觉区域,导致关系幻觉。提出了一种名为“惯性感知视觉激励”(IVE)的新解码方法,通过根据 token 级别的注意力历史动态重新校准视觉值来解决此问题。IVE 旨在区分新相关的 token 和持续存在的“惯性 token”,从而在保持各种 MLLMs 的整体多模态性能的同时,减少关系错误。
-
新的自校正方法增强了交错多模态生成
研究人员推出了一种名为自校正优化(SCO)的新型无需训练的方法,旨在增强交错图像-文本内容的生成。该方法通过在新的事件和状态保持约束下应用最小的自校正,解决了当前多模态大语言模型(MLLMs)在时间一致性和视觉主体保持方面的局限性,而无需昂贵的数据增强。SCO在基准测试中表现出显著的改进,并显示出在视频生成和机器人操作等物理基础过程中的应用潜力。
-
新的SALM框架在无需图文对的情况下提升CLIP的细粒度感知能力
研究人员开发了SALM,一个旨在增强CLIP等视觉语言模型(VLM)细粒度感知能力的新框架。SALM采用结构感知潜在掩码建模方法,在无需图文对的情况下,同时提升局部空间相关性和全局语义对齐。其扩展SALM-Self通过自蒸馏进一步优化了CLIP固有的细粒度潜力,在密集预测任务和零样本准确率方面取得了显著改进。
-
AI框架基于生物力学数据进行模态推理,以提供更好的反馈
研究人员开发了BoT-Feedback,一个旨在通过将AI模型的输出与生物力学证据相结合来改进其模态推理的新框架。该方法解决了当前系统在对人类动作提供通用或物理上不合理的反馈方面的局限性。BoT-Feedback通过逐步分析生物力学数据来提供更具可解释性和鲁棒性的指导,显著提高了反馈质量。
-
新的 Percept-V 数据集揭示 MLLM 在基本视觉感知方面存在困难
一篇新的研究论文介绍了 Percept-V,这是一个旨在测试多模态大语言模型(MLLM)基本视觉感知能力的数据集。尽管任务很简单,只需要很少的推理,但目前最先进的专有和开源 MLLM 与人类相比表现较弱。研究发现,随着图像中物体数量的增加,模型的性能会显著下降,并确定了对这些模型特别具有挑战性的特定感知技能。虽然对开源 MLLM 进行微调显示出性能提升,但这些改进并未很好地泛化到相关数据集,表明所学表示形式存在局限性。
-
VepAgent框架通过因果推理和强化学习增强视频事件预测
研究人员推出VepAgent,一个旨在通过解决当前多模态大语言模型(MLLMs)的局限性来改进视频事件预测(VEP)的新框架。VepAgent整合了因果-过渡推理与工具增强强化学习,使其能够对从观察状态到未来事件的逻辑进展进行建模。该框架使用了一个新的数据集futurebench-4K进行监督微调,并包含一个诊断工具库用于动态推理增强。在FutureBench和NEPBench数据集上的评估显示,VepAgent取得了最先进的性能,优…
-
新型攻击可从多模态AI系统中提取数据
研究人员开发了一种名为“immrag”的新方法,用于从多模态检索增强生成(MRAG)系统中提取数据。该技术在黑盒设置下运行,并将恶意指令嵌入输入图像而非文本提示中来探测系统。实验表明,immrag可以从各种场景中重建大量图像,凸显了多模态AI增强安全措施的必要性。
-
新型AI代理在正负空间图像构图方面表现出色
研究人员开发了形式与虚空代理(Form and Void Agent, FaV-A),这是一种多模态代理,旨在生成具有可控正负空间的图像。与直接提示方法不同,FaV-A采用分阶段的方法,首先创建基础对象,然后分析其空间属性以确定合适的负空间语义,最后生成图像的构图指令。与零样本多模态大型语言模型相比,该方法在生成视觉上连贯且语义上对齐的构图方面显示出更高的有效性。
-
新框架SMI增强世界模型的长期记忆 · 跟踪3个来源
研究人员推出了一种名为空间记忆智能(SMI)的新型框架,旨在增强世界模型中的长期记忆管理,特别是在长视频生成方面。SMI系统地采用理解模型来组织、稀疏化、检索和过滤空间记忆,以应对管理复杂、长距离空间上下文的挑战。该方法旨在提高记忆稀疏性、生成稳定性和空间一致性,并建立在多模态大型语言模型和统一模型概念的进步之上。
-
FORTE框架增强了MLLMs在长视频问答中的能力
研究人员开发了FORTE,一个旨在改进多模态大语言模型(MLLMs)处理长视频以进行问答任务的新框架。FORTE采用两阶段方法:自适应相关性评分和全局关键帧优化。自适应评分使用高斯过程高效预测帧相关性,平衡了探索有前景区域与探索代表性不足的时间区域的需求。优化阶段通过最大化考虑测量相关性和时间覆盖率的目标来选择最终关键帧,在基准测试中取得了卓越的准确性。
-
EAServe 采用新的编码感知架构优化多模态大语言模型服务
研究人员开发了 EAServe,一个旨在优化多模态大语言模型 (MLLM) 服务的新系统。与现有框架在 MLLM 的三阶段编码-预填充-解码 (EPD) 管道中遇到的困难不同,EAServe 将编码阶段重新定位为管道的控制点。这种方法允许自适应微批处理、动态 GPU 分区以及对共驻预填充工作程序的速率控制卸载。评估表明,EAServe 在吞吐量和 GPU 利用率方面显著优于 NVIDIA Dynamo 和 vLLM。
-
研究表明AI模型难以检测多模态假新闻 · 追踪6个来源
新研究探讨了多模态大语言模型(MLLMs)在生成和检测假新闻方面的能力和局限性。研究表明,虽然MLLMs可用于创建跨各种领域的逼真虚假社交媒体帖子,但当前的检测模型在识别图像真实性方面,其准确性常常达不到人类水平。研究人员正在开发新的框架和数据集,通过考虑生成方面和证据关系来改进检测,同时也强调了在人工智能驱动的虚假信息检测工具中,人类判断和透明设计的重要性。
-
Imagine3D-LLM 教会多模态大语言模型在回答前可视化3D场景
研究人员开发了Imagine3D-LLM,这是一种新颖的多模态大语言模型(MLLM),旨在提高从多视图图像理解3D场景的能力。与以往专注于细粒度几何的方法不同,Imagine3D-LLM通过首先组装场景的粗略3D布局来模仿人类的空间推理。这是通过附加可学习的摘要令牌来实现的,这些令牌被解码为3D高斯溅射表示,并与标准的下一个令牌预测目标联合训练。该模型在空间推理和3D理解基准测试中表现出优越的性能,表明对于MLLM来说,想象场景的布局…
-
新调查勾勒高效多模态学习图景
一篇新的调查论文系统地对高效多模态学习(EML)领域进行了分类,解决了多模态模型中的计算和内存瓶颈。它提出了一个从模型到系统的分类法,分析了三个层级(模型、算法和系统)的 300 多项工作。该论文综合了关于效率、效用和隐私之间权衡的见解,以多模态大型语言模型(MLLMs)为例,说明了该领域的演变和迈向内在高效人工智能的未来方向。
-
新方法验证多模态大语言模型中的物体声明
研究人员开发了一种名为语义空间一致性验证(SSAV)的新型无训练方法,以解决多模态大语言模型中的物体幻觉问题。该技术通过评估物体声明在不同查询下的稳定性及其在图像区域内的持续定位来验证这些声明。SSAV结合了语义支持估计和查询诱导区域验证(QIRV),以降低对措辞的敏感性并识别不可靠的物体提及。实验表明,SSAV能有效减轻幻觉,在COCO、A-OKVQA和GQA等基准测试中提高了准确性,同时在应用于LLaVA-1.5-7B等模型时降低…
-
MedSAM-3 通过文本提示和 LLM 代理增强医学图像分割
研究人员推出了 MedSAM-3,这是一款专为医学图像分割设计的新模型,它利用文本提示来精确靶向解剖结构。通过使用医学图像和概念标签对 Segment Anything Model (SAM) 架构进行微调,MedSAM-3 实现了开放词汇分割。该模型还包含一个代理框架,集成了多模态大型语言模型 (MLLM),用于复杂推理和迭代优化,在各种医学成像模式上的表现优于现有模型。