MLLMs
PulseAugur coverage of MLLMs — every cluster mentioning MLLMs across labs, papers, and developer communities, ranked by signal.
- instance of Multimodal LLMs 95%
- instance of multimodal large language model 95%
- instance of alphaXiv 90%
- instance of Gotit.pub 90%
- instance of CatalyzeX 90%
- instance of Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond 90%
- instance of DagsHub 90%
- instance of Qwen2.5-VL 90%
- instance of ScienceCast 70%
- developed Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond 70%
- used by DagsHub 70%
- used by alphaXiv 70%
- 2026-05-22 research_milestone A new pipeline was introduced to enhance MLLMs for safety-critical driving video analysis. 来源
- 2026-05-22 research_milestone Researchers reveal and propose a method to recover temporal grounding in multimodal large language models. 来源
- 2026-05-22 research_milestone A new benchmark and dataset were introduced to evaluate MLLMs' ability to reason about personality beyond superficial cues. 来源
- 2026-05-21 research_milestone A new method using MLLMs for detecting AI-generated Chinese poetry achieves state-of-the-art results. 来源
13 天有情绪数据
-
新的攻击方法提高了闭源多模态大语言模型的对抗可迁移性
研究人员开发了一种名为IAU-FOA的新方法,以提高对抗性攻击对闭源多模态大语言模型(MLLMs)的有效性。该技术通过在全局和局部层面进行特征对齐来增强对抗性样本的可迁移性,解决了先前主要使用全局图像级特征的方法的局限性。IAU-FOA结合了置信度自适应不平衡传输进行细粒度特征对齐,以及视觉不变性增强,以确保对抗性扰动能够跨不同的视觉编码器泛化,在性能上优于现有方法。
-
GPT-6 在医学图像对齐评估中展示了先进的视觉推理能力
一篇新的 arXiv 论文通过测试前沿多模态大语言模型(MLLMs)评估医学图像对齐的能力,来探索它们在通用视觉推理方面的能力。研究发现,尽管几个月前发布的模型表现不佳,GPT-6 在各种场景下准确率超过了 85%。特定任务的微调模型在训练过的任务上可以媲美或超越前沿模型,但在泛化到未见过的设置方面表现有限。这项研究表明,MLLMs 在视觉评估方面正接近一个可以整合到医学成像流程中的水平。
-
新基准AVMeme Exam揭示大型语言模型在文化背景理解方面存在困难
研究人员推出了AVMeme Exam,这是一个新的基准,旨在测试多模态大型语言模型(MLLMs)对视听内容中文化背景的理解能力。该基准包含一千多个互联网迷因(meme)及其相关的问答,评估从基本内容到细微文化理解的掌握程度。初步评估显示,当前的多模态大型语言模型在无文本音乐和音效方面存在困难,并且与人类表现相比,在上下文和文化推理方面表现出局限性。
-
VisionWeave 使多模态大语言模型能够自适应地分配视觉表示,节省 token 并提高性能
研究人员开发了 VisionWeave,一种用于多模态大语言模型(MLLMs)的新方法,该方法允许它们根据内容自适应地分配视觉表示。这种方法与当前使用固定大小 token 的方法形成对比,后者可能导致细节丢失。VisionWeave 结合了门控空间池化器和粒度路由器,以实现内容自适应粒度和提高效率。在 Qwen3.5-4B 上进行测试并扩展到 Qwen3.8-27B 后,VisionWeave 在八个基准测试中平均节省了 43% 的 …
-
新框架AssemState提升MLLM在家具组装方面的空间推理能力
研究人员开发了AssemState,一个新颖的零样本框架,旨在提高多模态大语言模型(MLLMs)在家具组装等任务中进行3D空间推理的能力。该框架将组装手册分解为单个部件操作,并使用迭代反馈来优化6D姿态更新,通过模拟验证物理可行性。虽然AssemState与先前方法相比显著提高了组装树恢复和部件级操作的准确性,但它也凸显了MLLMs在精确空间关系推理方面持续存在的局限性。
-
研究发现 MLLM 的融合路径因架构而异
研究人员分析了多模态大语言模型 (MLLM) 的内部融合路径,区分了拼接和原生多模态架构。他们的研究表明,拼接模型倾向于先处理文本再整合视觉信息,而原生模型则表现出视觉和文本信息之间更早的协同适应。这项研究提供了对多模态融合在这些模型中如何发生的机制性理解,支持了面向架构的诊断。
-
新的 Percept-V 数据集揭示 MLLM 在基本视觉感知方面存在困难
一篇新的研究论文介绍了 Percept-V,这是一个旨在测试多模态大语言模型(MLLM)基本视觉感知能力的数据集。尽管任务很简单,只需要很少的推理,但目前最先进的专有和开源 MLLM 与人类相比表现较弱。研究发现,随着图像中物体数量的增加,模型的性能会显著下降,并确定了对这些模型特别具有挑战性的特定感知技能。虽然对开源 MLLM 进行微调显示出性能提升,但这些改进并未很好地泛化到相关数据集,表明所学表示形式存在局限性。
-
新方法揭示MLLMs中的认知不确定性
研究人员开发了一种名为因果不变掩码(Causal-Invariant Masking, CIM)的新方法,以更好地量化多模态大型语言模型(MLLMs)中的认知不确定性。该方法旨在通过区分数据歧义引起的不确定性与模型局限性引起的不确定性来解决MLLMs产生幻觉的问题。提出的语义散度(Semantic Divergence)指标及其更快的代理指标预期嵌入漂移(Expected Embedding Drift, EED)在各种基准测试中均表…
-
新框架提升MLLM处理长视频的效率 · 跟踪3个来源
研究人员开发了新的方法来提高多模态大型语言模型(MLLMs)在处理长视频时的效率。FORTE 使用自适应评分和高斯过程来选择与问题相关的帧,平衡预测的相关性与时间覆盖范围。视频证据索引(VEI)采用一种策略,利用视频预览和特权自蒸馏来学习定位相关时刻并规划预算分配。FocusGraph 利用场景图 LLM 选择器和图结构帧选择来识别具身智能体的关键帧,降低推理成本。
-
新的GPEC方法以最小的开销增强了LLM心脏视频字幕生成
研究人员开发了GPEC,一种新颖的方法,用于增强多模态大型语言模型(MLLM)在心脏视频字幕生成等专业领域的性能。GPEC通过在LLM之前插入一个校正层来工作,该校正层优化视觉表示,使其更好地与结构化视频注释对齐。这种方法在最近的arXiv论文中有所详细介绍,它以最小的计算开销提高了字幕的相似性和内容准确性,避免了对VideoChat2等现有模型进行端到端微调的需要。
-
新的MWOP技术通过定向剪枝提升MLLM效率
研究人员开发了一种名为“模态感知宽度操作剪枝”(MWOP)的新方法,以提高多模态大语言模型(MLLM)的效率。MWOP通过独立剪枝视觉到视觉、文本到视觉和文本到文本的注意力路径,并分别选择视觉和文本输入的FFN通道,来解决注意力头和前馈网络(FFN)通道内的冗余问题。这种方法在保留令牌序列的同时减少了计算量,从而显著加快了速度。在LLaVA-OneVision-7B上,MWOP单独实现了1.6倍的预填充速度提升,且性能损失极小;与令牌…
-
新型AI代理通过分阶段的正负空间生成来改进图像构图
研究人员开发了Form and Void Agent (FaV-A),这是一种多模态代理,旨在通过专门处理正空间和负空间的生成来改进图像构图。与多模态大型语言模型 (MLLM) 的直接提示方法不同,FaV-A 采用分阶段的方法。它首先生成一个基础对象,然后分析其结构以确定潜在的负空间语义,最后为图像生成阶段创建指令。与零样本 MLLM 基线相比,该方法在生成视觉上连贯且语义上一致的构图方面显示出更有效的结果。
-
新的基准和框架解决了长视频中的情感理解问题
研究人员推出了LongEmoBench,这是一个旨在评估长视频中情感理解和推理能力的新基准。他们还提出了LongEmo,一个新颖的、增强记忆的代理框架,该框架构建了一个事件记忆图来模拟离散事件之间的长距离依赖关系和情感动态。评估表明,现有方法在长视频情感分析方面存在困难,而LongEmo取得了最先进的性能,突显了其以事件为中心的记忆架构的有效性。
-
新框架通过分解任务来诊断 MLLM 故障
研究人员开发了一个名为 CADET 的新框架,用于诊断多模态大语言模型 (MLLM) 中的故障。该框架将复杂任务分解为更小的单元,从而能够区分源于内在能力缺陷的错误与源于先决条件依赖的级联错误。通过分析这些因果关系,CADET 可以精确地找出 MLLM 挣扎的具体领域,揭示出端到端准确性指标无法显现的模式。研究表明,纠正先决条件错误可以显著提高性能,尤其是在认知任务上,并确定了几个关键的先决条件,解决这些先决条件可以带来巨大的收益。
-
新基准测试评估多模态大语言模型从密集图表中重建数值数据的能力
一项新的基准测试 ChartDensity-Bench 被引入,用于评估多模态大语言模型(MLLMs)从科学图表中重建数值数据的能力,特别是在高视觉密度条件下。该基准测试系统地改变了同时呈现的图表数量,以评估模型在结构可靠性、完整性、可解析性和数值保真度等方面的性能。初步实验表明,增加视觉密度通常会降低数值重建的准确性,并且不同 MLLMs 之间存在显著差异。
-
新的PhysElite基准揭示多模态大型语言模型在奥赛级物理方面存在困难
研究人员推出了PhysElite,这是一个旨在评估多模态大型语言模型(MLLMs)物理问题解决能力的新基准。该基准包含11,586个奥赛级物理问题,配有视觉图表、中文和英文的逐步解决方案以及最终答案。对18种不同MLLMs的初步测试显示,即使是表现最好的模型准确率也仅为33.7%,这凸显了当前人工智能模型在专家级物理推理方面仍有很大的改进空间。评估还包括了步骤级分析,以 pinpoint 模型在推理链中具体薄弱的环节。
-
研究表明AI模型难以检测多模态假新闻 · 追踪6个来源
新研究探讨了多模态大语言模型(MLLMs)在生成和检测假新闻方面的能力和局限性。研究表明,虽然MLLMs可用于创建跨各种领域的逼真虚假社交媒体帖子,但当前的检测模型在识别图像真实性方面,其准确性常常达不到人类水平。研究人员正在开发新的框架和数据集,通过考虑生成方面和证据关系来改进检测,同时也强调了在人工智能驱动的虚假信息检测工具中,人类判断和透明设计的重要性。
-
ThinkV2V框架通过MLLM推理增强视频编辑功能 · 跟踪到2个来源
研究人员推出ThinkV2V,一个旨在通过利用多模态大语言模型(MLLMs)的推理能力来增强指令引导视频编辑的新框架。与先前主要将MLLMs用作语义编码器的方法不同,ThinkV2V在视觉生成之前显式激活MLLM的“思考”,将对视频和指令的推理转化为精炼的编辑条件信号。该框架采用了专门的训练和推理策略,包括渐进式课程训练和推理时思考扩展,以提高复杂编辑任务的性能。该框架还附带了用于评估的ThinkV2V-150K数据集和ThinkV2…
-
Hugging Face论文:无编码器多模态模型在大规模下展现潜力
Hugging Face的一篇新论文探讨了无编码器多模态大语言模型(MLLMs)的潜力。研究表明,移除传统的视觉编码器可以将最优计算分配转移到更大的模型上,并表明无编码器架构可以在大约10^22 FLOPs时赶上基于编码器的模型。研究还发现,在没有专用视觉编码器的情况下,语言模型本身会适应并承担这一角色,并且在更大规模下收益会增加。
-
AI 研究探索用于模型改进的 On-Policy Distillation,同时 OpenAI 回应数据提取尝试
多篇研究论文探讨了用于改进 AI 模型(尤其是在推理和多模态任务中)的 On-Policy Distillation (OPD) 技术。OpenAI 报告称,其已挫败了一场试图提取其模型推理能力的活动,这凸显了加强防御以对抗对抗性蒸馏的必要性。arXiv 论文介绍了新颖的 OPD 方法,例如用于空间引导的多模态学习的 Where-OPD、用于结构化策略的 Iterative Policy Refinement、用于残差目标控制的 Re…