MLLMs
PulseAugur coverage of MLLMs — every cluster mentioning MLLMs across labs, papers, and developer communities, ranked by signal.
- instance of multimodal large language model 95%
- instance of Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond 90%
- instance of DagsHub 90%
- instance of alphaXiv 90%
- instance of CatalyzeX 90%
- instance of Gotit.pub 90%
- instance of Multimodal LLMs 90%
- instance of Qwen2.5-VL 90%
- developed Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond 70%
- used by DagsHub 70%
- used by Gotit.pub 70%
- used by alphaXiv 70%
- 2026-05-22 research_milestone A new pipeline was introduced to enhance MLLMs for safety-critical driving video analysis. 来源
- 2026-05-22 research_milestone Researchers reveal and propose a method to recover temporal grounding in multimodal large language models. 来源
- 2026-05-22 research_milestone A new benchmark and dataset were introduced to evaluate MLLMs' ability to reason about personality beyond superficial cues. 来源
- 2026-05-21 research_milestone A new method using MLLMs for detecting AI-generated Chinese poetry achieves state-of-the-art results. 来源
19 天有情绪数据
-
新基准Holtercare-Bench评估MLLMs在长期心电图分析方面的能力
研究人员推出Holtercare-Bench,这是一个新的多模态基准,旨在评估多模态大语言模型(MLLMs)在分析长期动态心电图(ECG)数据方面的能力。该基准建立在Holtercare-23K之上,这是一个大型数据集,包含源自临床Holter记录的信号-视频-文本对齐。初步评估表明,当前的MLLMs在超长病理性心电图序列所需的时间推理和诊断报告生成方面存在困难,尽管微调显示出显著的改进潜力。
-
新的PI3D攻击针对3D环境中的MLLM
研究人员开发了一种名为PI3D的新型提示注入攻击,专门针对在3D环境中运行的多模态大语言模型(MLLM)。该攻击涉及将带有注入文本的物理对象放置在环境中,目的是覆盖MLLM的预期任务。该方法侧重于识别合理的物体放置,以诱导MLLM执行攻击者的命令。实验表明,PI3D对各种MLLM都有效,并且目前的防御措施不足以可靠地对抗它。
-
新的MR-IQA-2框架提高了AI图像质量评估的忠实度
研究人员推出MR-IQA-2,一个旨在提高多模态大语言模型(MLLMs)在图像质量评估(IQA)中忠实度的新型框架。这种新方法将推理和评分的信用分配分开,确保模型的解释准确反映图像质量,而不是仅仅偶然预测出正确的评分。MR-IQA-2采用了一个演员-编辑-评委系统,其中编辑根据识别出的质量因素修改图像,评委则对推理提供反馈。该方法在评分一致性方面与人类评估具有竞争力,并提供了超越简单评分的更丰富的视觉理解,在图像质量优化方面具有潜在应用。
-
新的AI方法增强图表理解和编辑能力
研究人员开发了新的方法来改进多模态大型语言模型(MLLMs)理解和交互图表的方式。一种方法CharTool集成了外部工具进行视觉感知和基于代码的计算,增强了数值推理和接地能力。另一种方法REChart通过优化中间推理步骤和减轻模型的“过度思考”来专注于高效的图表编辑。这两种方法在图表相关基准测试中都显示出显著的改进,优于现有基线,并取得了与更大模型相媲美的结果。
-
新的MS-MFAD系统使用MLLM实现强大的面部反欺骗检测
研究人员开发了MS-MFAD,这是一个利用多模态大语言模型(MLLM)的新型人脸反欺骗检测系统。与传统方法不同,MS-MFAD采用细粒度的像素语义锚定机制,以确保可审计的推理并防止定位幻觉。通过标注有限数量的高质量掩码,该系统显著降低了错误率,并证明了其对抗对抗性攻击的鲁棒性,同时满足实时部署的要求。
-
新的CADP范式旨在解锁学术论文中的知识
研究人员引入了一种名为可编译学术文档解析(CADP)的新范式,以更好地表示嵌入在学术论文中的科学知识。当前的方法在保留表格、公式和伪代码等元素的结构和逻辑方面存在困难,而这些元素对于多模态大语言模型(MLLMs)至关重要。CADP使用LaTeX和可执行Python重建这些文档,从而可以直接将重建的元素与源进行验证。一个新的基准CADP-Bench已被开发出来以评估此过程,结果显示即使是先进的MLLMs在生成高保真、可执行的重建方面仍有…
-
新的 Diagram-MMU 基准测试 MLLMs 在科学图表方面的能力
一个名为 Diagram-MMU 的新基准已被开发出来,用于评估多模态大型语言模型(MLLMs)在理解和交互科学图表方面的能力。该基准在解析、编辑以及与这些图表相关的问答任务上评估 MLLMs。初步结果表明,虽然 MLLMs 展现出强大的推理能力,但在视觉基础和生成图表表示(TikZ)的代码方面存在不足。
-
新框架Zero-MELO提升MLLM微手势识别能力
研究人员开发了Zero-MELO,一个旨在提高多模态大语言模型(MLLMs)在微手势识别(MGR)方面性能的新框架。该框架通过引入一种测试时证据校准方法,解决了MLLMs在处理细粒度和以动作为中心任务方面的局限性。该方法使用树搜索机制收集局部视觉证据,并使用校准模块纠正分数偏差,与基线模型相比,在iMiGUE和MA-52等数据集上的准确性显著提高。
-
新审计方法追踪RAG系统中的内容来源
研究人员开发了一种名为源感知成员审计(SMA)的新方法,用于追踪检索增强生成(RAG)和多模态RAG系统生成内容的来源。与以往关注数据是否被记忆的方法不同,SMA能够精确指出生成内容来自预训练数据、外部检索还是用户输入。这通过使用零阶优化和利用多模态大语言模型(MLLMs)分析图像输入的跨模态技术来实现的归因估计机制来完成。
-
新型 AI 模型实现 LLM 的高效自注视视频分析
研究人员开发了 EgoGazeLite,这是一种轻量级的设备上注视预测模型,旨在提高多模态大型语言模型 (MLLM) 在处理自注视视频输入时的效率。该模型通过预测注视点来裁剪相关区域,从而减少所需视觉 Token 的数量,以降低高分辨率视频相关的计算和内存成本。与依赖专用眼动追踪硬件的先前方法不同,EgoGazeLite 作为一种纯软件解决方案运行,适用于消费级智能眼镜和智能手机。该模型在多个 MLLM 和指标上的性能已得到验证,在描…
-
新的ActFER框架实现了代理式面部表情识别
研究人员开发了ActFER,一种用于面部表情识别(FER)的新型代理式框架,它超越了被动分析。ActFER通过使用工具进行面部检测、选择性区域缩放以及推理面部动作单元(AUs)和使用视觉思维链(Chain-of-Thought)进行推理,来主动获取视觉证据。为了实现这种主动感知,开发了一种名为UC-GRPO(Utility-Calibrated GRPO)的新型强化学习算法,该算法使用基于AU的奖励和查询条件效用估计来指导模型的学习过…
-
新的GLoTran框架通过双重感知增强富文本图像翻译
研究人员推出了一种新颖的GLoTran框架,旨在提高高分辨率富文本图像的文本图像机器翻译(TIMT)的准确性和完整性。该方法采用双重感知策略,结合了图像的低分辨率全局视图和多尺度局部文本细节。为此,创建了一个名为GLoD的大规模数据集,包含超过510,000个图像-文本对。实验表明,与多模态大语言模型(MLLMs)结合使用时,GLoTran显著优于现有方法。
-
ImageNet-1k数据集重新标注,发现12%的标签错误
一篇新论文详细介绍了重新标注ImageNet-1k数据集的广泛过程,揭示了原始标签存在严重问题。研究人员发现,大约12%的标签不正确,33.3%的图像是多标签的,3.8%的图像不包含相关对象。这项名为ReImageNet的全面重新标注工作包括多标签校正、对象定位和修订的类别定义,使监督模型准确性提高了高达1.2%,多模态大模型(MLLMs)提高了5-6%。该研究表明,大规模标注需要迭代改进,并强调了人与大模型协作在实现高质量结果方面的有效性。
-
新的Act2Intention基准推动了主动移动代理的发展
研究人员推出了Act2Intention,一个旨在推动主动移动代理发展的新基准。该框架侧重于从GUI操作中推断用户意图,超越了简单的被动任务执行。Act2Intention Bench包含超过72,000个意图和700,000个操作,涵盖52个应用程序,为评估主动代理提供了一个标准化平台。实验表明,在此基准上进行微调可以显著提高意图理解、预测和执行能力。
-
新的基准Edit2TikZ揭示MLLM在科学图形编辑方面存在困难
研究人员推出了Edit2TikZ,一个旨在评估多模态大型语言模型(MLLM)使用TikZ代码编辑科学图形能力的新基准。该基准包含1,548个样本,涵盖真实世界和合成编辑,支持文本和视觉定位请求,并具有带注释的多步编辑功能。对14个主流MLLM的评估显示,当前模型在编译成功率和保留无关内容方面存在困难,专有模型仅达到75%的编译成功率。为了解决这些局限性,研究人员开发了一个名为TikZEditMix的混合训练集和课程学习方法,显著提高了…
-
新框架解决文档理解多模态大语言模型中的隐私风险
研究人员发现,专门用于文档理解的多模态大语言模型(MLLMs)存在重大的隐私漏洞。当这些模型面临不足的视觉信息时,它们可以通过依赖训练数据中记忆的关系模式来推断敏感的个人数据。为解决此问题,提出了一种新的动态关系遗忘框架(DRUF),其中包括一个关系解耦遗忘模块,用于在保持提取准确性的同时抑制相关敏感字段的泄露。还引入了一个新的基准测试 DocPrivacyBench,以系统地评估这些隐私风险,结果表明 DRUF 通过将泄露抑制率提高…
-
新的MAG框架利用无标签数据提升多模态LLM的上下文学习能力
研究人员开发了MAG,一个新颖的框架,旨在通过有效利用无标签数据来增强多模态大语言模型(MLLMs)的上下文学习能力。MAG将演示选择视为多模态图上的半监督问题,解决了显著影响MLLM性能的高质量演示选择的挑战。该框架采用两阶段过程:首先,它通过无标签数据传播相关性分数,以识别有影响力的样本进行伪标签化,从而降低计算成本。其次,它利用多模态相关性,结合视觉和文本信息,来最终确定演示选择。在八个多模态基准上的实验表明,MAG在低标签场景…
-
新的NARU基准测试MLLMs对日语视频叙事和文化的理解能力
研究人员推出了NARU,这是一个新的基准,旨在评估多模态大型语言模型(MLLMs)在理解日语长视频中的叙事演变和文化细微差别方面的能力。该基准包含基于155个视频的1,481个问题,总时长为146.8小时,涵盖了四个叙事维度和五个文化维度。其构建过程采用了基于分层记忆的注释流程,并由68名母语为日语的注释员进行了验证。初步评估表明,当前MLLMs在长距离叙事整合和基于文化的推理方面存在显著局限性。
-
新基准显示AI视频检测器在危机内容上失效
一个名为RA-Bench的新基准已被开发出来,用于评估AI生成视频检测系统的有效性,特别是在现实世界危机事件的背景下。该基准包含超过17,000个视频,显示当前检测方法在各种生成条件下难以泛化,并且随着视频在社交媒体上的传播而变得不那么可靠。研究强调了开发更强大的检测器的迫切需求,以跟上不断发展的AI视频生成技术。
-
GeoBridge通过解耦语义推理和坐标生成来改进图像地理定位
研究人员开发了GeoBridge,这是一种新颖的机制,旨在通过将语义推理与坐标生成解耦来改进图像地理定位。这种方法解决了当前预测地名方法的局限性,这些方法可能是有损的,并且会忽略详细的图像证据。GeoBridge将一个冻结的多模态大语言模型(MLLM)与一个专用解码器连接起来,在不干扰坐标生成过程的情况下注入地理先验知识。该系统在IM2GPS3K数据集上展示了改进的性能,与现有流程相比,在各种距离阈值下实现了更高的精度。