Large Multimodal Models
PulseAugur coverage of Large Multimodal Models — every cluster mentioning Large Multimodal Models across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新基准UnifiedAttack针对LMM在有害图像-文本生成中的安全性
研究人员开发了UnifiedAttack,这是一个新的基准,用于评估大型多模态模型(LMM)在通过协调文本和图像模态生成有害内容时的安全性。该方法旨在识别超出单个模态威胁总和的风险。该基准包括合成的虚假信息查询和一个采用上下文重塑(ICR)和认知规划注入(CPI)的框架,通过操纵模型的推理过程来绕过安全过滤器。对当前LMM架构的评估表明,UnifiedAttack可以系统地利用模型的有用性和连贯性进行有害生成,这凸显了对逻辑感知防御的需求。
-
RegRet框架增强大型多模态模型中的区域级检索
研究人员推出RegRet,一个旨在改进大型多模态模型(LMMs)中区域级检索的新框架。该方法侧重于增强图像内详细区域特征的捕获,同时保持整体的全局检索性能。RegRet利用区域感知编码器和多阶段训练流程,包括本地化字幕和区域对比学习。为了解决现有基准测试的局限性,还开发了REGMB基准,该基准包含跨四个任务的22.5万个对比对。
-
新的LogiScope-VQA基准显示,在工业危险识别方面,大型多模态模型(LMMs)的表现落后于人类
一个名为LogiScope-VQA的新基准数据集已被开发出来,用于评估大型多模态模型(LMMs)在工业环境中识别物流危险的能力。该数据集包含图像、视频和视觉问答(VQA)对,并被用于测试GPT-5.5、Gemini-3.1 Pro和Claude Opus 4.7等知名模型。实验表明,这些先进模型在危险识别的感知、理解和推理方面仍未达到人类水平,凸显了显著的改进空间以及阻碍实际部署的安全偏见。
-
新基准测试AI在反事实视频中的社交推理能力
研究人员推出了SocialReasonBench,这是一个新的视频问答基准,旨在评估大型多模态模型(LMMs)的社交推理能力。该基准利用了游戏《底特律:变人》中的反事实叙事视频,玩家的选择会导致不同的社交结果。SocialReasonBench评估七个推理维度,包括意图识别、情感共情和反事实推理,结果显示当前的LMMs在基本的社交理解方面表现良好,但在更复杂的原因和反事实场景方面存在困难。
-
新的ImgCoder框架生成科学准确的图像以供AI推理
一篇新的研究论文介绍了一个名为ImgCoder的框架,该框架旨在生成科学准确的图像,解决了当前文本到图像模型常生成视觉上合理但逻辑上不正确的输出的局限性。该研究提出了SciGenBench用于评估合成图像的科学严谨性,并证明了使用这些高保真图像对大型多模态模型(LMMs)进行微调可以显著提高它们的推理能力,这与基于文本的AI的进步类似。
-
新的 MedReaMM 基准揭示大型多模态模型在临床诊断方面存在困难
研究人员推出了 MedReaMM,这是一个旨在评估大型多模态模型(LMM)在临床环境中诊断综合能力的新基准。与之前侧重于孤立文本或视觉任务的基准不同,MedReaMM 整合了患者病史和多张医学影像,以评估鉴别诊断的准确性。该基准包含 625 个专家验证的病例,结果显示,在接受评估的 23 个 LMM 中,大多数的诊断准确率低于 50%,这凸显了它们在执行专家级临床推理能力方面存在的显著差距。
-
ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力
研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Grou…
-
新的强化学习框架推进3D点云质量评估
研究人员推出PCQA-R1,一个新颖的无参考3D点云质量评估强化学习框架。该系统利用链式思考数据集和高斯邻近奖励来提高跨不同数据集和评分尺度的泛化能力。实验表明,PCQA-R1在跨数据集泛化方面达到了最先进水平,并在域内准确性方面具有竞争力。
-
新的Latent-OPD方法增强了LMM在帧高效视频推理方面的能力
研究人员推出了一种新方法Latent-OPD,用于提高大型多模态模型(LMM)在视频推理方面的效率。该技术通过引入轨迹级潜在蒸馏来增强On-Policy Distillation(OPD),专注于推理轨迹末端的隐藏状态,以更好地捕捉累积的视觉证据。一种渐进式教师前瞻策略进一步将学生模型层与更深的教师层对齐。在六个视频推理基准上的实验表明,Latent-OPD的性能显著优于标准的仅输出OPD,尤其是在帧数有限、视频长或证据聚合任务复杂的…
-
新框架增强了密集体育视频分析的AI推理能力
研究人员开发了SportsGrounder,一个旨在提高大型多模态模型(LMMs)在分析密集体育视频时的推理能力的新框架。该框架通过引入领域引导的对象提案和交错式地面化融合机制,解决了区分视觉上相似的实体(如穿着相同队服的球员或球)的挑战。这种方法将显式的边界框坐标与隐式的视觉语义相结合,在不增加过多序列长度的情况下保持时间对齐。此外,还采用了一个动作感知监督模块,以确保模型学习准确的运动表示,减少对文本偏见的依赖,并使用混合偏好优化…
-
新的ReGraph框架使LMM能够从食物图像生成结构化食谱图
研究人员推出了ReGraph,这是一个新颖的数据集和框架,旨在使大型多模态模型(LMM)能够从食物图像生成结构化食谱图。该方法旨在明确表示食材、烹饪动作和工具,以及它们的状态变化和过程依赖关系,超越了简单的文本食谱生成。实验表明,虽然当前的LMM在生成合理的文本方面表现出色,但它们在捕捉准确生成图所需的详细过程知识方面存在困难,突出了食材状态捕捉是一个关键挑战。
-
开源多模态搜索代理POINTS-Seeker解决了上下文限制问题
研究人员推出了POINTS-Seeker,这是一种开源多模态搜索代理,旨在克服当前大型多模态模型(LMM)的局限性。该系统解决了从头开始培养搜索代理和在长时间交互中管理上下文爆炸的挑战。它采用了一种Agentic Seeding训练方法来引导工具使用和规划,以及一种V-Fold记忆管理机制,该机制将最近的交互保存为文本,同时将过时的上下文编码到视觉空间中以避免令牌冗余。由此产生的POINTS-Seeker-8B模型在其规模上展示了多模…
-
新框架使用LMM纠正视觉物种识别错误
一篇新研究论文提出了一个名为事后纠错(POC)的框架,以提高视觉物种识别(VSR)的准确性。研究发现,虽然大型多模态模型(LMM)在VSR方面的表现不如专家少样本学习(FSL)模型,但它们可以有效地纠正这些专家模型所犯的错误。POC框架利用LMM来优化FSL模型的预测,在五个VSR基准测试中,无需额外训练即可将准确率平均提高6.4个百分点。
-
新的VVM-Tuning框架增强了大型多模态模型在未见过的视觉模态上的能力
研究人员开发了一个名为VVM-Tuning的新训练框架,以增强大型多模态模型(LMMs)在各种视觉模态上的泛化能力。该方法从RGB场景合成各种视觉外观,以帮助模型将不变的语义信息与特定于模态的特征分离开来。通过在提示中引入模态上下文并使用指令调优,该框架使LMMs能够以零样本方式适应未见的模态。为了评估这种方法,研究团队创建了VVM-Bench,这是一个包含六种真实和合成模态的基准测试,并在几个测试模型上展示了语义感知和模态理解方面的显著改进。
-
新的HART技术使大型多模态模型(LMM)能够在无标注的情况下对高分辨率图像进行推理
研究人员开发了一种名为HART(High-resolution Annotation-free Reasoning Technique,高分辨率无标注推理技术)的新技术,以改进大型多模态模型(LMM)处理高分辨率图像的方式。当前LMM在处理高分辨率图像生成的大量token时遇到困难,通常需要昂贵的人工标注来识别重要区域。HART采用闭环框架和一种称为AP-GRPO的策略优化方法,使LMM能够在没有外部监督的情况下自我验证关键区域。在多…
-
CarbonCLIP 使用 LMMs 改进基于卫星的碳排放预测
研究人员开发了 CarbonCLIP,一个旨在提高卫星图像碳排放预测准确性的新框架。该方法集成了街景语义和时间上下文,弥合了自上而下的卫星视图与地面人类活动之间的差距。通过利用大型多模态模型 (LMMs) 从街景数据生成语义先验并纳入月度排放变化,CarbonCLIP 为城市碳建模提供了强大的解决方案。在北京和新加坡进行的实验表明,CarbonCLIP 的性能优于现有方法,即使在推理期间地面数据不可用时,也提供了可扩展的部署选项。
-
CAIRN模型推进多房间三维场景理解
研究人员推出CAIRN,这是一种新颖的拓扑感知大型多模态模型,用于理解复杂的多房间三维场景。与以往仅限于单房间的模型不同,CAIRN明确地推理物体关系和房间连通性。它通过集成图神经网络和学习到的房间令牌来实现这一点,从而实现尊重场景拓扑的层次化注意力。CAIRN在新推出的CAIRN-MR基准上进行了评估,在多房间任务上展示了比现有3D-LLM显著的性能提升。
-
新方法增强多模态工业异常检测 · 已追踪2个来源
研究人员开发了两种不同的方法来改进多模态工业异常检测。第一种方法,调谐反向蒸馏(TRD),利用多分支设计和跨模态调谐器来增强正常特征的学习,同时有效检测不同模态的异常。第二种方法,全球逻辑与局部搜索(GLLS),是一个无训练框架,利用大型多模态模型和蒙特卡洛树搜索进行可验证的异常检测,在推理上下文中组织参考和规范。这两种方法都旨在推进工业环境中识别缺陷的最新技术水平。
-
新的基准和数据集推动音频、图像和视频的深度伪造检测
研究人员推出了几个新的数据集和基准,旨在改进跨各种媒体的深度伪造检测。Echoes 专注于音乐深度伪造,强调语义对齐和提供商多样性,以创建更强大的检测模型。VendorBench-100 提供了一个统一的框架,用于评估商业 API、视觉语言模型和开源检测器中的深度伪造图像检测,突出了性能差异和指标分歧。HumanForge 采用以人为中心的方法来检测深度伪造视频,使用多代理管道进行注释,并专注于人与物体以及人与人之间的交互。此外,…
-
New Regularizer Enhances Taxonomic Knowledge in Large Multimodal Models
研究人员开发了一种名为分层表示正则化($HiR^2$)的新方法,以提高大型多模态模型(LMMs)的分类知识。当前的LMMs通常缺乏对概念之间语义关系的理解,导致在分层视觉识别方面存在不一致。$HiR^2$引入了一个语义感知的视觉树构建框架,该框架从中间LLM层提取特征。该正则化器包括一个分类蕴含损失和一个判别性分散损失,以强制执行分层一致性并促进相似嵌入的分离。