Large Multimodal Models
PulseAugur coverage of Large Multimodal Models — every cluster mentioning Large Multimodal Models across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力
研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Grou…
-
新的强化学习框架推进3D点云质量评估
研究人员推出PCQA-R1,一个新颖的无参考3D点云质量评估强化学习框架。该系统利用链式思考数据集和高斯邻近奖励来提高跨不同数据集和评分尺度的泛化能力。实验表明,PCQA-R1在跨数据集泛化方面达到了最先进水平,并在域内准确性方面具有竞争力。
-
新的Latent-OPD方法增强了LMM在帧高效视频推理方面的能力
研究人员推出了一种新方法Latent-OPD,用于提高大型多模态模型(LMM)在视频推理方面的效率。该技术通过引入轨迹级潜在蒸馏来增强On-Policy Distillation(OPD),专注于推理轨迹末端的隐藏状态,以更好地捕捉累积的视觉证据。一种渐进式教师前瞻策略进一步将学生模型层与更深的教师层对齐。在六个视频推理基准上的实验表明,Latent-OPD的性能显著优于标准的仅输出OPD,尤其是在帧数有限、视频长或证据聚合任务复杂的…
-
新框架增强了密集体育视频分析的AI推理能力
研究人员开发了SportsGrounder,一个旨在提高大型多模态模型(LMMs)在分析密集体育视频时的推理能力的新框架。该框架通过引入领域引导的对象提案和交错式地面化融合机制,解决了区分视觉上相似的实体(如穿着相同队服的球员或球)的挑战。这种方法将显式的边界框坐标与隐式的视觉语义相结合,在不增加过多序列长度的情况下保持时间对齐。此外,还采用了一个动作感知监督模块,以确保模型学习准确的运动表示,减少对文本偏见的依赖,并使用混合偏好优化…
-
新的ReGraph框架使LMM能够从食物图像生成结构化食谱图
研究人员推出了ReGraph,这是一个新颖的数据集和框架,旨在使大型多模态模型(LMM)能够从食物图像生成结构化食谱图。该方法旨在明确表示食材、烹饪动作和工具,以及它们的状态变化和过程依赖关系,超越了简单的文本食谱生成。实验表明,虽然当前的LMM在生成合理的文本方面表现出色,但它们在捕捉准确生成图所需的详细过程知识方面存在困难,突出了食材状态捕捉是一个关键挑战。
-
开源多模态搜索代理POINTS-Seeker解决了上下文限制问题
研究人员推出了POINTS-Seeker,这是一种开源多模态搜索代理,旨在克服当前大型多模态模型(LMM)的局限性。该系统解决了从头开始培养搜索代理和在长时间交互中管理上下文爆炸的挑战。它采用了一种Agentic Seeding训练方法来引导工具使用和规划,以及一种V-Fold记忆管理机制,该机制将最近的交互保存为文本,同时将过时的上下文编码到视觉空间中以避免令牌冗余。由此产生的POINTS-Seeker-8B模型在其规模上展示了多模…
-
新框架使用LMM纠正视觉物种识别错误
一篇新研究论文提出了一个名为事后纠错(POC)的框架,以提高视觉物种识别(VSR)的准确性。研究发现,虽然大型多模态模型(LMM)在VSR方面的表现不如专家少样本学习(FSL)模型,但它们可以有效地纠正这些专家模型所犯的错误。POC框架利用LMM来优化FSL模型的预测,在五个VSR基准测试中,无需额外训练即可将准确率平均提高6.4个百分点。
-
新的VVM-Tuning框架增强了大型多模态模型在未见过的视觉模态上的能力
研究人员开发了一个名为VVM-Tuning的新训练框架,以增强大型多模态模型(LMMs)在各种视觉模态上的泛化能力。该方法从RGB场景合成各种视觉外观,以帮助模型将不变的语义信息与特定于模态的特征分离开来。通过在提示中引入模态上下文并使用指令调优,该框架使LMMs能够以零样本方式适应未见的模态。为了评估这种方法,研究团队创建了VVM-Bench,这是一个包含六种真实和合成模态的基准测试,并在几个测试模型上展示了语义感知和模态理解方面的显著改进。
-
新的HART技术使大型多模态模型(LMM)能够在无标注的情况下对高分辨率图像进行推理
研究人员开发了一种名为HART(High-resolution Annotation-free Reasoning Technique,高分辨率无标注推理技术)的新技术,以改进大型多模态模型(LMM)处理高分辨率图像的方式。当前LMM在处理高分辨率图像生成的大量token时遇到困难,通常需要昂贵的人工标注来识别重要区域。HART采用闭环框架和一种称为AP-GRPO的策略优化方法,使LMM能够在没有外部监督的情况下自我验证关键区域。在多…
-
CarbonCLIP 使用 LMMs 改进基于卫星的碳排放预测
研究人员开发了 CarbonCLIP,一个旨在提高卫星图像碳排放预测准确性的新框架。该方法集成了街景语义和时间上下文,弥合了自上而下的卫星视图与地面人类活动之间的差距。通过利用大型多模态模型 (LMMs) 从街景数据生成语义先验并纳入月度排放变化,CarbonCLIP 为城市碳建模提供了强大的解决方案。在北京和新加坡进行的实验表明,CarbonCLIP 的性能优于现有方法,即使在推理期间地面数据不可用时,也提供了可扩展的部署选项。
-
CAIRN模型推进多房间三维场景理解
研究人员推出CAIRN,这是一种新颖的拓扑感知大型多模态模型,用于理解复杂的多房间三维场景。与以往仅限于单房间的模型不同,CAIRN明确地推理物体关系和房间连通性。它通过集成图神经网络和学习到的房间令牌来实现这一点,从而实现尊重场景拓扑的层次化注意力。CAIRN在新推出的CAIRN-MR基准上进行了评估,在多房间任务上展示了比现有3D-LLM显著的性能提升。
-
新方法增强多模态工业异常检测 · 已追踪2个来源
研究人员开发了两种不同的方法来改进多模态工业异常检测。第一种方法,调谐反向蒸馏(TRD),利用多分支设计和跨模态调谐器来增强正常特征的学习,同时有效检测不同模态的异常。第二种方法,全球逻辑与局部搜索(GLLS),是一个无训练框架,利用大型多模态模型和蒙特卡洛树搜索进行可验证的异常检测,在推理上下文中组织参考和规范。这两种方法都旨在推进工业环境中识别缺陷的最新技术水平。
-
新的基准和数据集推动音频、图像和视频的深度伪造检测
研究人员推出了几个新的数据集和基准,旨在改进跨各种媒体的深度伪造检测。Echoes 专注于音乐深度伪造,强调语义对齐和提供商多样性,以创建更强大的检测模型。VendorBench-100 提供了一个统一的框架,用于评估商业 API、视觉语言模型和开源检测器中的深度伪造图像检测,突出了性能差异和指标分歧。HumanForge 采用以人为中心的方法来检测深度伪造视频,使用多代理管道进行注释,并专注于人与物体以及人与人之间的交互。此外,…
-
New Regularizer Enhances Taxonomic Knowledge in Large Multimodal Models
研究人员开发了一种名为分层表示正则化($HiR^2$)的新方法,以提高大型多模态模型(LMMs)的分类知识。当前的LMMs通常缺乏对概念之间语义关系的理解,导致在分层视觉识别方面存在不一致。$HiR^2$引入了一个语义感知的视觉树构建框架,该框架从中间LLM层提取特征。该正则化器包括一个分类蕴含损失和一个判别性分散损失,以强制执行分层一致性并促进相似嵌入的分离。
-
新框架SAYRE合成数据以提升多模态KIE模型
研究人员开发了SAYRE,一个用于合成训练数据以提高大型多模态模型(LMMs)关键信息提取(KIE)能力的新框架。这种场景感知的合成方法从示例文档中生成文档-模式-标注三元组,捕捉内容模式和布局约定。SAYRE还结合了错误驱动生成,以基于真实世界的失败案例创建具有挑战性的训练示例。实验表明,SAYRE显著增强了Qwen3-VL等模型,提高了性能,特别是在设备端LMMs和开放类别提取任务上。
-
SenseNova-Vision 将计算机视觉任务统一为多模态生成 · 跟踪 6 个来源
研究人员开发了 SenseNova-Vision,一个统一的多模态模型,它将所有计算机视觉任务视为生成问题。这种方法使用自然语言指令和视觉提示来指定任务,允许模型生成文本、图像或两者的组合。该模型在新创建的 SenseNova-Vision Corpus 上进行了训练,在检测、分割和姿态估计等广泛的视觉任务上的性能与专用系统相当。这项工作表明,统一的多模态生成是一种可扩展的方法,可以将各种计算机视觉能力集成到通用基础模型中,并且该模型…
-
新的vLLM流水线统一音频生成与理解
研究人员开发了一种利用vLLM统一音频理解和生成任务的新型推理流水线。该系统解决了高吞吐量多模态生成所面临的挑战,特别是对于采用复杂解码策略(如AR+NAR或多令牌预测)的语音语言模型。该流水线集成了片上声学解码器,用于端到端波形合成,并通过联合调度条件和无条件请求来优化无分类器引导,从而将吞吐量维持在非CFG吞吐量的约80%。
-
新的AI框架通过先进的记忆和推理能力解决长视频理解问题
研究人员正在开发先进的框架,以改进AI模型理解和推理长视频的方式。例如,Homer使用分层记忆系统,按时间因果联系组织信息,在M3-Bench-robot等基准测试中表现优于现有方法。Latent-VC通过在解码器中保留视觉记忆来解决“视觉锚定衰减”问题,从而实现更准确、更简洁的视频推理。EGAgent采用实体场景图和代理规划来实现以自我为中心的视频理解,而Light-Omni则提供了一种具有双重上下文状态以实现高效处理的反射式、轻量…
-
新的HarmVideoBench评估大型语言模型对细微有害视频的理解能力 · 跟踪2个来源
研究人员推出了HarmVideoBench,这是一个旨在评估大型视觉语言模型(LVLMs)有害视频理解能力的新基准。现有的基准通常将有害内容过度简化为二元分类,并且缺乏解释性理由,导致评估结果不透明。HarmVideoBench通过提供一个多层次的诊断方法,包含1,379个视频和4,137个多项选择题,来评估模型在可观察证据、剪辑内部含义和剪辑外推理方面的能力,从而解决了这些局限性。该基准还引入了BCR方法,通过预测推理边界并动态检索…
-
新的大模型“PreciseDoc”提高了文档元素定位的准确性
研究人员开发了PreciseDoc,这是一种新开发的大多模态模型(LMM),旨在提高在文档中精确定位特定元素的能力。现有模型在文本密集型文档图像的精确局部化方面存在困难,阻碍了可靠的推理。PreciseDoc通过使用专门构建的训练数据(包括具有细粒度坐标元数据的合成文档)来解决这个问题,并采用视觉定位推理与强化学习的联合训练范式。评估表明,它在文档空间定位和理解任务方面表现更优。