multimodal large language model
PulseAugur coverage of multimodal large language model — every cluster mentioning multimodal large language model across labs, papers, and developer communities, ranked by signal.
- instance of CatalyzeX 90%
- instance of Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond 90%
- uses text-to-video generation 90%
- used by DagsHub 70%
- used by ScienceCast 70%
- used by Gotit.pub 70%
- used by alphaXiv 70%
- used by CatalyzeX 70%
- instance of DagsHub 70%
- developed text-to-video generation 50%
20 天有情绪数据
-
新管线使用冻结的LLM进行微动作理解
研究人员开发了一种新颖的、无需训练的微动作理解管线,微动作是指可以揭示情绪和心理状态的细微身体动作。该系统使用冻结的多模态大语言模型(MLLM)构建,动态地将子任务路由到专门的判别式或生成式MLLM。该管线在MAC~2026微动作挑战赛的细粒度理解赛道上获得第一名,在开放式描述和推理任务上显著优于其他方法。
-
新的Vis-Poison攻击通过污染图像来破坏多模态AI
研究人员开发了一种名为Vis-Poison的新型攻击方法,该方法通过污染视觉数据本身来损害多模态检索增强生成(RAG)系统。此攻击通过将恶意内容直接嵌入图像中,而不改变相关的文本(如标题或元数据),从而绕过了传统防御。Vis-Poison在黑盒环境下针对大型知识库的成功率从40.16%到65.40%不等,即使是仅能从其参数知识中回答的模型也有效。
-
面向多模态大语言模型的新训练方法,仅聚焦于投影仪
研究人员开发了一种名为“Projector Is All You Train”的多模态大语言模型(MLLMs)新训练方法。该方法仅训练连接语言模型主干和特定模态编码器的投影仪组件,而不是对整个主干进行微调。在3D MLLMs上的实验表明,这种仅训练投影仪的方法可以实现强大的多模态性能,避免损害现有的语言模型能力,并且与联合训练方法相比,训练样本吞吐量大约提高一倍。研究结果在各种语言模型主干以及3D分类、字幕生成和推理基准测试中得到了验证。
-
UMER框架统一嵌入和排序以实现多模态检索
研究人员推出UMER,一个旨在统一嵌入和排序以实现通用多模态检索任务的新框架。该方法采用感知对的判别性推理,通过对比查询-候选对来识别相关的匹配和差异证据,这与以往孤立推理的方法不同。UMER在一个多模态大语言模型(MLLM)中联合学习用于高效全局匹配的对比嵌入和用于成对相关性判断的判别性排序。该框架在MMEB-V2基准测试中展示了最先进的性能。
-
新工具Molmo2Fish使用LLM进行交互式鱼类追踪校正
研究人员开发了Molmo2Fish,一个使用多模态大型语言模型来校正不完美的计算机视觉鱼类追踪预测的交互式工具。这种方法允许进行对话式校正工作流程,提高了生态数据集中鱼类追踪的准确性。虽然Molmo2Fish在鱼类追踪和追踪校正方面表现出高性能,但仍需进一步开发以增强其自然语言指导能力。
-
多模态大语言模型被用于审计跨国TikTok有害内容
一篇新发表在arXiv上的研究详细介绍了一种使用多模态大语言模型(MLLMs)审计TikTok有害内容暴露情况的方法。研究人员发现,在分析视频帧和文本时,Gemini 2.5 Flash在所测试的LLMs中表现最佳。该研究在法国、意大利和瑞典的不同年龄组中使用了代理账户,揭示与被动浏览相比,关键词搜索显著提高了有害内容的检测率,尽管这种效果是暂时的。在被动浏览条件下,意大利所有年龄段的有害内容暴露率最高。
-
新的AnchorScore方法使用CLIP预测多模态大语言模型的标注难度
研究人员开发了AnchorScore,一种利用CLIP预测多模态大语言模型(MLLMs)在标注特定类别时面临难度的创新方法。该方法提供了一种低成本的诊断工具,用于识别MLLMs最不可能可靠标注的类别,其表现优于DINOv2和ResNet-50等其他预测器。AnchorScore已在优化MLLM评估、实现混合路由策略以及优先处理具有挑战性的标注任务的人工审查方面展现出实际应用价值。
-
新基准使用多模态大语言模型(MLLM)委员会评估 AI 模型解释
研究人员开发了 CBX-Bench,这是一个旨在量化评估概念瓶颈模型(CBMs)生成解释质量的新基准。该基准利用一个多模态大语言模型(MLLM)委员会对解释质量进行评分,该评分已通过人类偏好进行了验证。该系统旨在提供一种可扩展且与人类对齐的方法,以超越传统的分类准确性来评估 CBM 的可解释性。
-
新框架通过LLM反馈和语义修复增强文本到视频生成
研究人员开发了新的框架,通过解决语义错误和身份漂移来改进文本到视频生成。一种方法将多模态大语言模型(MLLM)直接集成到扩散采样循环中,使用语义评估监督器和语义修改助手在不改变模型参数的情况下在中途纠正错误。另一种方法,Agentic Enhancement and Semantic Repair (AESR),使用代理提示增强模块和视觉语义修复模块来优化提示和编辑生成的视频,在视频生成挑战赛中获得最高排名。
-
多模态大语言模型从遥感图像中提取详细城市布局
研究人员开发了一种名为 Code-as-City 的新方法,该方法使用多模态大语言模型(MLLM)从遥感图像中提取详细的城市布局。该方法超越了简单的检测框或掩码,能够生成代表城市结构(包括道路、土地覆盖和建筑物)的可执行代码。生成的代码可以创建可渲染的 3D 城市布局和同步的 2D 投影,并在 CityLayout-100 数据集上进行了评估,取得了显著的交并比分数。
-
新的 SLMP 框架通过 LLM 增强病理图像解释
研究人员开发了一个名为空间语言消息传递 (SLMP) 的新框架,以改进多模态大语言模型 (MLLM) 如何解释病理图像。SLMP 通过将图像区域表示为空间文本图来解决全切片图像 (WSI) 超过 MLLM 上下文限制的挑战。在该图中,瓦片是带有初始描述的节点,边表示空间邻近性。然后,LLM 通过整合来自相邻瓦片的消息来优化每个瓦片的描述,从而在不微调 MLLM 权重的情况下实现语义优化。该方法在 HER2 和 CAMELYON16 数…
-
InstructVVT框架实现了指令驱动的视频虚拟试穿
研究人员开发了InstructVVT,一个用于视频虚拟试穿的新框架,它使用扩散Transformer和多模态大语言模型,在不依赖辅助空间先验的情况下实现精确的服装替换。这种方法可以直接从源视频、参考服装和指令输入中进行细粒度控制。与ViViD-S和TripVVT-Bench等基准上的现有方法相比,该系统在服装保真度、结构保持和时间一致性方面表现出卓越的性能。
-
MLLM 通过语义校正和视觉规划增强文本到视频生成
两篇新的研究论文探讨了通过整合多模态大语言模型(MLLM)和扩散模型来增强文本到视频生成。第一篇论文介绍了一个框架,该框架将 MLLM 反馈直接注入扩散采样循环中进行中间生成语义校正,在不改变模型参数的情况下提高对齐度和保真度。第二篇论文系统地研究了 MLLM 和扩散 Transformer(DiT)的融合,发现自回归生成且显式以 DiT 为条件的离散语义视觉标记比提示精炼更有效。这种称为 BiVidGen 的方法展示了改进的语义对齐…
-
EvoTale框架支持故事世界中持续的角色定制
研究人员开发了EvoTale,一个用于在不断扩展的故事世界中持续定制角色的新框架。该系统解决了在不破坏现有角色关系的情况下整合新角色的挑战,这是以角色为中心的故事可视化中的一个常见问题。EvoTale采用了一个全合一世界角色集成器来管理残余组件,以及一个使用多模态大语言模型反馈来调整优化预算的角色质量门控。此外,它还利用了面向区域的角色感知采样,以在特定区域内保持角色身份,同时确保整体叙事的一致性。
-
VOS-Agent框架在LSVOS挑战赛中荣获第一名
研究人员开发了VOS-Agent,一种用于复杂视频对象分割的新型框架,该框架改进了现有的SAM3等方法。VOS-Agent利用目标感知和路由代理来对目标进行分类并将其路由到专用代理。对于微小目标,视觉跟踪代理提供增强支持,而以语义为主导的目标则由基于多模态大语言模型(MLLM)的语义代理进行管理。该方法在ECCV 2026的第8届LSVOS挑战赛MOSEv2赛道上取得了第一名,在MOSEv2测试集上表现出色。
-
新的ARMDIL系统使用MLLM来提升跨数据集图像分类能力
研究人员推出ARMDIL,一个旨在提高跨不同数据集图像分类能力的新型系统。ARMDIL利用多模态大语言模型(MLLM)智能地将图像路由到异构集合中最合适的视觉骨干网络。该集合包括各种架构,如ResNets、自监督学习模型和视觉语言模型,所有这些模型都在源自具有不同特征的多个数据集的统一标签空间上进行训练。该系统展示了增强的适应性和可解释性,为AI助手和自主机器人等应用的更可靠的通用视觉系统提供了途径。
-
新的基准和多智能体系统提升了MLLM在无人机图像分析方面的能力
研究人员开发了UAVQA-Bench,一个旨在评估多模态大语言模型(MLLMs)在理解和推理无人机航空影像方面能力的新基准。该基准通过整合13个公开数据集,生成了跨越16个任务和6个能力维度的1500个人工标注问答对,解决了现有评估的局限性。为了解决领域工具集不匹配和错误传播等已识别的故障模式,该团队还引入了UAV-MAS,一个无训练的多智能体系统,以提高MLLM在此挑战性任务上的性能。
-
VDC-Agent框架实现自主进化的视频字幕生成
研究人员开发了VDC-Agent,一个新颖的框架,使单个多模态大型语言模型能够自主生成和优化视频详细字幕。该自进化系统通过采用基于原则的自我反思过程,克服了对昂贵的人工标注或外部模型的依赖。为了提高效率,模型通过课程直接偏好优化策略将反思能力内化,该策略使用从代理自我评分轨迹派生的偏好数据集。实验表明,VDC-Agent在VDC和DREAM-1K基准测试中取得了最先进的性能,提高了字幕的细节和准确性,同时保持了推理效率。
-
新的基准和框架用于评估人工智能生成图像的视觉空间美学
研究人员推出了SA-BENCH,这是一个旨在评估室内场景视觉空间美学的新基准,该领域此前被现有的图像质量评估(IQA)方法服务不足。该基准包含18,000张图像和50,000个标注,重点关注布局、和谐、光照和失真。在此基础上,他们开发了SA-IQA,一个利用多模态大语言模型(MLLM)微调和多维融合方法的综合奖励框架。SA-IQA在SA-BENCH上表现出色,并通过强化学习和图像选择应用于优化AI生成的内容管道。
-
MetaSpace框架测试具身AI智能体的空间认知能力
研究人员推出MetaSpace,一个用于评估具身智能体空间认知能力的新颖框架。该系统应用了软件工程中常用的变形测试(metamorphic testing)原理,通过逻辑规则和物理定律自动生成测试用例。通过将这些原理编码到Prolog中,MetaSpace通过检测预定义的变形关系(metamorphic relations)的违本来识别空间认知中的失败。在三个场景的评估中,MetaSpace在最先进的多模态大型语言模型(MLLM)驱动…