Unified Multimodal Models
PulseAugur coverage of Unified Multimodal Models — every cluster mentioning Unified Multimodal Models across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
PixelUMM:推出无编码器的统一图像和视频模型
研究人员推出 PixelUMM,这是一种新颖的无编码器模型,旨在直接在像素空间中进行统一的图像和视频理解与生成。该模型通过将图像视为空间块并将视频视为时空管状物,克服了整合用于理解和生成的独立视觉表示的挑战。PixelUMM 采用 Transformer 混合架构,结合共享注意力与特定任务的参数,以支持自回归文本预测和像素空间流匹配,在各种任务上取得了有竞争力的性能。
-
用于边缘和本地使用的开源多模态模型,以及关于高级UMM能力的研究
Liquid Foundation Models 发布了一系列专为边缘计算设计的开源“d1 decision models”,其中包括在 Decision Index 0.2.1 基准测试中表现出色的 d1-3B 模型,支持文本和图像输入。这些模型针对速度进行了优化,d1-3B 在 NVIDIA 硬件上实现了低延迟。同时,研究论文正在探索统一多模态模型的高级概念,例如用于处理不可能请求的视觉弃权、量化理解与生成之间的差距、通过自适应模…
-
新研究揭示统一多模态AI模型的安全风险
一篇题为“因互惠而不安全”(Unsafe by Reciprocity)的新研究论文探讨了统一多模态模型(UMMs)的安全影响,这些模型集成了文本到图像的生成和理解能力。该研究引入了一种名为RICE(基于互惠交互的跨功能利用)的新型攻击范式,以展示这些功能之间的双向交互如何产生漏洞。研究人员发现,不安全的中间信号会传播并放大安全风险,导致UMMs固有的重大弱点。
-
新基准揭示UMMs在推理到生成对齐方面存在困难
一个名为 UReason 的新基准已被开发出来,用于评估统一多模态模型 (UMMs) 中推理与生成之间的对齐。该基准包含 2,000 个跨五个推理密集型任务的人工策划实例,结果显示,虽然引导式推理生成优于直接生成,但脱离上下文的生成表现始终更好。研究结果表明,尽管当前的 UMMs 具有统一的架构,但它们在将文本推理中的预期视觉语义可靠地反映到生成的图像方面仍存在困难。
-
新研究探讨统一多模态模型中的概念绑定
研究人员开发了一种新颖的方法来研究统一多模态模型(UMMs)中理解和生成之间的关系。通过构建一个仅通过一个任务方向进行训练的视觉实体,他们发现生成训练会植入一个模型只能匹配的概念,而理解训练则允许模型也能生成该概念。研究表明,跨任务可用性取决于概念绑定进入共享计算的位置,特别是在理解路径的入口点需要一个共享的语义格式。
-
新的SGU框架整体评估统一多模态AI模型
研究人员推出了一种新的评估框架Self-Generative-Understanding (SGU),旨在整体评估统一多模态模型 (UMMs)。与现有分别评估生成和判别能力的方法不同,SGU采用闭环过程:模型首先描述图像,然后根据该描述重建视觉上下文,最后对其自我生成的输出来进行推理。这种无需标注的方法揭示了UMMs对其自身生成内容进行推理的能力的局限性,而这些局限性常常被传统评估方法所忽略。
-
新框架全面评估统一多模态人工智能模型
研究人员推出了一种名为“自生成理解”(SGU)的新框架,用于评估统一多模态模型(UMMs)。当前的方法通常分别评估视觉生成和理解能力,未能捕捉UMMs的集成能力。SGU提供了一种无需标注的方法,模型首先描述图像,然后根据该描述重建视觉上下文,最后对其自生成输出进行推理。实验表明,即使是先进的UMMs在对其自身生成的内容进行推理时也存在困难,这凸显了传统评估技术所忽略的局限性。
-
新研究深入探究多模态模型的内部推理和语义空间
两篇新研究论文探讨了统一多模态模型(UMMs)的内部工作机制,质疑它们是否真的在理解和生成过程中共享统一的语义空间。第一篇论文《统一多模态模型是否在一个空间中思考?通过跨分支引导的视角》(Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering)提出了一种通过在理解和生成分支之间转移语义方向来探究UMMs的方法,发现源自理…
-
STBridge框架弥合了多模态模型中理解与生成之间的差距
研究人员推出STBridge,一个旨在提高统一多模态模型(UMMs)中理解与生成之间对齐度的新框架。当前的UMMs常常在语义一致性方面遇到困难,这意味着它们可能正确描述了预期的图像编辑,但却无法生成相应的视觉变化。STBridge通过创建共享目标对齐来解决这一问题,将模型的描述能力与其生成输出联系起来。该方法采用两阶段过程:初始监督微调以建立通用路径,然后进行强化学习以围绕目标状态优化协调。实验表明,STBridge在各种基准测试中提…
-
SenseNova-Vision 将计算机视觉任务统一为多模态生成 · 跟踪 6 个来源
研究人员开发了 SenseNova-Vision,一个统一的多模态模型,它将所有计算机视觉任务视为生成问题。这种方法使用自然语言指令和视觉提示来指定任务,允许模型生成文本、图像或两者的组合。该模型在新创建的 SenseNova-Vision Corpus 上进行了训练,在检测、分割和姿态估计等广泛的视觉任务上的性能与专用系统相当。这项工作表明,统一的多模态生成是一种可扩展的方法,可以将各种计算机视觉能力集成到通用基础模型中,并且该模型…
-
新框架通过保留知识和改进生成来增强多模态AI
研究人员正在开发新框架以增强多模态AI模型。Rosetta 引入了一种可组合的预训练方法,可以在不破坏现有知识的情况下添加新模态并保留核心知识,使用动量锚定正交投影来管理梯度冲突。COMPASS 在统一系统中将组合意图控制进行接地,通过使用共享的专家令牌来同时改进感知和生成。SRUM 使统一的多模态模型能够通过使用其理解模块作为内部评估器来改进其生成能力,采用双重奖励系统来保证全局和局部保真度。此外,ReVisIT 提供了一种无需训练…
-
新方法增强了用于图像生成和理解的统一多模态AI模型
研究人员开发了改进统一多模态模型(UMMs)的新方法,UMMs结合了视觉理解和生成。一种方法是重建对齐(RECA),它使用自监督学习从图像自身的视觉嵌入中重建图像,以最小的计算成本提高生成和编辑的保真度。另一种方法是SPAR,它引入了一个新颖的框架,具有不对称双流标记器,以弥合语义感知和像素级重建之间的差距,并采用自适应路由来实现灵活的多模态交互。这两种技术都旨在提高UMMs的质量和能力,而无需依赖外部数据或教师。
-
新的基准测试和调优方法推动统一多模态AI模型发展
研究人员正在开发新的方法和基准测试来改进统一多模态模型(UMMs),旨在整合视觉理解和生成能力。一种名为语义生成调优(SGT)的方法,使用图像分割作为生成代理来对齐这些能力,在理解和生成方面均表现出性能提升。同时,正在引入MMGist和Unison等新基准测试,以解决现有评估中存在的问题,例如视觉依赖性不足和性能饱和。这些基准测试旨在为UMMs提供更准确、更具区分度的评估,并突出视觉逻辑等方面的持续薄弱环节。
-
新的Pareto LoRA方法平衡了多模态模型中的文本和图像梯度
研究人员推出了一种名为Pareto LoRA的新方法,用于解决参数高效微调过程中统一多模态模型(UMMs)中的模态不平衡问题。这种不平衡在基于LoRA的微调中尤为普遍,会导致语言梯度压倒图像生成,从而降低视觉质量。Pareto LoRA将多模态指令微调重构为双目标优化问题,使用帕累托最优策略集成文本和图像梯度,以平衡它们的方向和强度。在Emu2的CoMM基准测试上的实验表明,Pareto LoRA显著改善了多模态生成平衡,感知图像质量…
-
新框架Uni-Plan使用多模态模型增强AI决策能力
研究人员推出了一种新颖的规划框架Uni-Plan,该框架利用统一多模态模型(UMMs)来增强决策能力。与以往仅依赖基于语言的推理的方法不同,Uni-Plan利用UMMs处理多模态输入和输出,通过生成的视觉内容进行推理。该框架将策略、动态模型和价值函数整合到一个模型中,并采用自判别过滤技术来防止动态预测中的幻觉。实验表明,与基于视觉语言模型(VLMs)的方法相比,Uni-Plan在具身决策任务中的成功率显著提高,展示了强大的数据可扩展性…
-
Google DeepMind 发布适用于笔记本电脑的 Gemma 4 12B 多模态模型
Google DeepMind 发布了 Gemma 4 12B,这是一款专为在具有 16GB VRAM 的笔记本电脑上本地运行而设计的新型多模态模型。该模型采用新颖的统一架构,将音频和视觉输入直接集成到 LLM 主干中,无需单独的编码器,从而降低了延迟和内存使用量。Gemma 4 12B 旨在将先进的代理多模态能力带到日常硬件上,其性能接近其较大的 26B MoE 版本,并通过开放许可和与流行工具的集成获得广泛的开发者支持。
-
多模态AI在推理和知识编辑方面存在困难
新研究表明,与纯文本模型相比,当前的文本到图像模型在推理能力方面存在显著差距。虽然文本到图像系统可以生成清晰的视觉文本,但它们在复杂的推理任务中常常无法保持逻辑一致性和事实准确性。此外,在统一的多模态模型中编辑知识的尝试表明,文本编辑不能可靠地转移到图像生成,这突显了需要新的编辑方法的模态差距。
-
Google发布Gemma 4 12B多模态模型以供本地使用
Google发布了Gemma 4 12B,这是一款专为在消费级笔记本电脑上本地部署设计的新型多模态模型。该模型采用统一架构,将视觉和音频输入直接集成到LLM主干中,无需单独的编码器即可减少延迟。虽然其性能接近大型模型,但比较表明,在某些受限本地推理的基准测试中,Qwen 2.5 9B可能仍然更胜一筹。
-
DIVA框架通过解决表示冲突来增强多模态模型
研究人员推出了一种新颖的训练后框架DIVA,旨在增强统一多模态模型(UMMs)。DIVA解决了UMMs中优化目标冲突的挑战,其中生成任务需要高保真表示,而理解任务需要判别性嵌入。通过分析内部表示的分歧,DIVA将视觉表示分解为共享和独有组件,促进两个分支之间的协同作用。这种方法带来了显著的改进,生成任务提高了8.46%,视觉理解提高了7.82%。
-
研究发现DPO难以统一多模态模型的理解与生成
一项关于统一多模态模型的最新研究发现,直接偏好优化(DPO)在同时提升图像理解和生成能力方面存在困难。研究表明,生成质量难以通过DPO进行对齐,其中一个模型表现出生成性能下降,而另一个模型则在理解和生成任务之间表现出近乎正交的梯度。这种干扰归因于token幅度存在显著不平衡,表明离散的VQ分词可能是统一模型的潜在瓶颈。