Diffusion Multimodal Large Language Models
PulseAugur coverage of Diffusion Multimodal Large Language Models — every cluster mentioning Diffusion Multimodal Large Language Models across labs, papers, and developer communities, ranked by signal.
-
新的VIG-Sampler通过图像引导解码增强dMLLM性能
研究人员开发了一种名为视觉信息引导采样器(VIG-Sampler)的新方法,用于扩散多模态大语言模型(dMLLMs)。该方法根据token对图像内容的注意力来优先解码token,旨在提高多模态生成的质量。VIG-Sampler还包含一个约束,通过惩罚与已选token具有相似图像注意力分布的token来增加信息增益。实验表明,VIG-Sampler在图像字幕生成和视觉问答任务上显著优于现有的Info-Gain Sampler等方法,在更…
-
新的ST-Veto方法将dMLLM的推理准确率提高了9%
研究人员推出了一种新颖的免训练方法ST-Veto,旨在增强扩散多模态大语言模型(dMLLMs)的推理能力。该方法利用了模型在每个扩散步骤中同时处理所有令牌位置的能力。ST-Veto通过使用置信度动态的二阶泰勒预测来识别和否决时间上不稳定的令牌,并通过过滤基于图像注意力质量的弱基础令牌来工作。在各种dMLLMs和多模态推理基准测试中,ST-Veto均表现出持续的改进,在不产生额外训练或生成成本的情况下,将准确率提高了高达9%。
-
新框架Seer通过MLP稀疏性将DMLLM加速高达31倍
研究人员开发了一个名为Seer的新框架,可显著加速扩散模型多模态大语言模型(DMLLMs)的推理速度。通过分析第一个去噪步骤中的MLP激活稀疏性,Seer可以检测到输出序列的有效语义边界。这使得一次性截断冗余填充成为可能,减少了不必要的计算,并将吞吐量提高了高达31倍。该框架保持了整体性能,甚至在某些视觉任务上提高了准确性。