PulseAugur
中
实时 19:00:23
实体 DMLLMs

DMLLMs

PulseAugur coverage of DMLLMs — every cluster mentioning DMLLMs across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_223209 ·

    新的解码策略提升了多模态语言模型的性能

    研究人员推出了一种新颖的扩散多模态语言模型(dMLLM)策略——信息引导的前沿解码(IGFD)。与以往优先考虑局部易于生成标记的方法不同,IGFD根据标记的置信度、邻域的不确定性以及结构承诺风险来对候选标记进行排序。这种方法鼓励早期承诺可靠的语义锚点,同时延迟不太关键的结构标记,从而在解码过程中增强上下文支持。IGFD无需额外的训练或计算开销,并在多模态理解、推理、基础构建和幻觉等各种基准测试中展示了持续的性能提升。

  2. TOOL · CL_218150 ·

    新的解码方法提高了 dMLLM 的连贯性并减少了幻觉

    研究人员推出了一种新颖的、无需训练的方法——Context-Aware Cluster Decoding (CACD),旨在提高扩散多模态大语言模型 (dMLLM) 的连贯性并减少语义漂移。现有的解码方法常常因基于置信度的评分而失败,这种评分会忽略邻居支持,而块分区则限制了对语义锚点的访问。CACD 通过将邻居邻近度整合到评分中并保持对锚点的无块访问来解决这些问题,从而实现更具上下文相关性的标记选择。实验表明,CACD 在各种 dML…

  3. TOOL · CL_154106 ·

    新的ST-Veto方法将dMLLM的推理准确率提高了9%

    研究人员推出了一种新颖的免训练方法ST-Veto,旨在增强扩散多模态大语言模型(dMLLMs)的推理能力。该方法利用了模型在每个扩散步骤中同时处理所有令牌位置的能力。ST-Veto通过使用置信度动态的二阶泰勒预测来识别和否决时间上不稳定的令牌,并通过过滤基于图像注意力质量的弱基础令牌来工作。在各种dMLLMs和多模态推理基准测试中,ST-Veto均表现出持续的改进,在不产生额外训练或生成成本的情况下,将准确率提高了高达9%。

  4. TOOL · CL_147895 ·

    新框架Seer通过MLP稀疏性将DMLLM加速高达31倍

    研究人员开发了一个名为Seer的新框架,可显著加速扩散模型多模态大语言模型(DMLLMs)的推理速度。通过分析第一个去噪步骤中的MLP激活稀疏性,Seer可以检测到输出序列的有效语义边界。这使得一次性截断冗余填充成为可能,减少了不必要的计算,并将吞吐量提高了高达31倍。该框架保持了整体性能,甚至在某些视觉任务上提高了准确性。