研究人员推出了一种新颖的免训练方法ST-Veto,旨在增强扩散多模态大语言模型(dMLLMs)的推理能力。该方法利用了模型在每个扩散步骤中同时处理所有令牌位置的能力。ST-Veto通过使用置信度动态的二阶泰勒预测来识别和否决时间上不稳定的令牌,并通过过滤基于图像注意力质量的弱基础令牌来工作。在各种dMLLMs和多模态推理基准测试中,ST-Veto均表现出持续的改进,在不产生额外训练或生成成本的情况下,将准确率提高了高达9%。 AI
影响 增强了多模态LLM的推理能力和效率,有望提高在复杂视觉-语言任务上的性能。
排序理由 该集群包含一篇详细介绍改进AI模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Diffusion Multimodal Large Language Models
- DMLLMs
- Spatio-Temporal Token Veto
- ST-Veto
- Taylor Prediction
- vision-language model
- Visual Grounding with Multi-modal Conditional Adaptation
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →