研究人员开发了 VisionWeave,一种用于多模态大语言模型(MLLMs)的新方法,该方法允许它们根据内容自适应地分配视觉表示。这种方法与当前使用固定大小 token 的方法形成对比,后者可能导致细节丢失。VisionWeave 结合了门控空间池化器和粒度路由器,以实现内容自适应粒度和提高效率。在 Qwen3.5-4B 上进行测试并扩展到 Qwen3.8-27B 后,VisionWeave 在八个基准测试中平均节省了 43% 的 token,同时保持了 98.9% 的原生性能。该系统在 SGLang 服务引擎上部署时,还显示出吞吐量显著提高和延迟降低。 AI
影响 这项研究通过在保持性能的同时降低计算开销,可能带来更高效、更强大的多模态人工智能系统。
排序理由 该集群描述了学术论文中提出的一种改进多模态大语言模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →