研究人员开发了ENCORE,一个旨在提升视觉-语言模型(VLM)性能的新框架。ENCORE通过保持物体完整性来解决当前基于Transformer的视觉编码器的局限性,尤其是在轻量级VLM中。该框架在推理过程中采用基于熵的裁剪策略(ECS),以选择熵最小的图像裁剪,从而保留与提示相关的区域。此外,它在训练过程中使用熵正则化训练(ERT)来将注意力集中在关键视觉token上。在十个VQA基准上的实验表明,ENCORE实现了1.43%的平均准确率提升,并以仅0.14%的参数微调设定了2B参数VLM的新最先进水平。 AI
影响 通过提高物体完整性和注意力来增强VLM性能,可能为小型模型设定新的基准。
排序理由 该集群描述了一篇详细介绍用于改进视觉-语言模型的新颖框架的研究论文。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Entropy-based Cropping Strategy
- Entropy Regularization Training
- Hugging Face
- Vision-Language Models
- visual question answering
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →