研究人员开发了两个新框架LensVLM和FocusVTC,以改进视觉语言模型(VLM)处理长文档的方式,方法是压缩视觉文本表示。LensVLM使用训练后方法选择性地扩展相关文本的压缩图像,在保持准确性的同时实现了显著压缩。FocusVTC采用自适应分辨率,结合低DPI全局视图和选择性区域增强,并在各种基准测试中展示了改进的性能,甚至在某些任务上超越了其文本输入骨干。 AI
影响 这些方法可以显著降低处理长文档的LLM的计算成本,从而实现更高效、更强大的多模态理解。
排序理由 两篇发表在arXiv上的研究论文,详细介绍了VLM中视觉文本压缩的新方法。
在 Hugging Face Daily Papers 阅读 →
- alphaXiv
- arXiv
- Carrillo Airport
- CatalyzeX
- DagsHub
- FocusVTC
- Glyphipterix
- Gotit.pub
- Group Relative Policy Optimization
- Hugging Face
- Lee Roy Myers
- LensVLM
- LongBench: a bilingual, multitask benchmark for long context understanding
- Qwen3.5-9B-Base
- REL-CoT
- REL-SFT
- RULER v1
- ScienceCast
- Vocational Training Council
- VTCBench
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →