研究人员推出了一种新颖的视觉语言模型(VLM)分层并行解码范式HPD-Parsing,旨在提高文档解析效率。与现有逐页处理的方法不同,HPD-Parsing全局分析布局并并行解码块内容,显著提高了吞吐量。该系统每秒可处理4,752个令牌,在保持具有竞争力的准确性的同时,性能超过当前模型2.6倍以上。 AI
影响 通过实现并行内容分析,加速了AI系统的文档处理。
排序理由 发布了一篇详细介绍新文档解析方法的最新研究论文。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Hierarchical Parallel Decoding
- HPD-Parsing
- Hugging Face
- Progressive Multi-Token Prediction
- vision-language model
- P-MTP
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →