研究人员开发了一种新颖的方法,通过采用像素级压缩来处理包含多个表格的文档问答。这项技术在 arXiv 的一篇新论文中进行了详细介绍,它解决了处理交织文本和表格的长输入所带来的挑战。该方法包括一个两步过程,模型首先从压缩的上下文中识别相关表格,然后以原生分辨率对这些表格进行推理。据报道,与使用原生分辨率表格的单步问答相比,该方法节省了 41% 的总 token 量,并将准确率提高了 7 个点,同时比现有的压缩配置更有效。 AI
影响 这项研究可能导致 AI 模型更有效地处理复杂文档,提高涉及表格和文本的任务的性能。
排序理由 详细介绍一种新的文档问答技术的 ist 研究论文。 [lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- A Table Is Worth 64 Tokens: Pixel-level Compression for Multi-Table Document Question Answering
- Hugging Face
- Optical context compression
- QA
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →