研究人员引入了一种名为可编译学术文档解析(CADP)的新范式,以更好地表示嵌入在学术论文中的科学知识。当前的方法在保留表格、公式和伪代码等元素的结构和逻辑方面存在困难,而这些元素对于多模态大语言模型(MLLMs)至关重要。CADP使用LaTeX和可执行Python重建这些文档,从而可以直接将重建的元素与源进行验证。一个新的基准CADP-Bench已被开发出来以评估此过程,结果显示即使是先进的MLLMs在生成高保真、可执行的重建方面仍有很大的改进空间。 AI
影响 这项研究可能有助于AI模型更有效地从科学文献中提取和利用知识。
排序理由 该条目描述了一篇介绍学术文档新解析范式和基准的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- arXivLabs
- CADP-Bench
- Compilable Parsing Paradigm for Academic Documents
- Hugging Face
- LaTeX
- MLLMs
- Multimodal Large Language Models
- Python
- Structured Academic Elements
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →