研究人员推出了 Khondo,一个旨在评估多模态大语言模型(MLLM)拆分文档包为其组成部分任务的新基准。该基准的独特性在于它专注于孟加拉语政府表格,是双语的(孟加拉语-英语),并且直接在页面图像上操作,而不是 OCR 文本。初步评估表明,MLLM 可以有效地将属于同一文档的页面聚类,但在重建原始页面顺序方面存在显著困难,尤其是在孟加拉语文档被打乱的情况下。研究强调,明确的指令对于排序至关重要,并且英语文档包的处理效果优于孟加拉语,这表明页面排列是主要挑战,而语言是次要但持续的因素。 AI
影响 为低资源文档理解建立了一个新的基准,推动 MLLM 提高页面排序能力。
排序理由 该项目描述了一个用于评估多模态大语言模型在特定文档理解任务上的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →