PulseAugur
实时 08:39:22
English(EN) Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

新的孟加拉语基准测试 MLLM 的文档拆分能力

研究人员推出了 Khondo,一个旨在评估多模态大语言模型(MLLM)拆分文档包为其组成部分任务的新基准。该基准的独特性在于它专注于孟加拉语政府表格,是双语的(孟加拉语-英语),并且直接在页面图像上操作,而不是 OCR 文本。初步评估表明,MLLM 可以有效地将属于同一文档的页面聚类,但在重建原始页面顺序方面存在显著困难,尤其是在孟加拉语文档被打乱的情况下。研究强调,明确的指令对于排序至关重要,并且英语文档包的处理效果优于孟加拉语,这表明页面排列是主要挑战,而语言是次要但持续的因素。 AI

影响 为低资源文档理解建立了一个新的基准,推动 MLLM 提高页面排序能力。

排序理由 该项目描述了一个用于评估多模态大语言模型在特定文档理解任务上的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的孟加拉语基准测试 MLLM 的文档拆分能力

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman ·

    Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

    arXiv:2607.21780v1 Announce Type: new Abstract: Document packets, multiple documents concatenated into a single file, are common in government and administrative workflows, yet splitting them into their constituent documents is difficult, especially for low-resource languages. We…