一项新的试点研究评估了多模态大语言模型(MLLMs)在理解低资源高棉语文档方面的能力。研究人员发现,虽然当前的多模态大语言模型可以处理视觉清晰的英文和结构化数字内容,但可靠的原生高棉语文档理解仍然是一个重大挑战。该研究从KH-FUNSD数据集中构建了一个评估子集,测试了Qwen-VL模型,并发现像Tesseract和PaddleOCR这样的外部OCR工具在处理高棉语脚本答案方面比直接提示效果更好。 AI
影响 当前的多模态大语言模型在处理非拉丁脚本和混合语言文档方面显示出局限性,表明在低资源语言理解方面需要进一步发展。
排序理由 学术论文,展示了一项关于多模态大语言模型在特定低资源语言文档集上的试点研究和评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →