一个名为 KhatianDoc 的新基准已被开发出来,用于评估多模态大语言模型(LLMs)在理解孟加拉语法律土地记录方面的能力。该基准由孟加拉国的 107 份真实土地记录构建而成,包含符号识别、十六进制到十进制转换、结构化字段提取和问答等任务。对六个大语言模型的评估显示存在重大失败,模型无法正确回答近 40% 的问题,并且在涉及土地所有权分数的算术任务上表现不如基线。 AI
影响 突显了多模态大语言模型在理解专业、非拉丁字母脚本数据方面的关键差距,表明需要进行领域特定的训练和评估。
排序理由 学术论文,介绍了一个用于评估大语言模型在特定领域能力的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →