研究人员推出了WildHandBench,这是一个旨在评估多模态大语言模型(MLLMs)和人类理解手写文档能力的新基准。该基准包含500份不同结构、语言和真实场景的文档,并引入了先验驱动误差(PDE)指标,以区分源于语言先验和视觉证据的错误。评估显示,表现最佳的模型准确率仅为71.85%,而人类的准确率为77.09%,略高于模型。值得注意的是,与人类相比,模型在错误中对语言先验的依赖性更大,这是传统准确率指标无法捕捉到的区别。 AI
影响 该基准突显了多模态大语言模型在处理复杂手写文档方面的现有局限性,为未来模型开发指明了方向。
排序理由 该集群描述了一个用于评估AI模型的新学术基准。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →