PulseAugur
中
实时 01:32:10
实体 WildHandBench

WildHandBench

PulseAugur coverage of WildHandBench — every cluster mentioning WildHandBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_217774 ·

    新的WildHandBench在手写文本理解方面挑战多模态大语言模型

    研究人员推出了WildHandBench,这是一个旨在评估多模态大语言模型(MLLMs)和人类理解手写文档能力的新基准。该基准包含500份不同结构、语言和真实场景的文档,并引入了先验驱动误差(PDE)指标,以区分源于语言先验和视觉证据的错误。评估显示,表现最佳的模型准确率仅为71.85%,而人类的准确率为77.09%,略高于模型。值得注意的是,与人类相比,模型在错误中对语言先验的依赖性更大,这是传统准确率指标无法捕捉到的区别。