实体
ExtractBench
ExtractBench
PulseAugur coverage of ExtractBench — every cluster mentioning ExtractBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Datalab推出OmniExtractBench以标准化AI文档提取评估
Datalab推出了OmniExtractBench,这是一个旨在解决结构化文档提取任务中偏差和不透明性问题的开放基准。该新基准评估AI系统从PDF文档填充JSON模式的准确性,并使用提供决策解释的确定性评分器。OmniExtractBench旨在提供一种标准化和可审计的评估方法,这与Datalab认为难以比较或验证的供应商创建的排行榜形成对比。该基准包含来自各种来源的620份文档,并采用基于内容的配对方法和匈牙利算法进行准确的表格对齐。
-
新的基准ExtractBench评估企业文档提取代理
研究人员推出了ExtractBench,这是一个旨在评估企业环境中模式引导文档提取能力的基准。该基准利用包含370份企业文档、共4,869页的数据集,在数值准确性、记录完整性、接地性和成本方面评估代理。初步结果显示,虽然商业VLMs在长文档方面存在困难,但编码代理准确但成本高昂。LlamaExtract Agentic Plus成为表现最佳者,以显著更低的成本提供与编码代理相当的准确性。