PulseAugur
实时 15:53:20
English(EN) Introducing OfficeQA Pro V2: A New Benchmark for Enterprise Grounded-Reasoning

Databricks 发布 OfficeQA Pro V2 基准,用于企业 AI 推理

Databricks 发布了 OfficeQA Pro V2,这是一个旨在评估企业风格任务中 AI 代理事实推理能力的新基准。该基准使用了约 12 万页的美国财政部收支账户新语料库,涵盖 1793 年至 2024 年。对前沿模型的初步评估显示平均准确率为 26.0%,模型之间存在显著的性能差异,并且在解析、时间协调和实体范围解释方面仍存在挑战。 AI

影响 该基准将有助于推动 AI 代理在企业文档分析和推理能力方面的进步。

排序理由 该项目描述了一个用于评估 AI 能力的新基准的发布。[lever_c_demoted from research: ic=1 ai=1.0]

在 Databricks Blog 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Databricks 发布 OfficeQA Pro V2 基准,用于企业 AI 推理

报道来源 [1]

  1. Databricks Blog TIER_1 English(EN) ·

    Introducing OfficeQA Pro V2: A New Benchmark for Enterprise Grounded-Reasoning

    Today, we are releasing OfficeQA Pro V2, a new benchmark designed to evaluate whether...