Databricks 发布了 OfficeQA Pro V2,这是一个旨在评估企业风格任务中 AI 代理事实推理能力的新基准。该基准使用了约 12 万页的美国财政部收支账户新语料库,涵盖 1793 年至 2024 年。对前沿模型的初步评估显示平均准确率为 26.0%,模型之间存在显著的性能差异,并且在解析、时间协调和实体范围解释方面仍存在挑战。 AI
影响 该基准将有助于推动 AI 代理在企业文档分析和推理能力方面的进步。
排序理由 该项目描述了一个用于评估 AI 能力的新基准的发布。[lever_c_demoted from research: ic=1 ai=1.0]
- AI agents
- Anthropic
- Claude Code
- Codex
- Databricks
- Google DeepMind
- GPT-5.6 Sol
- OfficeQA Pro V2
- OpenAI
- Sonnet 5
- U.S. Treasury
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →