Mercor与Ramp合作开发了一个名为APEX-Accounting的新基准,用于评估前沿AI模型在执行会计任务方面的能力。该基准包含160项专家编写的任务,涵盖账户对账、费用权责发生、交易记账和报告生成。在对九个模型的评估中,Claude Fable-5以56.4%的Mean Criteria@3得分最高,其次是Muse Spark 1.1,得分为52.6%。研究还观察到了与代币预算相关的辛普森悖论,即更高的预算通常会提高分数,但在受限的框架内,特定任务上增加代币使用量会导致性能下降。 AI
影响 该基准有望推动AI在处理会计等复杂、特定领域任务方面的能力提升,可能为金融专业人士带来新工具。
排序理由 该集群描述了一个新的基准和研究论文,评估AI模型在特定任务上的表现。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →