Mercor和Ramp推出了一项名为APEX-Accounting的新基准测试,用于评估前沿AI模型在执行会计任务方面的能力。该基准测试包括账户对账、费用权责发生制和报告生成等任务,并包含一个由160个专家编写的任务组成的私有评估集。Claude Fable-5在该基准测试中得分最高,其次是Muse Spark 1.1,而其他模型则表现有限。研究还观察到了与token预算分配相关的辛普森悖论效应。 AI
影响 该基准测试可能会推动AI朝着在金融和会计领域完成更专业、更实际任务的方向发展。
排序理由 该集群描述了一个新的基准测试和研究论文,详细介绍了AI模型在会计任务中的表现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →