Artificial Analysis 发布了其 Harvey LAB-AA 基准测试的结果,该测试使用 Stirrup 代理实现了 Harvey 法律代理基准 (LAB)。评估使用了 Harvey 数据集,该数据集包含 24 个法律领域的 120 个私有任务,以评估按标准划分的通过率和总体通过率。Kimi K3 取得了最高分 94.6%,其次是 Claude Fable 5 的 93.6% 和 Muse Spark 1.1 的 93.1%。结果还包括成本、代币和速度的指标。 AI
影响 为法律任务中的 AI 代理设定了新的基准,突出了 Kimi K3 的领先表现,并为其他模型提供了比较数据。
排序理由 该集群报告了 AI 代理在法律任务上的基准评估结果。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
- Artificial Analysis
- Claude Fable 5
- Harvey
- Harvey LAB-AA
- Kimi K3
- Legal Agent Benchmark (LAB)
- Muse Spark 1.1
- Stirrup
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →