PulseAugur
实时 12:03:10
English(EN) StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

StateM 运行时提高了 AI 代理在长周期任务上的准确性

一篇新的研究论文介绍了 StateM,一个专为代理设计的运行时,旨在提高长周期 AI 代理的性能。StateM 通过围绕持久化状态、阶段本地上下文和版本化过程实践来组织执行,从而在不改变其核心模型权重的情况下,增强代理周围的执行系统。该系统在 Terminal-Bench 2.1 基准测试中展示了显著的准确性提升,将 GPT-5.5 xhigh 提升至 92.1%,并使用 GPT-5.6 Sol xhigh 达到了 95.3%。此外,StateM 以极低的适应成本将 DeepSeek-V4 Flash 的准确率从 82.7% 提高到 88.1%,并显著减少了 API 使用量。 AI

影响 增强了长周期代理的能力并降低了推理成本,可能加速复杂 AI 工作流程的采用。

排序理由 详细介绍一种改进 AI 代理性能的新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

StateM 运行时提高了 AI 代理在长周期任务上的准确性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang ·

    StateM:通过Harness Scaling在Terminal-Bench 2.1上达到95.3%的原始准确率,或15美元的Frontier运行

    arXiv:2608.15089v1 Announce Type: new Abstract: Long-horizon agents can fail even when their underlying models can solve the constituent steps. They may lose track of mutable state, fail to reactivate lessons from earlier executions, skip known procedures, or stop prematurely. We…