一篇新的研究论文介绍了 StateM,一个专为代理设计的运行时,旨在提高长周期 AI 代理的性能。StateM 通过围绕持久化状态、阶段本地上下文和版本化过程实践来组织执行,从而在不改变其核心模型权重的情况下,增强代理周围的执行系统。该系统在 Terminal-Bench 2.1 基准测试中展示了显著的准确性提升,将 GPT-5.5 xhigh 提升至 92.1%,并使用 GPT-5.6 Sol xhigh 达到了 95.3%。此外,StateM 以极低的适应成本将 DeepSeek-V4 Flash 的准确率从 82.7% 提高到 88.1%,并显著减少了 API 使用量。 AI
影响 增强了长周期代理的能力并降低了推理成本,可能加速复杂 AI 工作流程的采用。
排序理由 详细介绍一种改进 AI 代理性能的新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- BusinessBench
- DeepSeek-V4 Flash
- GPT-5.5 xhigh
- GPT-5.6
- GPT-5.6 Luna
- GPT-5.6 Sol
- GPT-5.6 Sol Ultra
- GPT-5.6 Sol xhigh
- Terminal-Bench 2.1
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →