研究人员开发了 StateM,一个旨在增强长时程 AI 代理性能而无需修改其底层模型权重的新运行时系统。该系统围绕持久化状态、可恢复的运行手册和可强制执行的过程控制来组织代理执行。StateM 在 Terminal-Bench 2.1 等基准测试中展示了显著的改进,将 GPT-5.5 xhigh 的准确率提高到 92.1%,并使用 GPT-5.6 Sol xhigh 达到了 95.3% 的原始准确率。它还以极低的适应成本将 DeepSeek-V4 Flash 的准确率从 82.7% 提高到 88.1%。 AI
影响 增强了长时程代理的能力并降低了推理成本,可能加速其在复杂任务自动化中的应用。
排序理由 该集群描述了一篇详细介绍用于提高 AI 代理性能的新颖系统的研究论文。
在 Hugging Face Daily Papers 阅读 →
- BusinessBench
- DeepSeek-V4 Flash
- GPT-5.5 xhigh
- GPT-5.6
- GPT-5.6 Luna
- GPT-5.6 Sol
- GPT-5.6 Sol Ultra
- GPT-5.6 Sol xhigh
- Terminal-Bench 2.1
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →