研究人员开发了一种名为“环境演化”的新方法来改进终端代理的训练。该技术在策略外(off-policy)逐步增加训练环境的难度,随着模型的进步提供持续的学习信号。使用该方法进行的实验在 Terminal-Bench 2.1 基准测试中显示出显著的性能提升,Qwen3.6-27B 和 Qwen3.6-35B-A3B 模型分别提高了 14.4 和 18.0 个百分点。该方法已与 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 等前沿模型进行了测试,证明了其在生成更具挑战性环境方面的有效性。 AI
影响 该方法可以加速能够与复杂环境交互的 AI 代理的开发和性能提升。
排序理由 该集群报道了一篇详细介绍 AI 代理训练新方法的学术论文。
在 Hugging Face Daily Papers 阅读 →
- Claude Opus-5
- Environment Evolution Commission
- GPT 5.6 "Sol"
- Hugging Face
- Hy4 preview
- Qwen3.6-27B
- Qwen3.6 35B-A3B
- Terminal-Bench 2.1
- arXiv
- Hy4
- terminal AI agents
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →