研究人员开发了递归合成终端任务(RST)框架,旨在以显著降低的成本为终端代理生成长时域训练数据。该方法通过验证种子递归地合成新任务,扩展解决方案,重新对齐验证器,并在沙箱中进行验证,最终以每项约0.05美元的价格生成了超过37,000个任务。合成的任务在递归轮次中难度显著增加,导致DeepSeek-V4-Pro等模型的性能下降。使用RST生成的数据进行微调已显示出Qwen3.5模型在各种基准测试上的显著改进,证明了该框架在增强代理能力方面的实用性。 AI
影响 该框架可以显著降低创建AI代理训练数据的成本,从而可能加速开发和部署。
排序理由 该集群描述了一篇详细介绍用于生成AI训练数据的新颖框架的新研究论文。
在 Hugging Face Daily Papers 阅读 →
- DeepSeek V4-Pro
- Long-Horizon Terminal Bench
- Qwen 3.5
- Qwen3.5 122B A10B
- Qwen3.5-27B
- Recursive Synthetic Terminal Tasks
- Terminal-Bench Hard
- arXiv
- Hugging Face
- Terminal-Bench
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →