研究人员开发了 MCP-Universe RL (MCP-U RL),这是一个开源框架,旨在简化利用工具的大型语言模型 (LLM) 代理的训练。该框架解决了两个关键挑战:高效管理大量隔离环境以进行并发训练轨迹,以及在涉及缓慢工具调用的长多轮对话中优化 GPU 利用率。MCP-U RL 与用于环境接口的模型上下文协议 (MCP) 集成,并包含环境和 rollout 管理的编排层,使代理能够在软件工程和深度研究等各种领域进行训练。 AI
影响 该框架可以加速能够跨各种领域进行复杂工具使用的复杂 AI 代理的开发和部署。
排序理由 该集群包含一篇详细介绍用于训练 AI 代理的新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- gpt-oss-20b
- GPU
- large language models
- MCP
- MCP-Universe RL
- Model Context Protocol
- Reinforcement learning
- slime
- veRL
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →