Together 开发了 ThunderAgent,这是一个开源推理优化工具,旨在解决代理工作流中的 KV 缓存颠簸问题。当代理任务在 GPU 密集型推理和等待外部工具之间交替时,会出现此问题,导致内存使用效率低下和性能下降。ThunderAgent 通过将代理工作流视为可调度程序来解决此问题,从而实现更智能的内存管理和路由到具有可用容量的节点。据报道,该工具提供了显著的性能改进,包括单节点吞吐量提高高达 2.5 倍,在高并发下 P50 延迟降低约 10 倍,并被 ICML 2026 评为 Spotlight 论文。 AI
影响 优化 AI 推理效率,可能降低代理应用程序的运营成本并改善响应时间。
排序理由 研究论文被 ICML 2026 接受,详细介绍了一种新的推理优化技术。
在 X — Together (inference / OSS) 阅读 →
- International Conference on Machine Learning
- KV cache
- NVIDIA Dynamo
- NVIDIA H100
- OpenAI
- SGLang
- Skyrlos
- ThunderAgent
- Together
AI 生成摘要 · Google Gemini · 来自 9 个来源。 我们如何撰写摘要 →