Together 开发了 ThunderAgent,这是一种调度器级别的解决方案,旨在通过缓解 KV 缓存抖动来优化代理推理的 GPU 使用率。这项创新在单节点吞吐量方面提高了 2.5 倍,在高并发下将 P50 延迟降低了十倍。ThunderAgent 已被 ICML 2026 选为 Spotlight 论文,并已被 Skyrlos 和 NVIDIA Dynamo 等项目采用,为现有的引擎配置提供即插即用集成。 AI
影响 优化 AI 代理的 GPU 利用率,可能降低推理成本并提高性能。
排序理由 研究论文被顶级机器学习会议录用,详细介绍了新颖的技术解决方案。
- Gort Investments
- San Francisco
- SemiAnalysis
- X
- YouTube
- International Conference on Machine Learning
- MiniMax H3
- NVIDIA Dynamo
- NVIDIA H100
- OpenAI
- Runway ML
- SGLang
- Skyrlos
- ThunderAgent
- Together
- Flux 3
- Grok Imagine Video 1.5
- Replit
AI 生成摘要 · Google Gemini · 来自 10 个来源。 我们如何撰写摘要 →