研究人员开发了KVMem,一个用于管理AI Agent大上下文窗口的系统,使其能够在消费级GPU上运行高达一百万Token。这种虚拟化技术将溢出的上下文存储为分页KV状态,分布在GPU内存、主机内存和NVMe中,与传统的压缩方法相比,能够更有效地处理长历史记录。KVMem已证明了提高任务成功率和交互响应能力,使得长时运行的Agent能够维护广泛的工作空间。 AI
影响 通过克服可访问硬件上的上下文窗口限制,使更长时运行、更强大的AI Agent成为可能。
排序理由 学术论文,详细介绍了一种管理LLM上下文窗口的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]
- AgentLongBench
- graphics processing unit
- Hugging Face
- KVMem
- LongMemEval
- MemoryAgentBench
- Multi Token Prediction
- NVM Express
- Qwen3.6/3.8-27B NVFP4
- Qwen3.8-27B
- RTX 5090 Laptop GPU
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →