研究人员开发了 mzCache,这是一个设备端 LLM 推理系统,旨在有效管理多任务移动环境中的内存。该系统解决了在应用切换过程中操作系统进行内存驱逐的问题,通常会导致恢复缓慢或重新计算。mzCache 将 LLM 内存划分为细粒度的共享缓冲区,允许部分驱逐和恢复,并支持并发跨处理器访问,同时利用混合交换和后向输出驱逐策略实现低延迟恢复。mzCache 作为一款 Android 应用实现,与基于存储的局部卸载方法相比,已证明其首次令牌时间(Time-to-First-Token)缩短了 2.1-5.5 倍。 AI
影响 通过减少多任务场景下的延迟,增强了设备端 LLM 的性能。
排序理由 该项目描述了一个新颖的系统及其在研究论文中提出的性能评估。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- android
- arXiv
- CatalyzeX
- central processing unit
- DagsHub
- Gotit.pub
- graphics processing unit
- Hugging Face
- LLM
- mzCache
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →