研究人员推出了一种新颖的缓存架构LAWS,旨在提高神经推理、机器人和边缘部署的效率。该系统通过观察实际工作负载构建一个认证专家函数库,每个函数在特定输入区域内都经过形式化误差界定。LAWS泛化了现有的方法,如专家混合(Mixture-of-Experts)和KV前缀缓存,为推理加速提供了一种更具表现力且可能具有最优获取成本的方法。 AI
影响 引入了一种新的缓存架构,可能显著提高LLM和边缘部署的推理效率。
排序理由 这是一篇详细介绍AI推理新技术的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →