一篇新研究论文介绍HybridInfer,一个旨在管理设备端、边缘端和云端大语言模型(LLM)推理的系统。该系统解决了设备端推理的热限制问题,这种限制可能导致移动GPU在持续使用过程中崩溃或无响应。HybridInfer采用强化学习方法,特别是Q学习,根据估计的复杂性、可用的热余量以及质量、延迟、成本和本地性之间的权衡来动态路由查询。这种方法旨在与始终使用设备端模型相比,提高可靠性并降低延迟,特别是对于较长的查询。 AI
影响 通过智能管理热限制,有可能实现更可靠、更高效的设备端大语言模型体验。
排序理由 详细介绍大语言模型推理路由新系统的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →