PulseAugur
中
实时 00:05:08
English(EN) HybridInfer: Thermal-Aware Reinforcement-Learning Tier Routing for On-Device, Edge, and Cloud LLM Inference

新的HybridInfer系统利用热感知来路由大语言模型推理

一篇新研究论文介绍HybridInfer,一个旨在管理设备端、边缘端和云端大语言模型(LLM)推理的系统。该系统解决了设备端推理的热限制问题,这种限制可能导致移动GPU在持续使用过程中崩溃或无响应。HybridInfer采用强化学习方法,特别是Q学习,根据估计的复杂性、可用的热余量以及质量、延迟、成本和本地性之间的权衡来动态路由查询。这种方法旨在与始终使用设备端模型相比,提高可靠性并降低延迟,特别是对于较长的查询。 AI

影响 通过智能管理热限制,有可能实现更可靠、更高效的设备端大语言模型体验。

排序理由 详细介绍大语言模型推理路由新系统的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的HybridInfer系统利用热感知来路由大语言模型推理

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Simran Koul ·

    HybridInfer:面向设备端、边缘端和云端 LLM 推理的热感知强化学习分层路由

    arXiv:2609.30270v1 Announce Type: new Abstract: On-device inference with small language models keeps user data local, works offline, and incurs no per-query cost, so the on-device tier is preferred when it is adequate. It is thermally constrained, however, and I find the constrai…