研究人员开发了一种新的方法来攻击大语言模型(LLM)的服务框架,而不是模型本身。这种“填充与挤压”(Fill and Squeeze)策略通过耗尽 KV 缓存并强制重复抢占来攻击调度器的状态转换。该攻击在 vLLM 框架上显著降低了首次令牌生成时间(TTFT)和每个输出令牌的时间,在实际的黑盒环境中以比以前更低的成本证明了其有效性。 AI
影响 这项研究突显了大语言模型服务基础设施中一类新的漏洞,可能影响部署安全性和成本效益。
排序理由 详细介绍大语言模型服务框架新攻击方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →