PulseAugur
实时 06:58:53
实体 PagedAttention

PagedAttention

PulseAugur coverage of PagedAttention — every cluster mentioning PagedAttention across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_206773 ·

    计算、内存和存储领域探索LLM首次响应时间缩减策略

    减少大型语言模型(LLM)的首次响应时间(TTFT)对于用户体验和性能至关重要。这涉及到优化四个关键领域:计算、GPU内存、存储和整体架构。FlashAttention和PagedAttention等技术解决了计算和内存管理问题,但它们的有效性受到硬件带宽的限制。扩展GPU内存或将KV Cache分层到更快的存储(如NVMe-oF阵列)可以显著减少长上下文场景下的延迟,明信科技的解决方案就证明了这一点,该方案显示480B模型的TTFT…

  2. TOOL · CL_202316 ·

    KV 缓存和 PagedAttention 优化现有 GPU 上的 LLM 推理

    由于内存碎片化和重新计算,大规模语言模型推理在规模化时可能效率低下。源自开源引擎 vLLM 的 KV 缓存和 PagedAttention 等技术旨在优化推理过程中的 GPU 内存使用。KV 缓存存储先前计算的键值矩阵,以避免在解码阶段进行冗余计算,而 PagedAttention 通过更有效地管理碎片化内存来进一步增强这一点,从而提高吞吐量并降低延迟。

  3. TOOL · CL_200606 ·

    vLLM 对比 Ollama:LLM 的生产部署

    vLLM 和 Ollama 是用于部署大型语言模型的不同工具,各自针对不同的用例进行了优化。Ollama 在本地、单用户交互方面以简洁性见长,易于在个人机器上快速运行模型。相比之下,vLLM 专为高吞吐量的生产环境设计,通过 PagedAttention 和连续批处理等高级技术,能够高效地服务数百名并发用户。基准测试表明,在高度并发的情况下,vLLM 的性能显著优于 Ollama,每秒处理的令牌数几乎是 Ollama 的 20 倍,同…

  4. TOOL · CL_195390 ·

    vLLM:AI模型的高吞吐量推理引擎

    vLLM 是一个开源的推理和服务引擎,旨在通过其 PagedAttention 机制优化 GPU 利用率。该工具因其处理大型语言模型的效率而受到关注。

  5. TOOL · CL_187642 ·

    压缩感知不适用于大语言模型推理存储压缩

    由于大语言模型(LLM)推理过程中 KV 缓存数据的非稀疏性以及对确定性、无损操作的需求,压缩感知并非一种适用于压缩 KV 缓存数据的合适方法。相反,推理存储的实际改进来自于优化存储层级和访问路径,这已在 Mingxin FX100 系统中得到证明。这种方法通过将访问频率较低的数据卸载到更快的存储介质,显著降低了延迟和加载时间,同时不影响生成质量。

  6. TOOL · CL_187559 ·

    KV Cache预取大幅降低LLM推理延迟

    一种新的KV Cache数据预取策略已被开发出来,显著降低了大模型推理期间的存储延迟。该方法在明心FX100上使用480B模型进行了测试,推理吞吐量提高了40%,首个token的生成时间缩短了32%。该策略涉及在计算单元需要KV Cache块之前,将其从存储加载到更快的内存层级,这是随着上下文窗口扩展并超出GPU高带宽内存(HBM)容量而进行的关键优化。与KV Cache数据未命中时重新计算相比,这种方法提供了8.6倍到20倍的显著加速。

  7. TOOL · CL_181549 ·

    明玕 FX100 通过 KV Cache 复用提升 LLM 推理性能 · 追踪 2 个来源

    明玕 FX100 在大型语言模型的多轮对话场景中展现了显著的性能提升。通过实施 KV Cache 复用策略(即将先前对话轮次的键值张量缓存起来,避免重新计算),该系统实现了 29-40% 的吞吐量提升和 26-32% 的首个 token 时间缩减。这些提升在冷启动或冷恢复情况下尤为显著,与重新计算整个历史记录的基线相比,系统可以将推理速度提高高达 20 倍。

  8. COMMENTARY · CL_138790 ·

    大语言模型推理速度受硬件物理限制,而非模型复杂度

    一篇文章探讨了大语言模型(LLM)推理的性能瓶颈,认为主要限制因素并非模型本身,而是硬件的底层物理限制,特别是内存带宽。文章解释说,GPU的设计是为了大规模并行处理,对大型数据集执行相同的操作,这对于AI工作负载至关重要。文章强调,LLM的推理速度取决于两个关键GPU资源中较慢的那个:计算能力和内存带宽,并引入了算力强度(arithmetic intensity)的概念来衡量这种关系。

  9. TOOL · CL_138222 ·

    vLLM:开源引擎提升 AI 推理吞吐量

    vLLM 是一个专为高吞吐量设计的开源推理和服务引擎。它利用 PagedAttention 优化 GPU 利用率,使其成为 AI 开发的 eficient 工具。

  10. TOOL · CL_117583 ·

    HARD-KV 框架将 LLM 推理速度提升 2 倍

    研究人员开发了 HARD-KV,一个旨在优化长上下文大型语言模型 (LLM) 推理的新框架。该系统解决了头自适应压缩算法(通过动态内存预算提供准确性)与需要静态内存模式以提高效率的现代推理引擎(如 vLLM)之间的冲突。HARD-KV 引入了级联缓存 (Cascade Cache) 层级结构和逻辑校准 (Logits Calibration) 机制,以统一重要性指标并为不同模型头实现一致的预算分配。实验表明,HARD-KV 在保持超过…

  11. TOOL · CL_106135 ·

    KV 缓存内存问题困扰 LLM 服务,vLLM 的 PagedAttention 提供解决方案

    KV 缓存是 LLM 推理中的关键组件,它存储过去的计算结果,以避免为每个新 token 重新计算。然而,其内存占用可能成为一个重大瓶颈,尤其是在具有并发用户和长上下文窗口的生产环境中。单个序列可能消耗数 GB 的内存,当有多个对话同时进行时,会迅速超出 GPU 容量。传统方法为 KV 缓存预先分配大块连续内存,导致内部碎片化和内存浪费,因为大多数对话并未达到分配的最大长度。

  12. TOOL · CL_54473 ·

    Ollama、LM Studio、vLLM:选择合适的本地 LLM 运行时

    本文比较了三种本地 LLM 运行时:Ollama、LM Studio 和 vLLM,重点关注它们在生产环境中的适用性。Ollama 因其易于设置和兼容 OpenAI 的 API 而受到关注,非常适合快速的本地开发工作流程,但其批处理支持有限。LM Studio 因其以 GUI 为中心的设计和缺乏并发负载处理能力而被排除在生产环境之外。vLLM 被认为是强大的生产解决方案,提供 PagedAttention 和连续批处理等高级功能以实现…

  13. RESEARCH · CL_40163 ·

    KV 缓存优化解决 LLM GPU 内存瓶颈

    大型语言模型 (LLM) 在服务效率方面面临着显著的瓶颈,原因是 KV 缓存的内存需求,它存储中间注意力计算。这个 KV 缓存对于实现更快的响应和处理更长的上下文窗口至关重要,但它会消耗高达 80% 的 GPU 内存。像 vLLM 的 PagedAttention 这样的创新,其灵感来自操作系统内存管理,通过优化 KV 缓存存储和减少内存碎片来解决这个问题,从而显著提高推理吞吐量。

  14. RESEARCH · CL_36289 ·

    LLM 推理和推理技术随着新研究和硬件的进步而发展

    研究人员正在探索新的方法来提高大型语言模型 (LLM) 的效率和推理能力。Google Research 正在开发训练 LLM 以贝叶斯方式进行推理的技术,从而提高它们更新概率估计和泛化到新任务的能力。同时,推理优化方面的进展包括“投机级联”,它将更小、更快的模型与更大的模型结合起来,以及“上下文回收”来管理长对话范围。此外,正在开发“级联多粒度剪枝”和“SharQ”等方法来压缩 LLM 以进行设备上推理,从而在保持准确性的同时降低延…