PulseAugur
中
实时 10:01:35
实体 KV cache

KV cache

PulseAugur coverage of KV cache — every cluster mentioning KV cache across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
201
90 天内 201
发布 · 30天
0
90 天内 0
论文 · 30天
110
90 天内 110
层级分布 · 90 天
主题
关系
情绪 · 30 天

16 天有情绪数据

最近 · 第 1/10 页 · 共 200 条
  1. TOOL · CL_289511 ·

    新的GUI-KV方法提高了视觉语言代理的效率

    研究人员开发了GUI-KV,一种提高利用视觉语言模型图形用户界面(GUI)代理效率的新颖方法。这些代理由于处理大量高分辨率屏幕截图而常常面临推理速度慢的问题。GUI-KV通过压缩键值缓存(存储过去信息的组件)来解决这个问题,而无需重新训练模型。该方法结合了空间显著性引导以保留重要的视觉细节,以及时间冗余评分以修剪重复的历史数据。实验表明,GUI-KV可以在保持准确性或甚至提高准确性的同时,显著降低计算成本,并且优于现有的缓存压缩技术。

  2. TOOL · CL_289209 ·

    Azure AI Foundry:缓存与 KV 缓存复用将 LLM 成本降低 50%

    通过结合使用缓存、KV 缓存复用和智能路由,可以优化 Azure AI Foundry 上的 LLM 成本。一个 .NET LLM 服务通过实施这些策略,可以在保持低延迟的同时,将 token 支出降低高达 50%。关键考虑因素包括平衡模型粒度与成本、管理缓存一致性以及决定 KV 缓存复用的状态性。

  3. TOOL · CL_286908 ·

    SPIN方法提升LLM注意力效率,降低延迟并提高吞吐量

    研究人员开发了一种新颖的方法SPIN(Shadow Predictive Indexer),用于优化大型语言模型中的稀疏注意力机制。SPIN通过使用轻量级的、基于历史的预测来识别重要的KV块,从而减少了对整个KV缓存进行评分的计算开销。这种方法在保持任务质量的同时实现了显著的稀疏性,并在vLLM中将服务吞吐量提高了14.9%,将延迟降低了13.2%。

  4. SIGNIFICANT · CL_287348 ·

    华为推出专用KV缓存存储,但SSD标准滞后

    华为推出了OceanStor M900,这是一种专用的KV缓存存储解决方案。KV缓存是AI模型推理中用于存储和重用先前计算信息的一个组件。此举与英伟达的CMX Context Memory Storage类似,旨在通过将KV缓存数据从昂贵的DRAM卸载到更经济的固态硬盘(SSD)上来减少冗余计算并节省处理能力。然而,这些SSD的具体要求,如耐用性(DWPD)和标准化,仍在开发中,目前的行业讨论范围从3到9 DWPD不等。该策略的最终成…

  5. RESEARCH · CL_284805 ·

    新研究探索压缩大型语言模型推理痕迹以提高效率的方法

    研究人员正在开发新的方法来压缩大型语言模型(LLM)的中间推理步骤,即“思维链”(Chain-of-Thought, CoT),以在不牺牲准确性的前提下降低计算成本。一种名为BreadthKV的方法侧重于平衡缓存令牌的数量及其精度,其表现优于简单的淘汰方法,并可与更复杂的技术相媲美。另一种名为SEER的方法,则通过抑制冗余或循环的痕迹来优化自生成的CoT数据,并微调模型以内化简洁的推理。第三种技术CALR,利用连续锚定潜在推理将中间状…

  6. TOOL · CL_281860 ·

    LLM 服务拆分为两个阶段,GPU 通量加倍

    现代 LLM 服务架构正通过将过程拆分为两个不同的阶段来更有效地处理请求:预填充(prefill)和解码(decode)。预填充阶段处理整个提示,是计算密集型的,受益于高 GPU 利用率。解码阶段负责逐个生成 token,是内存带宽密集型的,需要高效的 KV 缓存管理。PagedAttention、连续批处理(continuous batching)和分块预填充(chunked prefill)等创新对于优化这些阶段至关重要,而分离式…

  7. COMMENTARY · CL_280722 ·

    常见的 LLM 基准测试陷阱被揭露:缓存、指标和配置错误

    大型语言模型(LLM)的基准测试可能极其复杂,许多常见的陷阱会导致结果不准确。一个显著的问题是前缀缓存,如果处理不当,可能会夸大吞吐量测量结果,尤其是在跨测试运行重复使用提示时。另一个问题源于对指标的误解,例如计算服务器发送事件(SSE)块而不是实际 token,这会导致性能被严重低估。此外,细微的配置差异,如意外的 8 位 KV 缓存设置,会改变内存容量并扭曲结果。最后,同时更改多个配置参数使得无法隔离任何单一更改的影响,而自动稳定…

  8. TOOL · CL_280348 ·

    分类后缀可提升 LLM Agent 检测恶意输入的能力

    研究人员调查了使用分类后缀来提高 LLM Agent 检测恶意输入有效性。他们的研究测试了 13 个安全基准和三个开源模型家族的各种后缀,发现附加分类指令比不加后缀更能持续地提高分布外检测能力。后缀的措辞很重要,分类提示比不相关或仅仅是关注提示更有效。这种好处源于分类格式本身,具体标准仅在更严格的阈值下增加精度。研究结果表明,通过 KV 缓存分叉提供的这些分类后缀可以成为激活探测监控器的经济高效的补充,尽管其有效性取决于特定模型和读出方法。

  9. TOOL · CL_280277 ·

    WakeKV 为 LLM 引入反应式 KV 缓存驻留

    研究人员开发了 WakeKV,这是一种新颖的 KV 缓存驻留策略,旨在提高大型语言模型的效率。与固定头分类的现有方法不同,WakeKV 会动态地将生成过程中行为发生变化的头移动到可恢复的 CPU 存储库中。这种反应式方法在各种模型和任务中持续提高性能,在内存受限的情况下优于 SnapKV 和 ReasonAlloc 等方法。

  10. TOOL · CL_279517 ·

    PagedAttention和连续批处理革新大语言模型推理

    大语言模型(LLM)服务基础设施在扩展推理方面面临严峻挑战,主要源于内存带宽和容量限制,而非原始计算能力。PagedAttention和连续批处理等关键创新,由vLLM等引擎率先推出,通过优化KV缓存的管理来解决这些问题。PagedAttention借鉴了操作系统虚拟内存的理念,将KV缓存划分为更小的块,将内存浪费从60%以上降低到4%以下,并提高了并发性。连续批处理通过在迭代级别处理请求,进一步提高了效率,避免了静态批处理和长时间等…

  11. TOOL · CL_275286 ·

    研究发现:超高带宽闪存可提升大语言模型服务性能

    一项新的研究论文探讨了使用超高带宽闪存(HBF)来增强高带宽内存(HBM)以用于大语言模型(LLM)服务。该研究引入了一个分层存储系统和一个缓冲感知调度方法,以管理HBF的访问成本和有限的写入寿命。模拟显示,HBF增强的系统可以将完成时间最多缩短87%,节省能源,并延长HBF的估计写入寿命。

  12. RESEARCH · CL_280204 ·

    Foresight架构赋能流式视觉语言模型实现主动感知

    研究人员开发了FORESIGHT,一种用于流式视觉语言模型(VLMs)的新型双流架构,可在无需重新训练的情况下实现主动感知。通过使用两个具有共享权重的Siamese LLM,一个LLM处理传入的视觉数据,另一个则预测未来事件并相应地规划计算资源。这种方法允许模型根据不断变化的场景动态调整其感知策略,从而在OmniPro Online、StreamingBench和OVO-Bench等基准测试中取得显著的性能提升。

  13. TOOL · CL_269454 ·

    新的大语言模型服务系统通过双精度优化KV缓存内存

    研究人员开发了DPS,一个双精度大语言模型服务系统,它动态调整模型精度以优化KV缓存内存。通过在KV缓存需求高的时期切换到模型的低精度变体,DPS可以将未使用的权重内存重新用于KV缓存块。这种基于半统一内存(SUM)的方法,在保持FP16级别精度的同时,将持续吞吐量提高了3.3倍,有效pass@1提高了41个百分点。

  14. TOOL · CL_285180 ·

    SlimWise 框架提升 MoE 模型服务效率

    研究人员开发了 SlimWise,一个旨在提高专家混合(MoE)模型服务效率的新框架。SlimWise 将专家剪枝解耦,仅在解码阶段应用,而在预填充阶段使用完整模型。这种方法允许在解码过程中重用预填充生成的 KV 缓存,显著减少流量瓶颈。该框架还包括一个低成本的蒸馏阶段,以进一步弥合准确性差距。在 vLLM 中实现后,SlimWise 在 Qwen3.6-35B-A3B 模型上实现了高达 1.81 倍的解码吞吐量提升,同时仅进行了 5…

  15. RESEARCH · CL_268807 ·

    新方法解决LLM KV缓存压缩问题,实现高效长上下文推理 · 跟踪10个来源

    多篇研究论文介绍了压缩大型语言模型KV缓存的新技术,这是高效长上下文推理的关键组成部分。这些方法旨在通过智能管理KV缓存来减少内存使用并提高推理速度。方法包括时间预取、具有专用查询和键变换的低比特量化、跨循环使用残差状态、基于注意力几何的自适应剪枝以及LLM引导的策略演化。其他策略侧重于优化驱逐时机和使用蒙特卡洛估计来预测未来令牌效用。

  16. SIGNIFICANT · CL_259112 ·

    华为推出 OceanStor M900 用于 AI 推理,配备 PB 级 KV 缓存 · 跟踪 2 个来源

    华为推出了 OceanStor M900,这是一款专为超大规模推理设计的新型 AI 内存存储解决方案。该系统具有 PB 级键值 (KV) 缓存,旨在增强代理和长上下文推理等应用的 AI 基础设施。OceanStor M900 拥有 NPUs 和 SSD 之间的低延迟、高聚合带宽以及 KV 感知调度能力。

  17. TOOL · CL_259264 ·

    撤回的论文提出了用于LLM对齐的KV缓存压缩方法

    一篇由作者Rui Zhu撤回的研究论文,探讨了在大型语言模型(LLM)训练后对齐过程中压缩KV缓存的方法。该研究旨在解决在长上下文推理任务的强化学习中遇到的显著内存开销和策略外偏差问题。提出的影子掩码蒸馏(Shadow Mask Distillation)技术试图通过提高RLHF和RLAIF等对齐过程中的内存效率来缓解这些问题。

  18. TOOL · CL_259248 ·

    HyQuant框架通过混合精度量化优化LLM注意力

    研究人员开发了HyQuant,一个新颖的混合精度量化框架,旨在提高大型语言模型(LLM)注意力机制的效率。该方法将大部分注意力状态量化为低比特格式,同时将垂直线令牌和局部窗口状态等关键组件保留在更高精度下。HyQuant旨在减少量化误差,并在各种任务和模型中保持准确性,为LLM注意力优化提供了实际可行性。

  19. TOOL · CL_259225 ·

    AI代理报告工具进度以提高性能

    研究人员开发了一种新方法,使AI代理在使用外部工具时能更好地管理其进度。当前系统经常猜测工具需要多长时间,导致GPU内存使用效率低下。提出的解决方案涉及工具实时报告其进度,提供比以往估算方法更准确的信号。这种方法可以显著减少代理在工具调用后收到第一个令牌所需的时间,从而提高整体性能。

  20. TOOL · CL_257552 ·

    提示缓存通过重用 KV 缓存将大语言模型成本削减高达 75%

    提示缓存是一种通过重用计算状态(称为 KV 缓存)来显著降低使用大语言模型成本的技术。当系统提示和少样本示例等静态内容出现在提示的开头时,此方法最为有效,从而使具有相同前缀的后续请求产生最低成本。开发人员可以通过将动态用户查询放在提示的末尾来优化提示结构,以最大化缓存命中率,从而在令牌密集型工作负载上实现 50-75% 的节省。