PulseAugur
实时 15:49:50
实体 EpiCache

EpiCache

PulseAugur coverage of EpiCache — every cluster mentioning EpiCache across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_98638 ·

    Nvidia、纽约大学和 Together AI 在 KV 缓存压缩和吞吐量方面取得进展

    来自 Nvidia 和纽约大学的研究人员开发了 TurboQuant,一种 KV 缓存压缩方法,可在 3-4 比特下实现理论最优。同时,Together AI 的 OSCAR 系统通过采用注意力感知旋转,将吞吐量提高了 8 倍。Apple 的 EpiCache 解决了另一个独立的问题,所有这三种技术都被证明是互补的,而非竞争关系。

  2. RESEARCH · CL_93251 ·

    新的LLM KV缓存压缩方法应对安全性和效率挑战

    研究人员正在开发新的方法来压缩大型语言模型(LLM)中的键值(KV)缓存,以减少内存使用并提高推理效率。AnchorKV通过偏向于不保留有害提示的token来关注安全性,而PolyKV通过对不同的Transformer层应用不同的策略和预算来优化压缩。Tangram在服务框架中实现了实用的非均匀KV缓存压缩,而BACON通过结合观察窗口注意力和最后查询证据来增强多模态KV缓存压缩。此外,TurboQuant和OSCAR代表了KV缓存量…

  3. RESEARCH · CL_39746 ·

    新方法解决长上下文 LLM KV 缓存压缩问题

    2026年5月和6月发布的多篇研究论文提出了压缩大型语言模型(LLM)键值(KV)缓存的新颖方法。这些技术旨在减少与长上下文长度相关的显著内存开销,从而在资源受限的环境中实现更高效的推理。方法包括偶发式管理、用于合并的全局回归、抗漂移检索和低秩近似,所有这些都旨在在大幅降低内存使用量和延迟的同时保持模型准确性。