PulseAugur
实时 08:34:10
实体 KV caches

KV caches

PulseAugur coverage of KV caches — every cluster mentioning KV caches across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. COMMENTARY · CL_210725 ·

    6 种架构转变以优化 LLM 管道的成本和延迟

    文章提出了六种架构转变,通过降低 Token 成本和延迟来优化大型语言模型 (LLM) 管道。它提倡实施严格的检索增强生成 (RAG) 和向量数据库,以仅获取相关上下文,并利用静态提示元素的上下文缓存来改善首次 Token 的时间。作者还建议将提示的复杂性与工作负载相匹配,将单体提示分解为可组合的模块,并将非生成任务卸载到更高效的系统。

  2. TOOL · CL_190063 ·

    BinaryPC 为高效 LLM 解码提供无需训练的稀疏注意力

    研究人员开发了 BinaryPC,这是一种新颖的稀疏注意力机制,旨在提高长上下文大型语言模型的效率。这种无需训练的方法使用二值主成分创建紧凑的哈希码,在无需基于梯度的训练的情况下保留结构数据信息。实验表明,BinaryPC 在保持与全注意力相当的准确性的同时,显著优于其他稀疏和基于哈希的方法,在现代 GPU 上与 FlashAttention 相比实现了 3.56 倍的吞吐量提升。

  3. TOOL · CL_126863 ·

    Llama-server 错误丢弃 KV 缓存,修复恢复快速状态恢复

    llama-server 中的一个错误导致它丢弃了恢复的 KV 缓存,强制进行完全的重新预填充,并显著增加了处理时间。该问题源于服务器的状态保存机制,该机制序列化了 token 数据,但没有序列化高效回滚所需的检查点元数据。成功的修复方法是将此检查点元数据持久化到侧边栏文件中,从而实现更快的状态恢复,并避免冗长的提示重新计算。

  4. TOOL · CL_119710 ·

    InfoFlow KV 改进了长上下文的检索增强生成

    研究人员开发了 InfoFlow KV,一种用于改进大型语言模型中检索增强生成(RAG)的新颖方法。该技术通过选择性地重计算 KV 缓存来解决推理过程中预填充大型检索上下文的瓶颈问题。InfoFlow KV 将选择性重计算建模为一个信息流问题,在一致的 RoPE 几何结构下使用注意力范数信号来识别语义相关和结构上有影响力的 token。实验表明,在 LLM 和视觉语言模型基准测试中取得了持续的性能提升。

  5. RESEARCH · CL_05362 ·

    TurboQuant 将 AI 向量压缩至 2-4 比特,准确率无损

    一种名为 TurboQuant 的新方法已被开发出来,用于将 AI 向量(如 KV 缓存和注意力键中的向量)压缩至每数字低至 2-4 比特,而不会牺牲准确性。该技术依赖于这样一个原理:随机旋转可以将输入向量转换为一个坐标遵循可预测模式的分布。通过为该分布使用预先设计的码本,TurboQuant 可以有效地压缩来自各种输入的向量。