实体
Kivi
Kivi
PulseAugur coverage of Kivi — every cluster mentioning Kivi across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新技术旨在提高LLM KV缓存效率和准确性
研究人员正在探索新颖的方法来优化大型语言模型的KV缓存,以提高其效率。KV缓存是推理的关键组件,但以其高内存和带宽需求而闻名。一种称为局部分布恢复的方法,旨在通过专注于恢复logits的局部分布来减轻低比特KV缓存量化引起的准确性下降。另一项研究调查了训练时正则化技术(特别是SIGReg)是否可以重塑模型表示以更好地支持KV缓存量化,发现直接KV正则化在某些量化方案下是有益的,但其优势会随着更先进的方法而减弱。
-
新的 KV 缓存压缩技术提升大语言模型推理性能 · 跟踪 9 个来源
多篇研究论文探讨了优化大语言模型(LLM)服务中的键值(KV)缓存的新技术,以解决内存和性能瓶颈。这些方法包括量化、剪枝、合并和频率引导压缩,旨在减少内存使用并提高长上下文工作负载的推理速度。研究评估了这些技术在各种基准测试和模型上的表现,强调了压缩率、任务质量和系统性能之间的权衡,并建议根据工作负载选择压缩策略。