实体
TriAttention
TriAttention
PulseAugur coverage of TriAttention — every cluster mentioning TriAttention across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
TriAttention方法针对LLM KV缓存缩减进行了优化
一篇新论文介绍了一种TriAttention方法的优化方案,旨在降低长上下文大语言模型(LLM)中缩减KV缓存的计算成本。所提出的方法利用一个代数恒等式,将17个距离的平均值折叠成一个单一的、可预先计算的权重,从而简化了缓存键的评分。此优化将每个键的评分成本从十七次评估减少到一次,而不会改变修剪哪些键,从而提供了适度的计算节省。
-
新的 KV 缓存压缩方法 alpha 优于现有技术
研究人员开发了一种新的 KV 缓存压缩方法 alpha,它使用多样性惩罚幸存者方法。在数学推理任务的设计空间研究中,该方法被发现优于其他七种机制。alpha 方法只有一个可调权重,在特定的模型和预算组合上取得了显著成果,突显了最小评分修改比更重的结构性更改更有效。