研究人员在语言模型的边缘注意力空间中识别出一个保守的信号,该信号在不同的LLM中保持一致。当按token减少时,该信号反映了文本的内在属性,并与网络的输入-输出雅可比矩阵相关联。当按head减少时,它会创建一个特定模型的签名,可用于优化键值缓存逐出策略,并展现出与现有方法相媲美的性能。 AI
影响 揭示了LLM中一个保守的内部机制,可能导致更有效的KV缓存逐出策略。
排序理由 该集群包含一篇详细介绍语言模型内部机制研究结果的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →