一个影响Apple Silicon上Gemma模型的缓存bug已被发现,导致本地AI代理性能显著下降。该问题源于Gemma的滑动窗口注意力机制,当上下文长度超过一定阈值时,KV缓存重用会无声失败。修复方法是将缓存类型更改为普通的KVCache,这可以在不影响模型输出质量的情况下恢复性能,使本地编码代理的速度提高高达20倍。 AI
影响 修复了Apple Silicon上Gemma模型的无声性能bug,可能显著加快本地AI代理的速度。
排序理由 该条目描述了一个针对在Apple Silicon上使用Gemma模型的特定本地AI设置的bug修复和性能改进,而不是一个新的模型发布或重大行业事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →