QKV
PulseAugur coverage of QKV — every cluster mentioning QKV across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Stable Diffusion 通过新的稀疏注意力后端获得速度提升
一种名为稀疏注意力的 Stable Diffusion 注意力机制的新后端已被开发出来,它提供了性能改进和更低的 VRAM 使用量。通过 ComfyUI 的自定义节点可用的此优化,通过实现协同内存内剪枝和片上重计算,旨在将生成速度提高 5-20%。稀疏注意力的有效性和质量影响取决于其在扩散过程中的应用,早期步骤影响提示遵循度,后期步骤影响时间伪影。
-
LLM技术讨论涵盖QKV、RAG和训练陷阱
讨论围绕大型语言模型(LLM)的技术方面展开,特别关注如何使用QKV(查询、键、值)投影来处理输入。检索增强生成(RAG)被强调为一种通过检索相关信息块来 grounding LLM响应的方法。此外,对话还触及了随机反向传播可能对模型训练产生负面影响的可能性。
-
开发者测试自定义 GPT 模型以获取 token 速度
一位开发者正在测试一个自定义构建的 GPT 模型,重点关注性能指标。该模型已集成 QKV(Query, Key, Value)机制,目前正在进行 token 速度的基准测试。
-
形式证明显示 Transformer 可以执行精确的贝叶斯推理
一篇新论文正式证明了 Transformer 架构可以作为完整的贝叶斯过程运行。该研究在测度论核框架内进行,表明当 Transformer 满足特定的贝叶斯联合分布条件时,其内部计算等同于精确的贝叶斯后验推理。这种等价性从核心的贝叶斯 Transformer 到完整的多层堆栈都成立,其中 Softmax 注意力机制被特别证明可以诱导一个有效的概率分布。
-
Transformer 研究发现 QKV 投影共享可大幅减少内存使用
研究人员调查了 Transformer 模型中三个独立投影(查询、键和值)的必要性。他们的研究发现,共享投影,特别是 Q-K=V 变体,可以在对性能影响极小的情况下显著减少 KV 缓存内存使用。这种方法,特别是与分组查询注意力结合使用时,可提供可观的内存节省,可能支持更高效的设备端推理。