研究人员推出了一种新颖的稀疏注意力机制NAMOH,旨在提高大型语言模型的效率和有效性,尤其是在扩展上下文长度方面。NAMOH通过每个token仅激活一部分注意力头来实现这一点,每个头处理token的特定子序列。这种方法允许参数扩展直接实现上下文扩展,在计算成本降低的同时,可能优于同等参数数量的密集模型。该机制与Grouped-Query Attention (GQA) 等现有技术和其他稀疏注意力方法兼容。 AI
影响 这种新的注意力机制可能带来更高效、更强大的LLM,有望降低推理成本,并为复杂任务实现更长的上下文窗口。
排序理由 该集群包含一篇详细介绍LLM注意力机制新技术的 ist 研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →