一项新近发表在arXiv上的研究,对大型语言模型中使用的八种不同的自注意力机制进行了基准测试,重点关注它们在训练过程中的资源利用率。该研究训练了一个GPT-2架构,发现像Flash Attention、Locality-Sensitive Hashing (LSH) Attention和Multi-Head Latent Attention (MLA)这样的优化内核实现是最节能的。研究强调,仅仅减少GPU功耗不足以实现能效,因为训练时间在总能耗中也起着至关重要的作用。 AI
影响 强调了在LLM中选择资源高效的注意力机制时,进行能耗感知基准测试的重要性。
排序理由 详细介绍AI模型组件比较研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Flash Attention
- GitHub
- GPT-2
- Hugging Face
- Locality-Sensitive Hashing (LSH) Attention
- Multi-head Latent Attention (MLA)
- Zhengyu Tian
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →