arXiv 上的一篇新研究论文提出了一种分析方法,用于估算在 NVIDIA H100 等 GPU 上运行的大型语言模型 (LLM) 推理的能耗。该方法旨在提供一种无需直接硬件遥测即可近似估算能源使用量的方法,这对于比较研究和系统设计非常有用。该方法将能耗分解为计算、内存访问和注意力机制等组成部分,并区分了提示预填充和自回归解码阶段。 AI
影响 为分析和优化 LLM 部署的能源效率提供了一个框架。
排序理由 在 arXiv 上发表的研究论文,详细介绍了一种估算 LLM 推理能耗的新方法。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →