研究人员开发了 LLMET,一个跨层仿真框架,用于评估新兴的单片 3D (M3D) 内存技术对大型语言模型 (LLM) 服务能效的影响。研究表明,显著增加片上缓存容量可将 LLM 预填充阶段的能耗降低高达 44%。例如,在双 NVIDIA A100 GPU 设置上将 L2 缓存从 40MB 扩展到 1GB,为 Llama3.1-70B 模型带来了显著的节能效果。 AI
影响 片上内存容量的显著增加可能导致更节能、更具成本效益的 LLM 部署。
排序理由 该集群描述了一篇研究论文,其中详细介绍了新的仿真框架及其在 LLM 服务内存技术方面的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →