研究人员开发了 ExaGEMM 框架,旨在优化 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作。该框架解决了高效执行不适合传统 CPU 架构的低比特精度权重和激活的挑战。通过共同探索参数化内核和轻量级 SIMD 指令集支持,ExaGEMM 显著减小了最优配置的搜索空间,并为特定的 ML 模型和 CPU 目标生成定制化解决方案。该系统展示了显著的延迟改进,特别是在混合精度 LLM 工作负载方面,与纯软件方法相比,速度提升高达 13.29 倍。 AI
影响 优化 CPU 上的机器学习推理,可能支持 LLM 在边缘设备上更高效地部署。
排序理由 该条目描述了一个用于优化 CPU 上机器学习推理的新框架和方法论,发表在研究论文中。 [lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →