研究人员开发了 ExaGEMM,这是一个旨在优化传统 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作的框架。该框架解决了有效执行通常不适合标准 CPU 架构的超低比特精度计算的挑战。ExaGEMM 共同设计了参数化内核和轻量级 SIMD 指令集架构 (ISA) 支持,分析了寄存器可行性、计算成本和硬件开销等因素,以显著缩小搜索空间。与纯软件基线相比,该系统在机器学习模型的延迟方面实现了 13.29 倍的提升,特别突出了其对混合精度 LLM 工作负载的有效性。 AI
影响 优化 CPU 推理的低比特 GEMM,有可能加速标准硬件上的机器学习模型部署。
排序理由 该集群包含一篇学术论文,详细介绍了用于优化 CPU 上机器学习推理的新框架。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →