PulseAugur
实时 19:17:00
English(EN) ExaGEMM: Exploration Framework for CPU-Driven ML Inference via Associative In-Register Computing for Low-Bit GEMM

ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能 · 跟踪 2 个来源

研究人员开发了 ExaGEMM,这是一个旨在优化传统 CPU 上机器学习推理的低比特通用矩阵乘法 (GEMM) 操作的框架。该框架解决了有效执行通常不适合标准 CPU 架构的超低比特精度计算的挑战。ExaGEMM 共同设计了参数化内核和轻量级 SIMD 指令集架构 (ISA) 支持,分析了寄存器可行性、计算成本和硬件开销等因素,以显著缩小搜索空间。与纯软件基线相比,该系统在机器学习模型的延迟方面实现了 13.29 倍的提升,特别突出了其对混合精度 LLM 工作负载的有效性。 AI

影响 优化 CPU 推理的低比特 GEMM,有可能加速标准硬件上的机器学习模型部署。

排序理由 该集群包含一篇学术论文,详细介绍了用于优化 CPU 上机器学习推理的新框架。

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

ExaGEMM 框架通过低比特 GEMM 优化提升 CPU 机器学习推理性能 · 跟踪 2 个来源

报道来源 [2]

  1. arXiv cs.LG TIER_1 English(EN) · Hyunwoo Oh, Suyeon Jang, Hanning Chen, Sanggeon Yun, Ryozo Masukawa, Mohsen Imani ·

    ExaGEMM:通过寄存器内关联计算探索低比特 GEMM 的 CPU 驱动的 ML 推理框架

    arXiv:2607.14622v1 Announce Type: cross Abstract: Low-bit GEMM is increasingly central to efficient ML inference, yet very-low-bit execution remains a poor fit for conventional CPUs. Practical deployment spans fragmented regimes-from 1/2/4-bit weights to varying activation precis…

  2. arXiv cs.LG TIER_1 English(EN) · Mohsen Imani ·

    ExaGEMM:一种通过寄存器内关联计算实现低比特 GEMM 的 CPU 驱动的机器学习推理探索框架

    Low-bit GEMM is increasingly central to efficient ML inference, yet very-low-bit execution remains a poor fit for conventional CPUs. Practical deployment spans fragmented regimes-from 1/2/4-bit weights to varying activation precision-whose feasibility, reuse opportunity, and supp…