PulseAugur
实时 21:45:58
实体 W4A16

W4A16

PulseAugur coverage of W4A16 — every cluster mentioning W4A16 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_211588 ·

    LLM量化:不止是比特缩减

    大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。

  2. TOOL · CL_206377 ·

    ExactMoE 将 MoE 模型内存使用量减少 87%,准确性损失极小

    研究人员开发了 ExactMoE,一种用于稀疏专家混合(MoE)语言模型的新型推理设计,可显著降低内存需求。通过仅对激活的专家应用四位权重量化并将它们存储在特定格式中,ExactMoE 在保持高推理吞吐量和准确性的同时,大幅减少了峰值 GPU 内存使用量。该方法允许仅存储和移动必要的专家组件,解决了大型 MoE 模型面临的关键部署挑战。

  3. TOOL · CL_175486 ·

    INT4 仅权重量化:解码加速、Prefill 停滞解析

    仅权重 INT4 量化虽然能有效减少内存流量并加速 LLM 推理的解码阶段,但并不能改善 Prefill 阶段。这是因为 Prefill 是计算密集型的,即它受限于 GPU 的处理能力而非内存带宽。INT4 权重所需的解量化过程会增加开销,抵消了 Prefill 阶段的任何潜在收益。对于计算密集型场景,建议的替代方案是量化激活或接受 INT4 以获得容量优势。