实体
MatGPTQ
MatGPTQ
PulseAugur coverage of MatGPTQ — every cluster mentioning MatGPTQ across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
MatGPTQ 实现嵌套量化大语言模型的推理效率
研究人员开发了一种名为 MatGPTQ 的新方法,用于高效运行已量化以使用更少比特的大语言模型(LLMs)。该方法允许单个模型检查点服务于多种精度级别,从而减少内存和延迟。MatGPTQ 通过使用更快的训练后量化方法并引入支持批处理的专用推理内核,改进了现有技术,与标准方法相比实现了显著的加速。
-
新的循环残差量化方法加速 LLM 部署
研究人员开发了循环残差量化 (RRQ),一种用于大型语言模型 (LLM) 的新型训练后量化框架。RRQ 通过将权重表示为具有连续量化残差校正的低比特量化基数,从而允许从单个检查点获得多种有效精度。该方法无需校准,并且比现有技术快得多,在 25 分钟内为 Qwen3-8B 构建了完整的 2-/4-/6-/8 位包,比 MatGPTQ 快 3.3 倍。在六个 LLM 上进行的实验表明,在 6 位和 8 位下具有可竞争的准确性,在 4 位下性能可变。