研究人员开发了一种名为 MatGPTQ 的新方法,用于高效运行已量化以使用更少比特的大语言模型(LLMs)。该方法允许单个模型检查点服务于多种精度级别,从而减少内存和延迟。MatGPTQ 通过使用更快的训练后量化方法并引入支持批处理的专用推理内核,改进了现有技术,与标准方法相比实现了显著的加速。 AI
影响 使量化大语言模型的服务更加实用,可能降低部署成本并提高可访问性。
排序理由 详细介绍大语言模型量化和推理新方法的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →