研究人员推出了一种新颖的多精度权重格式 StagQ,旨在实现大型语言模型(LLMs)的高效服务。StagQ 利用带有额外精炼平面的 2 位基础流,允许将所有支持的精度作为前缀读取,而无需模型权重的多个副本。这种方法在 Llama-3.1-8B、Phi-4 和 OLMo-2-7B 等模型的 MMLU 分数上显示出显著的改进,优于现有的多精度基线。 AI
影响 这种新的权重格式可以实现更高效的大型语言模型的部署和服务,可能降低基础设施成本并提高推理速度。
排序理由 该集群描述了一篇关于大型语言模型权重量化新颖技术方法的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →