一个团队已成功将 Tencent 的 Hy3 295B 模型量化为 1 位版本,生成的 GGUF 文件足够小,可以在单台 4-GPU 设置上运行。此次本地 1 位量化实现了约每秒 83 个 token 的速度,比云 API 版本约每秒 37 个 token 快 2.2 倍。尽管速度显著提升,但 1 位量化模型在质量上没有损失,在生成自玩游戏等复杂任务中产生了可比的结果。 AI
影响 展示了在本地运行大型模型并显著加速的可行途径,有可能减少对云 API 的依赖。
排序理由 该条目描述了一种应用于现有大型语言模型的新颖量化技术,详细说明了性能改进和质量比较。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →