LLM-Compressor
PulseAugur coverage of LLM-Compressor — every cluster mentioning LLM-Compressor across labs, papers, and developer communities, ranked by signal.
-
Kimi-K3 微型模型发布,可在 Hugging Face 上进行测试
moonshotai/Kimi-K3 模型的一个较小、拥有 0.4 亿参数的版本已在 Hugging Face 上发布,用于测试和开发目的。这个名为 inference-optimization/Kimi-K3-0.40B 的微型模型保留了其更大版本的一些关键架构特性,包括 KimiDeltaAttention 与 KimiMLAAttention 层 3:1 的比例以及注意力残差连接。它使用 LLM-Compressor 工具创建,…
-
MedGemma-1.5-4B 使用 llm-compressor 量化到 INT4
一份技术指南详细介绍了使用 llm-compressor 库将 Google 的 MedGemma-1.5-4B 医学视觉语言模型量化到 INT4 (W4A16) 的过程。作者遇到了并解决了几个问题,包括 AutoAWQ 的弃用以及与 Gemma3 架构的兼容性问题。该指南提供了设置环境、加载模型、准备校准数据集和运行量化过程的具体步骤,最终将模型的自托管部署大小从 8.6 GB 减少到 5.2 GB。
-
Stateful Transformers 提升流式推理性能;Intel 发布 AutoRound 量化工具包
一篇新论文介绍了一种有状态的 Transformer 推理引擎,通过维护持久的 KV 缓存,显著加快了流式数据的处理速度。这种方法实现了与累积上下文大小无关的查询延迟,在市场数据基准测试中比现有引擎快了 5.9 倍。此外,Intel 发布了 AutoRound,一个用于 LLM 和 VLM 的先进量化工具包,可在超低比特宽度(2-4 位)下实现高精度和广泛的硬件兼容性,并与 vLLM 和 Transformers 等流行框架集成。