NVIDIA Model Optimizer
PulseAugur coverage of NVIDIA Model Optimizer — every cluster mentioning NVIDIA Model Optimizer across labs, papers, and developer communities, ranked by signal.
-
Nvidia 发布 GLM-5.3-Flash NVFP4 多模态模型,支持 1M 上下文
Nvidia 发布了 GLM-5.3-Flash NVFP4 模型,这是 ZAI 的 GLM-5.3-Flash 的量化版本。这款多模态混合专家模型专为推理、编码和智能体任务设计,采用混合注意力架构,支持高达 100 万个 token 的上下文长度。该模型针对 NVIDIA 硬件进行了优化,提供更快的训练和推理速度,并兼容 vLLM 和 SGLang 等各种运行时引擎以及 NVIDIA Blackwell 微架构。
-
Unsloth 加速 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 性能
Unsloth 发布了更新,显著加速了 Qwen3.8-Flash-Next 和 GLM-5.3-Flash 模型的性能,提供高达 2 倍的生成速度提升和更低的 token 消耗。这些改进归功于多轮规划 (MTP) 和针对 Apple Silicon 优化的 MLX 推理等优化,能够实现更长、更快的聊天。此次发布还包括对模型加载、聊天编辑安全、本地媒体 API 和硬件兼容性(特别是 AMD GPU)的广泛增强。
-
NVIDIA 发布 Qwen-Image-Flash 文本到图像模型
NVIDIA 发布了 Qwen-Image-Flash,一款新的文本到图像生成模型。该模型是 Qwen/Qwen-Image 的一个精简版本,采用了 NVIDIA 的 FastGen、Model Optimizer 和 AutoModel 项目中的四步过程和 DMD2 蒸馏技术。调度器被配置为特定的四步轨迹,旨在从文本提示高效生成图像。
-
NVIDIA 发布 Qwen-Image-Flash 以实现快速文本到图像生成
NVIDIA 发布了 Qwen-Image-Flash 模型,这是 Qwen/Qwen-Image 模型的蒸馏版本,专为快速文本到图像生成而设计。该模型采用四步 DMD2 蒸馏过程,并针对 NVIDIA 硬件进行了优化,提供更快的推理速度。它适用于商业和非商业用途,面向开发人员和研究人员,用于创意内容原型设计和对延迟敏感的应用。
-
NVIDIA发布Kimi-K2.6-DFlash以优化Moonshot AI延迟
NVIDIA推出了Kimi-K2.6-DFlash,这是专为Moonshot AI的Kimi-K2.6模型设计的草稿头。该新组件通过NVIDIA Model Optimizer针对推测解码进行了优化,旨在减少在NVIDIA GPU硬件上运行时代理和RAG系统的延迟。Kimi-K2.6-DFlash是在NVIDIA Open Model License下发布的。