NVFP4
PulseAugur coverage of NVFP4 — every cluster mentioning NVFP4 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的OSFP4量化方案提高了LLM推理精度
研究人员开发了一种名为OSFP4的新量化方案,旨在提高NVFP4数据类型在大型语言模型(LLM)推理中的精度。OSFP4优化了对角平滑矩阵和块缩放,以最小化量化误差,在各种设置下精度均优于现有方法。该新方案保持了大部分供应商NVFP4预填充吞吐量,使其成为高效LLM部署的有吸引力的选择。
-
autotrust 发布基于 Gemma-4 的决策模型 bf16 和 NVFP4 量化版本
autotrust/GEV-26B-Decide 模型基于 Gemma-4,发布了两个版本:标准的 bf16 模型和为 vLLM 优化的量化 NVFP4 版本。NVFP4 版本显著降低了内存需求,使其能够运行在 24GB GPU 上,并在 GPQA Diamond 和 HLE 等基准测试中保持与 bf16 版本相当的性能。该模型专为决策任务设计,具有自适应思考能力,仅在必要时进行推理,从而在 Nvidia B200 等硬件上实现快速推理。
-
Nvidia 发布 GLM-5.3,支持 1M 上下文和 MoE 架构
Nvidia 发布了 GLM-5.3,这是一款采用混合专家(MoE)架构的新模型,拥有 7530 亿总参数和 400 亿活跃参数。该模型采用稀疏 Attention 机制,支持 100 万个 token 的上下文窗口。通过 Model Optimizer 进行量化,将内存需求降低了 1.66 倍,允许在 Blackwell B300 平台上使用 SGLang 进行推理。
-
NVIDIA 发布集成了 DSpark-Draft-Head 的 DeepSeek-V4-Pro-0813
NVIDIA 已将 DeepSeek-V4-Pro-0813 作为 NVFP4 检查点发布,集成了 DSpark-Draft-Head。此次发布将草稿模块的 MXFP4 专家无损映射到 NVFP4,确保目标和草稿之间量化的一致性。该模型设计用于在 Blackwell 硬件上运行,并利用 vLLM。
-
Together AI 为 NVIDIA Vera Rubin Blackwell GPU 优化 ThunderKittens
Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅…
-
NVIDIA 为 Blackwell 系统发布 GLM-5.3-Flash 和 Qwen3.8-27B
NVIDIA 发布了两款针对其 Blackwell 系统优化的新模型:GLM-5.3-Flash 和 Qwen3.8-27B。GLM-5.3-Flash 是一个 320B 参数的 MoE 模型,拥有 18B 激活参数,支持多模态任务和 1M 上下文窗口,并采用 MIT 许可证发布。Qwen3.8-27B 是一个 27B 参数的模型,提供 NVFP4/FP8 量化版本,在代理和多模态任务上实现了接近 BF16 的精度,拥有 262K 上…
-
Scale-QLoRA 使得在 4 位模型中无损合并 LLM 适配器成为可能
一篇新研究论文介绍了 Scale-QLoRA,一种将 LoRA 适配器合并到原生 4 位量化 LLM 中而不会损失准确性的方法。传统的合并方法可能会降低性能,但 Scale-QLoRA 保留了原始量化代码平面,实现了精确合并和更快的任务切换。这种方法保持了代码不变性,并提供了精确回滚和代码平面去重等优势。
-
NInfer、llama.cpp、vLLM 在 Qwen3.8-27B 上的速度和质量对比
一位用户在一台 RTX 5090 GPU 上使用 Qwen3.8-27B 模型对三种推理引擎——NInfer、llama.cpp 和 vLLM——进行了性能比较。评估重点关注生产内容智能管道的质量和速度,采用了包含六个层级的真实世界任务的自定义测试框架,包括相关性分类、关键信息检索和多笔录问答。与 llama.cpp 相比,NInfer 和 vLLM 在上下文处理能力方面表现更优,NInfer 在笔录问答和推理任务中展现出最高的质量,…
-
Nvidia 发布为 Blackwell 硬件优化的 Qwen3.8-Flash-Next 模型
Nvidia 发布了 Qwen3.8-Flash-Next,一个拥有 1250 亿参数的模型,作为 NVFP4 检查点。该模型集成了混合注意力和专家混合 (MoE) 架构。它已针对在 Nvidia 的 Blackwell B200/B300 硬件上通过 vLLM 运行进行了优化,与 BF16 相比,量化使其磁盘大小减少了 63%。
-
新研究通过二维块缩放解决 FP4 预训练稳定性问题
一篇新研究论文介绍了一种通过解决转置不变二维块缩放的关键问题来实现稳定 FP4 预训练的方法。先前使用一维缩放组的方法在矩阵转置进行反向传播时存在缩放不一致的问题,导致梯度偏差。提出的解决方案将矩阵划分为二维方形块,确保缩放分配在正向和反向传播中保持一致,从而减轻了低精度计算中系统性错误的特定来源。
-
新的 OCGQuant 方法增强了 Llama 3 和 Qwen 3 的 NVFP4 量化
研究人员开发了 OCGQuant,一种新的训练后量化方法,旨在通过解决激活离群值问题来提高 NVFP4(一种高效的低比特推理微缩放格式)的准确性。OCGQuant 通过自适应地将离群值通道与低幅度伴随通道配对,以增强 NVFP4 激活块的组成。在 Llama 3 和 Qwen 3 模型上的实验表明,与评估过的其他训练后量化方法相比,OCGQuant 在 WikiText-2 困惑度和下游准确性方面取得了更优异的结果,同时保持了具有竞争…
-
A.X K2 语言模型发布,拥有 6880 亿参数并专注于智能体应用
一份新的技术报告介绍了 A.X K2,一个拥有 6880 亿参数的混合专家(MoE)语言模型,专为智能体应用而设计。尽管其训练的 token 数量少于其前身 A.X K1,但由于 token 效率的提高和更高质量的训练数据集,A.X K2 在各种基准测试中表现出显著的改进。该模型采用了稀疏门控注意力(SGA)等创新技术,以实现高效的长上下文处理,并采用了门控归一化(GN)技术以实现稳定的大规模训练,在 RULER 和数学任务等基准测试…
-
NVIDIA RTX PRO 6000 BSE 与 H100 NVL 对比:NVFP4 性能提升详解
对 NVIDIA 的 RTX PRO 6000 Blackwell 服务器版 (BSE) 和 H100 NVL 的对比评测,重点介绍了新的 NVFP4 四位权重格式结合二级缩放所带来的性能提升。RTX PRO 6000 BSE 支持 NVFP4,在测试中与 H100 NVL 对比,使用了 Qwen 和 DeepSeek-V4-Flash 等多种 AI 模型,评估了 FP8 和新的 NVFP4 格式下的性能表现。测试在 YADRO G4…
-
DAMP新技术大幅降低LLM内存使用并提升速度
研究人员开发了一种名为DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization)的新型量化技术,以减少使用循环状态的大型语言模型的内存占用并提高其速度。传统模型将这些状态存储为FP32,消耗大量GPU内存并增加延迟。DAMP识别这些状态中的高风险通道,并以更高精度存储它们,同时将其余部分量化为INT8,在接近FP32的精度下,存储量减少了69.1%,循环状态更新速度提升…
-
NVIDIA 为 Blackwell 硬件发布量化版 DeepSeek 和 Qwen LLM
NVIDIA 已发布两种大型语言模型的量化版本,DeepSeek-V4-Pro-0813 和 Qwen3.8-2.4T-A95B,采用了其 NVFP4 量化方法。DeepSeek 模型拥有 1.65 万亿参数,采用混合注意力机制,并通过 SGLang 在 Nvidia 的 Blackwell B200 硬件上运行。Qwen 模型是一个拥有 2.4 万亿参数、950 亿激活参数的 MoE 模型,支持 100 万 token 的上下文长度…
-
Nvidia 宣传 DSX MaxLPS 以在固定功率预算内最大化 AI 计算密度
Nvidia 正在推广其 DSX MaxLPS 电源管理技术,旨在优化固定数据中心功率预算内的计算密度。在 Hot Chips 2026 上,该公司强调该系统与其 Vera Rubin NVL72 GPU 配对使用时,可以在 100MW 的设施中部署多达 40,000 个 GPU。这种动态功率分配方法旨在克服静态配置的限制,允许将未使用的功率更有效地重新分配到最需要的地方,从而最大化每瓦性能。
-
SGLang 错误导致 FP8 lm_head 模型无限重复
SGLang 提交 5375babb 之前的版本中存在一个错误,在使用 FP8 lm_head 配置(例如 unsloth/Qwen3.8-27B-NVFP4)的模型时,会导致无限重复和空响应。此问题源于 SGLang 错误地处理 lm_head 组件,导致 logit 排名损坏。该问题在服务器启动时不会显现,唯一的迹象是在服务器加载日志中出现特定警告。该修复已于 2026 年 8 月 19 日合并到 SGLang 的主分支,但尚未包…
-
Qwen3.8-27B 模型通过激进的 NVFP4 量化实现了接近 BF16 的性能
一个名为 Qwen3.8-27B-QUASAR-NVFP4 的 Qwen3.8-27B 模型的新完全量化版本已发布。该模型采用了一种名为 QUASAR 的新型量化感知蒸馏 (QAD) 算法,对所有线性层实现了激进的 NVFP4 量化。尽管量化程度很高,该模型在 GPQA-Diamond 和 AIME26 等基准测试中仍表现出与原始 BF16 版本相当的性能,同时将其大小显著减小到 19.7 GB。
-
MiniMax AI 通过新的集成索引扩展 H3 生态系统
MiniMax AI 正在通过一个名为“Awesome MiniMax H3 Integrations”的新索引来扩展其 H3 生态系统。该资源跟踪利用 H3 模型构建的社区项目,范围涵盖需要 24GB VRAM 的本地 ComfyUI 设置到使用 SGLang 和 vLLM-Omni 的大规模企业部署。该索引详细介绍了硬件优化、适用于不同 VRAM 限制的量化方法、服务加速技术以及开发工具,包括对 Apple Silicon 的支持。
-
统一 INT4 量化在真实梯度张量上优于 NVFP4
一项比较梯度张量量化方案的研究发现,在真实世界训练数据上,统一 INT4 量化方案优于 NVIDIA 的 NVFP4 量化方案。研究表明,在量化前通常应用的随机 Hadamard 旋转能有效处理异常值,使得类似浮点数的间隔所提供的动态范围变得不那么关键。因此,一种更简单、均匀间隔的 INT4 量化方案被证明在梯度训练中更有效。