NVFP4
PulseAugur coverage of NVFP4 — every cluster mentioning NVFP4 across labs, papers, and developer communities, ranked by signal.
16 天有情绪数据
-
统一 INT4 量化在真实梯度张量上优于 NVFP4
一项比较梯度张量量化方案的研究发现,在真实世界训练数据上,统一 INT4 量化方案优于 NVIDIA 的 NVFP4 量化方案。研究表明,在量化前通常应用的随机 Hadamard 旋转能有效处理异常值,使得类似浮点数的间隔所提供的动态范围变得不那么关键。因此,一种更简单、均匀间隔的 INT4 量化方案被证明在梯度训练中更有效。
-
用户为 ComfyUI 量化 LTX-2.5 Gemma-4 12B 文本编码器
一位用户开发了 LTX-2.5 Gemma-4 12B 文本编码器的量化版本,该版本专门为 ComfyUI 进行了优化。这种新的 NVFP4 格式减少了 VRAM 使用量,并且可以作为原始编码器的直接替代品,质量上似乎没有损失。用户已在 Hugging Face 上分享了该模型,并正在寻求反馈,特别是与官方 INT8 ConvRot 编码器的比较。
-
研究发现误差反馈会损害Adam优化器的性能
一项最新研究表明,在机器学习中用于缓解精度损失的技术——误差反馈,与Adam优化器结合使用时表现不佳。虽然误差反馈对随机梯度下降(SGD)有效,但与Adam结合使用时,与纯量化或不量化相比,收敛效果明显更差。研究表明,Adam的非线性特性(与SGD的线性特性不同)导致了这种有害的相互作用,使得结果距离最优值近乎两倍之遥。
-
Alibaba Qwen 为 Qwen3.8-27B 模型发布新食谱,支持 NVFP4 和 DFlash2
Alibaba 的 Qwen 团队为其 Qwen3.8-27B 模型发布了新食谱,集成了 NVFP4 和 DFlash2 技术。这些食谱现已在 SGLang 食谱中提供,为用户提供了实验的起点。该团队表示,未来还将为 Qwen3.8-27B 模型提供进一步的更新。
-
LLM量化:不止是比特缩减
大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。
-
旧款V100 GPU通过软件运行Qwen 3.8,性能媲美RTX 5090
一位开发者成功地在四块2017年的NVIDIA V100 GPU上运行了使用NVFP4量化的Qwen 3.8模型,实现了与现代RTX 5090相当的性能。这一壮举值得注意,因为NVFP4是为更新的NVIDIA Blackwell架构设计的,而V100缺乏对模型使用的FP4和FP8格式的原生支持。开发者通过创建名为QPN的软件翻译器实现了这一点,该翻译器允许V100高效地处理模型,在解码吞吐量和得到正确答案的时间上与RTX 5090相当。
-
Qwen 3.8 27B NVFP4 为 Synth Invaders 提供 AMD 硬件支持
一位用户已成功在配备 ROCmFPX 的 AMD R9700 AI Pro 上运行了使用 Qwen 3.8 27B NVFP4 创建的 Synth Invaders 应用程序。ROCmFPX 被指出能提供出色的 NVFP4 GGUF 推理能力。
-
新框架优化深度学习和 HPC 的 GPU 内核 · 跟踪 3 个来源
三篇新的研究论文介绍用于优化 GPU 内核的先进框架,这对于深度学习和高性能计算至关重要。HIERA 专注于跨 PyTorch 和 CUDA 等不同实现空间的感知工作负载规划,展示了更高的效率和性能。AsmEvo 在 AMD GPU 的汇编级别进行优化,验证功能等价性并在生产工作负载上实现显著加速。KernelArc 在 NVIDIA GPU 上采用多智能体框架进行自主优化,通过协调专业智能体在基准排行榜上获得顶尖排名。
-
Qwen3.8-27B模型在多种硬件配置下表现强劲 · 已追踪4个来源
用户报告称Qwen3.8-27B模型在各种硬件配置下展现出令人印象深刻的性能和能力。一位用户在使用vLLM的单块RTX 5090上实现了262K的上下文窗口,以合理的token生成速度展示了长上下文处理能力。另一套使用Strix Halo搭配RTX 3090 Ti和llama.cpp的配置,在32K和200K上下文下实现了高token生成速率,并且在HumanEval基准测试中显著优于双RTX 3090 vLLM配置。在Strix H…
-
新的QUASAR方法在低比特量化中提升LLM准确性
两篇新研究论文介绍了QUASAR,一种用于提高量化大语言模型准确性的新方法。第一篇论文侧重于一种无需训练的训练后量化方法,该方法解决了残差补偿中的数值稳定性问题,并在Vision Transformer Base模型上取得了优异的成果。第二篇论文将QUASAR作为一种感知量化训练技术,通过将感知重构纳入训练循环来降低损失下限,在Qwen3和Llama-3.1等模型上显著提高了准确性和KL散度。
-
Alibaba 的 Qwen 27B 模型通过 UnslothAI 在 17GB RAM 上运行
Alibaba 的 Qwen 团队与 UnslothAI 合作,发布了一个拥有 270 亿参数的模型 Qwen3.8-27B,该模型能够以低至 17GB 的 RAM 运行。这一进展使得通过 Unsloth Dynamic GGUFs 在本地执行该模型成为可能。Qwen3.8-27B 因其尺寸而被强调为性能特别强大的模型,同时还提供了新的 NVFP4 量化版本。
-
阿里巴巴的Qwen3.8-27B模型在RTX 5090上达到206 tok/s
阿里巴巴的Qwen团队发布了Qwen3.8-27B,这是一个开源的小型模型,取得了令人印象深刻的性能指标。该模型在使用NVFP4和DSpark优化的情况下,在单块RTX 5090 GPU上解码速度达到每秒206.1个token。此次发布还包括SGLang的Day-0支持,SGLang是一个促进模型高效执行的项目。
-
QUASAR方法通过降低损失下限来改进LLM量化
研究人员开发了QUASAR,一种新颖的量化感知训练(QAT)方法,旨在提高大语言模型在低精度下的性能。QUASAR解决了QAT中的一个关键挑战,即使用有损重建的权重来计算损失,导致训练效果不佳。通过将轻量级的、感知损失的重建直接纳入训练循环,QUASAR有效地降低了损失下限,并提高了所得低比特模型的质量。该方法已显示出显著的改进,在Qwen3和Llama-3.1等模型的任务上,与现有的QAT和PTQ基线相比,实现了更低的KL散度和更高的准确性。
-
Ollama v0.32.10-rc0 加速模型预填充性能
Ollama 发布了 v0.32.10-rc0 版本,对双精度 NVFP4 模型进行了优化。此次更新将乘法和转换操作合并为单个内核,减少了独立即时操作的开销。在 M5 Max 上的基准测试显示,Qwen3.6-27B 和 muse-glimmer:30b 等模型的预填充操作性能提高了约 6.7% 至 7.9%,而推测解码性能则不受影响。
-
Qwen3.6-27B 模型针对 V100 GPU 优化,速度达 366 t/s
一位开发者已针对 NVIDIA V100 GPU 优化了 Qwen3.6-27B 模型,在特定基准测试中达到了每秒 366 个 token 的速度。此优化名为“v100-skinny”,专注于为 NVFP4 权重创建快速路径,并在 SM70 架构上实现高效的深度推断。虽然峰值性能针对特定提取任务有所体现,但对于 JSON 等结构化数据,实际生成速度约为每秒 240 个 token,代码生成速度约为每秒 200 个 token。
-
TileRT AI 提升 NVIDIA Blackwell GPU 上的 LLM 解码交互性
TileRT AI 的新技术 TileRT 承诺显著提升 NVIDIA Blackwell GPU 上大型语言模型的解码交互性。通过将模型静态编译为持久化的 Engine Kernel,TileRT 旨在克服传统 GPU 编程模型固有的延迟问题。这项创新有望在相同的每 token 成本下,将解码交互性提高 1.9 倍,并可能影响 Groq、Cerebras 和 SambaNova 等竞争对手。
-
NVIDIA 发布 Nemotron 3.5 Lightning 草稿模型以实现专业化解码 · 跟踪 3 个来源
NVIDIA 发布了 Nemotron 3.5 Lightning 30B-A3B 系列下的新型草稿模型,专为专业化解码任务设计。Nemotron-3.5-Lightning-30B-A3B-NVFP4-DFlash 拥有 8.33 亿参数,可在 H100 和 RTX 5090 等硬件上加速 30B 目标模型以进行 DFlash 解码。另一个变体 Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark …
-
GGUF 量化版本在 Qwen3.6 27B 模型上优于 NVFP4、AWQ 和 FP8
对 Qwen3.6 27B 模型各种量化方法的比较显示,GGUF 格式通常提供最佳的质量与大小权衡。这些不量化激活的 GGUF 模型与 NVFP4、AWQ、AutoRound 和 FP8 等其他格式相比,显示出较低的 KL 散度。研究发现,vLLM 量化的有效性可能差异很大,有些表现明显不如其他相似甚至更小的量化版本。
-
MiniMax-H3 和 H3 Healthcare 发布量化版 Qwen3-VL-32B-Heretic 模型
Qwen3-VL-32B-Heretic 模型的新量化版本现已发布,专门针对 MiniMax-H3 和 H3 Healthcare 的 Three Hop Index 文本编码器进行了优化。这些版本包括 NVFP4 量化和 INT8 ConvRot 变体,旨在适配内存较低的 GPU,例如单张 16 GB 显卡,从而提高高级视频生成的可用性。此次发布还提供了一个可选的提示增强尾部,以获得更详细的输出,并附有详细的安装和运行时验证说明。
-
MiniMax H3 模型已量化,可在消费级 GPU 上本地推理
Hugging Face 上的 Abiray 存储库提供了 MiniMax H3 模型的量化版本,针对消费级 GPU 上的本地推理进行了优化。这些集合包括用于扩散模型和文本编码器的各种格式,如 INT4、INT8 和 NVFP4,可满足从 16GB 到 24GB 及以上不同的 VRAM 容量。GGUF 版本提供了进一步的量化选项,以及用于多模态输入、高达 2K 的输出分辨率和音频生成的详细规格。