Fp8
PulseAugur coverage of Fp8 — every cluster mentioning Fp8 across labs, papers, and developer communities, ranked by signal.
13 天有情绪数据
-
Stable Diffusion 通过新的稀疏注意力后端获得速度提升
一种名为稀疏注意力的 Stable Diffusion 注意力机制的新后端已被开发出来,它提供了性能改进和更低的 VRAM 使用量。通过 ComfyUI 的自定义节点可用的此优化,通过实现协同内存内剪枝和片上重计算,旨在将生成速度提高 5-20%。稀疏注意力的有效性和质量影响取决于其在扩散过程中的应用,早期步骤影响提示遵循度,后期步骤影响时间伪影。
-
LLM量化:不止是比特缩减
大型语言模型的量化是一个复杂的过程,涉及的不仅仅是降低比特精度。它包括四个关键决策:表示法、格式、评估以及由此产生的容量增益。不同的量化方案,如W4A16和W8A8,对内存带宽和计算速度的影响不同,其中W4A16主要减少数据获取,而W8A8和W4A4则利用专用硬件进行更快的算术运算。这些方法的有效性在很大程度上取决于模型是受内存限制还是受计算限制,以及使用的批次大小。
-
Qwen3.8-27B 以 FP8 在 AIME 2026 数学基准测试中获得 29/30 分
对 Qwen3.8-27B 模型在 AIME 2026 数学数据集上的基准测试显示,其量化的 FP8 权重在设置为 xhigh 推理时,获得了 29/30 的分数。此性能在相同的 xhigh 推理设置下与 BF16 版本相当,但速度显著提高。FP8 xhigh 配置在速度更快的情况下,也达到了 BF16 medium 设置的分数。
-
Qwen3.8-27B-Uncensored-FP8 模型支持在消费级 GPU 上进行本地 27B 推理
Qwen3.8-27B 模型的新 FP8 量化版本 Uncensored-FP8 在 Hugging Face 上广受欢迎。此优化显著降低了模型的内存需求,使得在内存有限的消费级 GPU 上运行一个拥有 270 亿参数的多模态语言模型成为可能。这一进展降低了个人和开发者在本地部署先进人工智能能力的门槛,无需高端数据中心硬件。
-
Qwen3.8-27B FP8 构建显著降低拒绝率,能力影响极小
Qwen3.8-27B 模型已更新为 FP8 构建,将有害指令的拒绝率从 64-99% 大幅降低至 0-6%。然而,这种安全性的提高似乎并未以牺牲能力为代价,因为 MMLU 和 GSM8K 的基准分数变化极小,变动小于 1.3 分。作为红队材料发布的评估数据表明,虽然模型拒绝有害提示的可能性降低,但其核心推理和知识能力基本保持不变。
-
Qwen 3.8 FP8 生成复杂的 HTML 熔岩灯动画
Qwen 3.8 FP8 模型在生成复杂代码方面展现了令人印象深刻的能力,特别是创建了一个独立的 HTML 文件来制作动画熔岩灯。该输出满足了所有指定的要求,包括内联 HTML、CSS 和 JavaScript,具有发光颜色的灯轮廓,以及六到十个具有逼真变形的元球风格的团块。考虑到模型的尺寸,其性能因质量和效率而受到高度赞扬。
-
阿里巴巴发布Qwen3.8-2.4T模型,Flag OS实现多芯片适配
阿里巴巴已开源其迄今为止最大、最强大的模型Qwen3.8-2.4T-A95B,该模型采用拥有2.4万亿参数的庞大MoE架构,其中包含950亿激活参数。此次发布伴随着Flag OS社区在九种不同AI芯片架构上实现了该模型的Day 0多芯片适配,这些芯片包括阿里巴巴T-Head、Nvidia及其他厂商的产品。Flag OS平台能够将前沿模型快速适配到多样化硬件上,显著缩短模型发布到多芯片可用所需的时间,并通过优化和量化技术延长现有AI计算资源的效用。
-
新的CurveFP数据类型有望降低语言模型的成本并提高性能
研究人员推出了一种新颖的低精度数据类型系列CurveFP,旨在降低语言模型的成本。CurveFP通过一个闭合乘积码本来优化标量保真度和乘积引起的算术,该码本将量化幅度分布在对数曲线上。这种方法将乘积形成简化为精确的符号XOR和整数索引更新,从而在训练和部署中实现更好的数值行为和效率。
-
GGUF 量化版本在 Qwen3.6 27B 模型上优于 NVFP4、AWQ 和 FP8
对 Qwen3.6 27B 模型各种量化方法的比较显示,GGUF 格式通常提供最佳的质量与大小权衡。这些不量化激活的 GGUF 模型与 NVFP4、AWQ、AutoRound 和 FP8 等其他格式相比,显示出较低的 KL 散度。研究发现,vLLM 量化的有效性可能差异很大,有些表现明显不如其他相似甚至更小的量化版本。
-
阿里巴巴发布 Qwen3.8-27B 模型;AI 助力 GPU 移植;LLM 基础设施详解
阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一个拥有 270 亿参数的密集模型,可容纳在单个 GPU 上,并支持 100 万 token 的上下文窗口,在 vLLM 中实现了 Day-0 集成。同时,研究正在探索 AI 辅助的 GPU 移植技术,用于遗留科学应用程序,展示了显著的速度提升和数值验证。此外,还详细介绍了 LLM 的 GPU 基础设施的更广泛格局,涵盖了硬件选项和优化技术,如连续批处理和层流式处理,以最大…
-
MiniMax H3模型发布,可在单台DGX Spark上运行
MiniMax H3模型现已公开可用,相关详情已在Hugging Face和Arint.info上分享。一位用户成功地在单台DGX Spark系统上运行了该模型,并指出需要对SM121兼容性和在线FP8进行实验。
-
NVIDIA Transformer Engine 教程详细介绍 GPU 加速 LLM
NVIDIA 的 Transformer Engine 在一篇教程中得到详细介绍,该教程解释了如何加速 Transformer 工作负载。该引擎结合了融合的 GPU 内核、BF16 计算和硬件感知的 FP8 执行。教程涵盖了安装、用于 TE 内核和 FP8 张量核心的 GPU 功能检测,以及 PyTorch 回退路径。它还检查了核心融合组件,并配置了用于管理张量缩放和格式的延迟缩放 FP8 配方。
-
Laguna S 2.1 模型已更新,支持 1M 上下文和新权重
Poolside 发布了其 Laguna S 2.1 模型(特别是 FP8 和 NVFP4 格式)的更新权重。这些更新将默认上下文大小增加到 100 万个 token,并包含修订后的配置。用户希望这些更改能解决先前注意到的循环问题,因为该模型在开发工作流程中一直很有价值。
-
INT4 仅权重量化:解码加速、Prefill 停滞解析
仅权重 INT4 量化虽然能有效减少内存流量并加速 LLM 推理的解码阶段,但并不能改善 Prefill 阶段。这是因为 Prefill 是计算密集型的,即它受限于 GPU 的处理能力而非内存带宽。INT4 权重所需的解量化过程会增加开销,抵消了 Prefill 阶段的任何潜在收益。对于计算密集型场景,建议的替代方案是量化激活或接受 INT4 以获得容量优势。
-
新的 FP4 训练方法可实现低精度下稳定的 LLM 训练
研究人员开发了一种新颖的方法,使用 4 位浮点精度 (FP4) 来训练大型语言模型 (LLM),这比标准的 bfloat16 或 FP8 有显著降低。该技术通过引入一种二维块量化方法,解决了之前在 FP4 训练中遇到的不稳定性问题,该方法即使在张量转置后也能确保前向和后向传播之间的一致缩放因子。该方法还结合了无截断缩放和随机舍入,以管理量化误差并保持无偏梯度。当应用于多达 70 亿参数的 LLM 和一个 300 亿参数的专家混合模型时…
-
AMD MI4555X 加速器拥有 40 Petaflops 和 432GB RAM
据报道,AMD 的 MI4555X 加速器提供令人印象深刻的性能,拥有 40 Petaflops 的 MXFP6 计算能力,该格式接近 FP8 质量。它还配备了大量的 432 GB RAM,内存带宽约为 20 TB/s。
-
Karpathy 提倡以 STEM 为重点的教育;新的 AMD GPU 规格揭晓
Andrej Karpathy 建议 80% 的教育应侧重于数学、物理和计算机科学,暗示传统学校教育对未来几代人来说可能不太重要。另外,AMD MI4555X GPU 因其有前景的规格而受到关注,包括 40 Petaflops 的性能和 432 GB 的 RAM 以及大量的带宽,并利用 MXFP6 来提高精度。
-
新的QUADS技术稳定MoE LLM的NVFP4强化学习
研究人员开发了一种名为QUADS的新技术,通过使用NVFP4低精度格式来稳定混合专家(MoE)大语言模型的强化学习(RL)。他们发现,激活误差而非权重误差是MoE模型FP4 RL不稳定的主要原因。QUADS通过在训练器端实现不对称量化感知训练,并在回滚端实现残差激活补偿来解决此问题,达到了BF16级别的准确率并提高了吞吐量。
-
AMD ROCm用户通过INT8 Triton变通方法实现Krea2 Turbo性能提升
一位用户通过实施选择性的Triton变通方法,成功地为AMD ROCm硬件优化了Krea2 Turbo模型。该变通方法允许INT8 ConvRot操作运行速度比FP8更快,在FP8基线基础上实现了18%的速度提升,并与之前的INT8回退方法相比实现了显著的6倍加速。该解决方案涉及仅通过Triton路由INT8线性操作,同时保持其他可能不稳定的路径禁用。
-
M+Adam 优化器改进低精度大语言模型训练
研究人员推出 M+Adam,这是一种新颖的优化方法,旨在提高低精度权重下大语言模型训练的准确性。标准优化器在低精度下可能会遇到困难,导致进展停滞,尤其是在权重幅度较大时。M+Adam 通过结合加法和乘法更新类型来解决这个问题,利用它们互补的优势来确保在各种权重幅度和符号变化下都能取得持续的进展。使用 LLaMA 类型模型和不同精度级别(包括 BF16、FP8 和 FP4)进行的实验表明,M+Adam 持续提高了低精度训练的成果。