bfloat16
PulseAugur coverage of bfloat16 — every cluster mentioning bfloat16 across labs, papers, and developer communities, ranked by signal.
15 天有情绪数据
-
MiniMax-H3 模型针对 ComfyUI 进行了优化,支持 INT8 量化
一位用户发布了 MiniMax-H3 Pruned Ref-Delta Fused r1024 模型针对 ComfyUI 的优化版本。这些版本包含 INT8 量化以提高效率,并特别注意将某些权重保留为 BF16,以避免在完全 INT8 转换时遇到的内存分配失败。由于混合精度,INT8 版本更大,但成功完成了完全量化模型无法完成的复杂工作流。
-
Qwen3.8-27B 以 FP8 在 AIME 2026 数学基准测试中获得 29/30 分
对 Qwen3.8-27B 模型在 AIME 2026 数学数据集上的基准测试显示,其量化的 FP8 权重在设置为 xhigh 推理时,获得了 29/30 的分数。此性能在相同的 xhigh 推理设置下与 BF16 版本相当,但速度显著提高。FP8 xhigh 配置在速度更快的情况下,也达到了 BF16 medium 设置的分数。
-
Liquid AI 发布 LFM2.5 模型的 QAD 检查点,提升边缘性能
Liquid AI 发布了其 LFM2.5 模型的新检查点,利用量化感知蒸馏 (QAD) 来提高性能。这些 QAD Q4_0 检查点在保持标准 Q4_0 GGUF 低内存占用和高吞吐量的同时,恢复了量化过程中约 97% 的精度损失。基准测试表明,这些新检查点在各种边缘硬件上具有改进的解码吞吐量,其质量可与 Q5_K_M 和 Unsloth 的 UD-Q4_K_XL 等其他量化方法相媲美或超越。
-
ExactMoE 将 MoE 模型内存使用量减少 87%,准确性损失极小
研究人员开发了 ExactMoE,一种用于稀疏专家混合(MoE)语言模型的新型推理设计,可显著降低内存需求。通过仅对激活的专家应用四位权重量化并将它们存储在特定格式中,ExactMoE 在保持高推理吞吐量和准确性的同时,大幅减少了峰值 GPU 内存使用量。该方法允许仅存储和移动必要的专家组件,解决了大型 MoE 模型面临的关键部署挑战。
-
北京大学和 StepFun 发布 TensorCast 以加速 LLM 推理 · 跟踪 2 个来源
北京大学和 StepFun 的研究人员开发了 TensorCast,这是一种新的可编程张量管理层,旨在优化大型语言模型基础设施。该系统旨在显著减少模型生成其第一个 token 所需的时间,在高并发代理场景中显示出高达 93.2% 的改进。此外,TensorCast 可将模型实例的启动时间加速高达 228.6 倍,解决了 LLM 部署中的关键性能瓶颈。
-
阿里巴巴发布Qwen3.8-2.4T模型,Flag OS实现多芯片适配
阿里巴巴已开源其迄今为止最大、最强大的模型Qwen3.8-2.4T-A95B,该模型采用拥有2.4万亿参数的庞大MoE架构,其中包含950亿激活参数。此次发布伴随着Flag OS社区在九种不同AI芯片架构上实现了该模型的Day 0多芯片适配,这些芯片包括阿里巴巴T-Head、Nvidia及其他厂商的产品。Flag OS平台能够将前沿模型快速适配到多样化硬件上,显著缩短模型发布到多芯片可用所需的时间,并通过优化和量化技术延长现有AI计算资源的效用。
-
新的CurveFP数据类型有望降低语言模型的成本并提高性能
研究人员推出了一种新颖的低精度数据类型系列CurveFP,旨在降低语言模型的成本。CurveFP通过一个闭合乘积码本来优化标量保真度和乘积引起的算术,该码本将量化幅度分布在对数曲线上。这种方法将乘积形成简化为精确的符号XOR和整数索引更新,从而在训练和部署中实现更好的数值行为和效率。
-
阿里巴巴发布 Qwen3.8-27B 模型;AI 助力 GPU 移植;LLM 基础设施详解
阿里巴巴的 Qwen 团队发布了 Qwen3.8-27B,这是一个拥有 270 亿参数的密集模型,可容纳在单个 GPU 上,并支持 100 万 token 的上下文窗口,在 vLLM 中实现了 Day-0 集成。同时,研究正在探索 AI 辅助的 GPU 移植技术,用于遗留科学应用程序,展示了显著的速度提升和数值验证。此外,还详细介绍了 LLM 的 GPU 基础设施的更广泛格局,涵盖了硬件选项和优化技术,如连续批处理和层流式处理,以最大…
-
AI模型或将用仅加法硬件取代矩阵乘法
研究人员正在探索将AI模型中的传统矩阵乘法转变为简单的仅加法运算,旨在克服内存带宽瓶颈。这种方法通过使用极低比特的权重表示,例如三元或1比特值,可以使庞大的万亿参数模型在消费级CPU上高效运行。虽然当前的训练后量化等方法可以实现压缩,但可能会降低准确性。未来在于原生训练这些低比特架构,尽管仍需解决处理激活值异常和防止表示崩溃等挑战。
-
由于训练后压缩,LLM审计会遗漏90%的安全漏洞
一项新的分析表明,大型语言模型(LLM)的标准审计实践未能检测到模型压缩后出现的重大安全漏洞。为了部署而将全精度模型压缩到较低的比特宽度,这是一种常见的成本节约措施,可能导致“对齐崩溃”,即像RLHF和DPO这样的安全护栏被悄无声息地擦除。这种退化没有被典型的性能基准所捕获,导致已部署的模型尽管通过了初步的安全评估,但仍然容易受到有害提示的影响。
-
新的QK-Guard方法可防止AI模型中低精度注意力塌陷
研究人员发现,Transformer模型(如GPT-2)中的低精度注意力机制存在一个关键漏洞,可能导致训练突然崩溃。他们发现,来自各种来源的错误会汇聚到一个共享的查询-键(QK)通道,引起频谱失控。提出的解决方案QK-Guard通过在共享位置实施无参数的QK归一化来干预,从而有效防止崩溃,且不影响训练稳定性。
-
新的大语言模型研究致力于加速训练、领域适应和推理效率
多篇在 arXiv 上发表的研究论文探索了优化大语言模型(LLM)训练和推理的新方法。A-3PO 提出了一种近似策略优化方法,以加速 LLM 训练;Diffract 通过检查权重矩阵和注意力头来分析领域适应;ZeroLock 引入了一种无反向传播算法,用于内存高效的 LLM 训练;DistillCache 使用强化学习进行推理过程中的自适应 KV 缓存驱逐。其他研究则侧重于通过采样多样性提高 LLM 推理性能,防范针对 KV 缓存的侧…
-
开发者提出专用LLM架构用于实时字幕
一位名叫Lyra的开发者推测,通用大型语言模型在字幕翻译等专业任务上效率低下。通过实验,Lyra发现一个80亿参数的小模型,即使没有压缩,在关键字幕错误方面也比一个270亿参数的大模型表现更差。这表明模型容量,而非压缩,是瓶颈。Lyra提出,一个为字幕限制而设计的专用架构或“载体”,可以产生专业质量的实时翻译,解决当前AI和人工翻译在速度和准确性方面的局限性。
-
MiniMax-H3 和 H3 Healthcare 发布量化版 Qwen3-VL-32B-Heretic 模型
Qwen3-VL-32B-Heretic 模型的新量化版本现已发布,专门针对 MiniMax-H3 和 H3 Healthcare 的 Three Hop Index 文本编码器进行了优化。这些版本包括 NVFP4 量化和 INT8 ConvRot 变体,旨在适配内存较低的 GPU,例如单张 16 GB 显卡,从而提高高级视频生成的可用性。此次发布还提供了一个可选的提示增强尾部,以获得更详细的输出,并附有详细的安装和运行时验证说明。
-
NVIDIA Transformer Engine 教程详细介绍 GPU 加速 LLM
NVIDIA 的 Transformer Engine 在一篇教程中得到详细介绍,该教程解释了如何加速 Transformer 工作负载。该引擎结合了融合的 GPU 内核、BF16 计算和硬件感知的 FP8 执行。教程涵盖了安装、用于 TE 内核和 FP8 张量核心的 GPU 功能检测,以及 PyTorch 回退路径。它还检查了核心融合组件,并配置了用于管理张量缩放和格式的延迟缩放 FP8 配方。
-
INT4 仅权重量化:解码加速、Prefill 停滞解析
仅权重 INT4 量化虽然能有效减少内存流量并加速 LLM 推理的解码阶段,但并不能改善 Prefill 阶段。这是因为 Prefill 是计算密集型的,即它受限于 GPU 的处理能力而非内存带宽。INT4 权重所需的解量化过程会增加开销,抵消了 Prefill 阶段的任何潜在收益。对于计算密集型场景,建议的替代方案是量化激活或接受 INT4 以获得容量优势。
-
NVIDIA AI 基础设施认证计划启动,提供培训资源
现已推出 NVIDIA 认证助理:AI 基础设施与运营 (NCA-AIIO) 认证的培训计划及相关资源。该计划包括录播课程、考试指南和模拟考试,并提供直播课程。一位学员分享了他们通过考试的经验,指出考试侧重于基础概念,并提供了视频概览和免费模拟测试等额外资源,以帮助他人备考。
-
新的 FP4 训练方法可实现低精度下稳定的 LLM 训练
研究人员开发了一种新颖的方法,使用 4 位浮点精度 (FP4) 来训练大型语言模型 (LLM),这比标准的 bfloat16 或 FP8 有显著降低。该技术通过引入一种二维块量化方法,解决了之前在 FP4 训练中遇到的不稳定性问题,该方法即使在张量转置后也能确保前向和后向传播之间的一致缩放因子。该方法还结合了无截断缩放和随机舍入,以管理量化误差并保持无偏梯度。当应用于多达 70 亿参数的 LLM 和一个 300 亿参数的专家混合模型时…
-
LLM 生成的 ARCH HDL 可验证浮点类型
研究人员为 ARCH 硬件描述语言开发并验证了浮点数据类型,该类型专为语言模型生成而设计。该系统确保了可综合的 SystemVerilog、SMT-LIB 和 Lean 4 证明模型在比较、转换和算术运算等运算符之间的一致性。对较简单的运算符进行了详尽的验证,而复杂的基于乘法的运算则根据四舍五入到最近偶数的规范证明了其正确性,并针对性能和流水线化进行了优化。
-
新方法无需直接测量即可估算 GPU 上 LLM 推理的能耗
arXiv 上的一篇新研究论文提出了一种分析方法,用于估算在 NVIDIA H100 等 GPU 上运行的大型语言模型 (LLM) 推理的能耗。该方法旨在提供一种无需直接硬件遥测即可近似估算能源使用量的方法,这对于比较研究和系统设计非常有用。该方法将能耗分解为计算、内存访问和注意力机制等组成部分,并区分了提示预填充和自回归解码阶段。