Fp8
PulseAugur coverage of Fp8 — every cluster mentioning Fp8 across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
FP8量化成本节省因模型输出问题而产生误导
一位开发者发现,在AMD MI300X GPU上使用vLLM进行FP8量化,特别是针对Qwen2.5模型,导致GPU成本显著降低了47%。然而,这种成本节省具有误导性,因为模型开始输出重复的垃圾标记,而不是有意义的响应。在使用预量化的FP8模型时,成本节省更为适度(约33%),但模型的输出质量保持不变。开发者建议在应用量化后,检查输出长度和在temperature为0下的几个固定提示,以确保模型完整性,而不是仅仅依赖每token成本指标。
-
新的矩阵乘法方法确保了大型语言模型的前缀不变性
研究人员开发了低精度设置下快速矩阵乘法的新方法,特别解决了语言模型中的前缀不变性问题。标准的快速矩阵乘法技术会通过混合标记行来引入错误,从而损害前缀不变性——这是多项选择任务中准确计算似然得分的关键属性。研究表明,即使在看似准确的FP8实现中,OpenBookQA等基准测试中的模型答案也可能发生重大变化。为了解决这个问题,他们提出了经过认证的实现,保证与规定的整数运算符的比特级相等性,确保实现的选择不会改变得分的似然性,从而使决策纯粹基于成本。
-
LLM推理优化研究详解成本-质量-延迟权衡 · 跟踪2个来源
两篇新研究论文探讨了大型语言模型(LLM)推理优化技术的权衡,重点关注成本、质量和延迟。第一篇论文《推理工程帕累托图集》(The Inference Engineering Pareto Atlas)分析了不同GPU上Qwen2.5-7B-Instruct的各种配置,发现组合优化方法比单独使用更有效。该论文强调,FP8权重在准确性和延迟之间提供了良好的平衡,而朴素的FP8 KV缓存则是有害的。第二篇论文《一种用于衡量推理优化如何影响输…
-
NVIDIA 发布 cuDNN Graph API,用于优化 AI 计算图
NVIDIA 推出了 cuDNN Graph API,这是其 cuDNN Frontend 中的一项新功能,允许开发者将计算定义为操作图。该 API 使 cuDNN 能够自动选择和优化这些图的执行引擎,并结合融合、自动调优和计划重用等技术。本教程通过构建和执行融合卷积、探索不同配置下的自动调优,以及集成 FP8 支持和 CUDA 图捕获等功能,演示了如何使用此 API,并与 PyTorch 的结果进行了验证。
-
7名博士生利用数百个AI代理从零开始训练7B大语言模型
北京中关村学院的七名博士生仅用三个月时间,就从零开始训练了一个名为ZGCM-1的7B大语言模型。他们通过利用数百个AI代理组成的团队来处理数据处理、实验和评估等任务,实现了“AI for AI”的开发范式。该团队已公开了模型的代码、数据和训练日志,实现了整个过程的完全可追溯性和可复现性。虽然ZGCM-1在某些推理任务上的表现可与其他7B模型媲美,甚至能与更大的模型相抗衡,但该项目突显了AI辅助AI开发的潜力和局限性。
-
新的注意力量化加速表格基础模型
研究人员为表格基础模型开发了一种新的注意力量化策略,以提高推理性能。该方法侧重于将查询、键和值量化为 FP8,并利用显式的 FP8 矩阵乘法指令。一项关键发现是,必须在训练和测试数据之间对齐量化误差,以防止精度下降。开发的 Triton 内核在标准 16 位内核上实现了高达 1.7 倍的加速,同时在 TabPFN-v3 和 TabICLv2 等模型在基准数据集上的表现没有显著的精度损失。
-
开源ZGCM-1模型在数学和智能体搜索方面实现高效率
研究人员推出ZGCM-1,一个为数学推理和智能体搜索设计的7B参数基础模型。该模型利用了一种高效的训练方法,结合了交错注意力等架构创新、稳定的FP8 Muon优化器以及渐进式课程学习。ZGCM-1在特定任务上展现出与更大规模前沿模型相媲美的性能,并在训练时间上提供了显著的效率提升。
-
Together AI 为 NVIDIA Vera Rubin Blackwell GPU 优化 ThunderKittens
Together AI 已获得基于 Blackwell 架构的 NVIDIA Vera Rubin NVL72 平台的访问权限。他们的团队已更新其 ThunderKittens 软件,以利用 Vera Rubin 芯片的新功能,特别专注于优化 NVFP4 和 FP8 GEMM(通用矩阵乘法运算)。初步测试表明,虽然新平台将张量核心的 K 维度容量翻倍并增加了张量内存,但现有的 Blackwell 优化内核无法足够快地为核心提供数据,仅…
-
NVIDIA 为 Blackwell 系统发布 GLM-5.3-Flash 和 Qwen3.8-27B
NVIDIA 发布了两款针对其 Blackwell 系统优化的新模型:GLM-5.3-Flash 和 Qwen3.8-27B。GLM-5.3-Flash 是一个 320B 参数的 MoE 模型,拥有 18B 激活参数,支持多模态任务和 1M 上下文窗口,并采用 MIT 许可证发布。Qwen3.8-27B 是一个 27B 参数的模型,提供 NVFP4/FP8 量化版本,在代理和多模态任务上实现了接近 BF16 的精度,拥有 262K 上…
-
StableDiffusion 用户比较 FLUX.2-Dev 中的文本编码器精度
Reddit 的 r/StableDiffusion 子版块上一位用户分享了他们使用 FLUX.2-Dev 测试文本编码器精度对图像生成影响的经验。他们比较了 bfloat16 (bf16) 和 8 位浮点 (fp8) 精度,并指出了模型大小和 VRAM 使用方面的显著差异。与近期取得的进展相比,该用户质疑 FLUX.2-Dev 庞大的占用空间和有限的社区支持是否仍然具有相关性。
-
新的 FlashAttention-4 方法在 Blackwell 硬件上提升了 FP4 性能
研究人员开发了一种名为 Direct-P 的新方法,用于优化 FlashAttention-4 在 Blackwell 的 4 位浮点 (FP4) 张量核心上的性能,解决了由 softmax 转换和片上依赖引起的性能瓶颈。对于非因果推理,Direct-P 将分数直接映射到 FP4 概率,在 NVIDIA GB200 硬件上实现了高达 bfloat16 2.13 倍的吞吐量。因果训练路径通过 FP8 梯度操作数重建概率,将 80 亿参数…
-
Qwen3.8 27B模型通过新的MXFP4优化达到280 tok/s
一位开发者通过在双R9700 GPU上实现MXFP4内核,显著提升了Qwen3.8 27B模型的性能。据报道,这项利用W4A8量化的优化已经超越了FP8的性能,并将硬件推向了极限。该开发者已开源其工作,促进了社区协作和该领域的进一步发展。
-
A.X K2 语言模型发布,拥有 6880 亿参数并专注于智能体应用
一份新的技术报告介绍了 A.X K2,一个拥有 6880 亿参数的混合专家(MoE)语言模型,专为智能体应用而设计。尽管其训练的 token 数量少于其前身 A.X K1,但由于 token 效率的提高和更高质量的训练数据集,A.X K2 在各种基准测试中表现出显著的改进。该模型采用了稀疏门控注意力(SGA)等创新技术,以实现高效的长上下文处理,并采用了门控归一化(GN)技术以实现稳定的大规模训练,在 RULER 和数学任务等基准测试…
-
LinkedIn 推出新的用于语义搜索的 GPU 检索
研究人员在 LinkedIn 上开发了一种新的语义搜索检索框架,旨在提高用户个人资料建议的相关性。该系统将嵌入分割为八个类别监督段,从而能够更精确地匹配用户查询和相关个人资料。该方法采用 FP8 和 FP16 精度的两阶段 GPU 架构实现,显著提高了检索效率和准确性。在 A/B 测试中,新框架分别在探索性和导航性查询的 Precision@10 和 Precision@1 方面取得了显著改进。
-
DeepSeek 发布首个多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp
DeepSeek 发布了其首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,该模型将视觉能力集成到其 V4-Flash 架构中。该新模型在多模态代理任务上提供了增强的性能,同时保持了可比的纯文本能力。它在 Hugging Face 上以 MIT 许可提供,支持 FP8 和 8 位量化,以降低本地推理的硬件要求。
-
阿里巴巴 Qwen 团队宣布支持新架构,集成 TokenSpeed
阿里巴巴 Qwen 团队宣布支持其新架构,包括 GDN + QSA、N-gram 嵌入和 FP8 精度。此支持由 lightseekorg 提供,后者为 TokenSpeed 提供了首日集成。公告还预告了 Qwen 4 即将进行的优化。
-
Qwen3.8-Flash-Next-FP8 VLM 拥有 125B 参数和 Gated DeltaNet
Qwen3.8-Flash-Next-FP8 是一个拥有 1250 亿参数的 VLM,它使用了 60 亿激活 MoE 单元和 Gated DeltaNet 架构。此 FP8 版本分布在 131 个 safetensors 分片中,并支持思考模式和代理控制等高级功能。
-
SGLang 错误导致 FP8 lm_head 模型无限重复
SGLang 提交 5375babb 之前的版本中存在一个错误,在使用 FP8 lm_head 配置(例如 unsloth/Qwen3.8-27B-NVFP4)的模型时,会导致无限重复和空响应。此问题源于 SGLang 错误地处理 lm_head 组件,导致 logit 排名损坏。该问题在服务器启动时不会显现,唯一的迹象是在服务器加载日志中出现特定警告。该修复已于 2026 年 8 月 19 日合并到 SGLang 的主分支,但尚未包…
-
新的 KV 缓存压缩技术旨在提升 LLM 长上下文性能
研究人员正在开发新的方法来压缩大型语言模型中的键值(KV)缓存,这是长上下文推理的主要瓶颈。Minima-KV 采用混合格式方法,将最近的页面存储在 FP8 中,将较旧的页面存储在 TQ3 中,以实现显著压缩。ST-Lite 通过解决视觉冗余和 UI 元素结构来针对 GUI 代理,性能优于现有方法。PuzzleKV 采用逐页低秩分解,将每页视为独立的压缩单元,以在减少存储的同时保持性能。Sigmoid Attention 探索了注意力…
-
Stable Diffusion 通过新的稀疏注意力后端获得速度提升
一种名为稀疏注意力的 Stable Diffusion 注意力机制的新后端已被开发出来,它提供了性能改进和更低的 VRAM 使用量。通过 ComfyUI 的自定义节点可用的此优化,通过实现协同内存内剪枝和片上重计算,旨在将生成速度提高 5-20%。稀疏注意力的有效性和质量影响取决于其在扩散过程中的应用,早期步骤影响提示遵循度,后期步骤影响时间伪影。