MXFP4
PulseAugur coverage of MXFP4 — every cluster mentioning MXFP4 across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
Unsloth 发布 Beta 版,支持命令面板和更快的 Laya 决策
Unsloth 发布了 0.1.902-beta 版本,引入了可通过 Cmd/Ctrl+P 访问的命令面板,并增强了桌面 UI/UX,以实现更快的导航和更清晰的错误消息。此更新将 Laya 决策模型的速度提高了 4.1 倍,并通过保持 INT4 和 MXFP4 检查点打包来提高 LoRA 训练期间的内存效率。此外,该版本还扩展了对托管决策 API 提供商的支持,并为图像和视频模型处理引入了新功能。
-
Imagination E系列GPU集成AI,加速渲染和LLM推理
Imagination Technologies发布了其新的E系列GPU架构,旨在将AI能力直接集成到图形处理中。新架构配备了“Neural Core”,可在2.3毫秒内完成540p到1080p分辨率的AI倍增,并支持MXFP8和MXFP4等低精度格式,将大型语言模型的Prefill性能提升4.7倍。E系列旨在通过在统一的可编程平台上处理图形和AI任务来减少数据移动并提高能效,尽管在复杂的SoC中仍需要与其他处理单元协作。
-
新研究探索LLM的高级量化技术 · 已追踪10个来源
多篇研究论文介绍了量化大型语言模型(LLMs)的新技术,以减少其计算和内存占用。这些方法旨在提高效率,同时不显著牺牲性能。方法包括激活量化的优化旋转、面向量化感知训练的最小范数优化,以及用于部署对齐的量化感知蒸馏框架。其他研究侧重于超低复杂度反量化、重新思考优化损失尺度以及量化的联合交替细化,所有这些都有助于使LLMs更易于访问和更高效。
-
小米发布万亿参数MiMo大模型家族,权重开放
小米发布了其MiMo大语言模型家族,最新版本MiMo-V2.5-Pro拥有万亿参数。这些模型以其MIT许可下的开放权重状态和原生的全模态能力而闻名,能够处理文本、图像、视频和音频。MiMo-V2.5-Pro采用了稀疏专家混合架构,在总计1.02万亿参数中,每个token有420亿活跃参数,并支持高达100万token的上下文窗口。
-
ESTS在WMT26上使用GPT-OSS-20B和GPT-5.1进行模型压缩的细节
ESTS的研究人员详细介绍了他们提交给WMT26模型压缩共享任务的工作,重点关注英译简中和英译埃及阿拉伯语的翻译。他们的方法包括根据特定任务的路由质量和跨语言路由发散度从GPT-OSS-20B中剪枝专家,然后使用GPT-5.1生成的合成数据对剩余的专家进行微调。通过对保留的专家权重使用MXFP4量化实现进一步压缩,模型参数量在4.186B到7.770B之间。
-
NVIDIA 发布集成了 DSpark-Draft-Head 的 DeepSeek-V4-Pro-0813
NVIDIA 已将 DeepSeek-V4-Pro-0813 作为 NVFP4 检查点发布,集成了 DSpark-Draft-Head。此次发布将草稿模块的 MXFP4 专家无损映射到 NVFP4,确保目标和草稿之间量化的一致性。该模型设计用于在 Blackwell 硬件上运行,并利用 vLLM。
-
新的EFQ-Softmax方法优化Transformer的低比特量化
研究人员开发了EFQ-Softmax,一种用于Transformer模型低比特量化的新颖方法,它绕过了Softmax的传统指数计算。该方法直接将移位的注意力分数映射到E2M1操作数,在不牺牲模型质量的情况下优化效率。在Qwen3-8B和Qwen3-VL-8B-Instruct等模型上的评估显示性能指标有所提高,并且在A5向量单元上的内核级测试证明延迟显著降低。
-
Scale-QLoRA 使得在 4 位模型中无损合并 LLM 适配器成为可能
一篇新研究论文介绍了 Scale-QLoRA,一种将 LoRA 适配器合并到原生 4 位量化 LLM 中而不会损失准确性的方法。传统的合并方法可能会降低性能,但 Scale-QLoRA 保留了原始量化代码平面,实现了精确合并和更快的任务切换。这种方法保持了代码不变性,并提供了精确回滚和代码平面去重等优势。
-
较旧的 LLM 量化格式在 Apple M2 上优于较新的格式
最近在 Apple M2 笔记本电脑上对两个本地大型语言模型 (LLM) 进行的测试显示,较旧的 Q4_K_M 量化格式的表现优于较新的 MXFP4 格式。Q4_K_M 格式实现了每秒 4.7 个 token,在 44 秒内完成了 200 个 token 的生成,而 MXFP4 仅达到每秒 2.6 个 token,完成相同任务耗时 71 秒。作者推测,MXFP4 在 M2 芯片上的性能受到反量化成本以及其依赖的硬件功能 M2 不完全支…
-
新的 FlashAttention-4 方法在 Blackwell 硬件上提升了 FP4 性能
研究人员开发了一种名为 Direct-P 的新方法,用于优化 FlashAttention-4 在 Blackwell 的 4 位浮点 (FP4) 张量核心上的性能,解决了由 softmax 转换和片上依赖引起的性能瓶颈。对于非因果推理,Direct-P 将分数直接映射到 FP4 概率,在 NVIDIA GB200 硬件上实现了高达 bfloat16 2.13 倍的吞吐量。因果训练路径通过 FP8 梯度操作数重建概率,将 80 亿参数…
-
新研究通过二维块缩放解决 FP4 预训练稳定性问题
一篇新研究论文介绍了一种通过解决转置不变二维块缩放的关键问题来实现稳定 FP4 预训练的方法。先前使用一维缩放组的方法在矩阵转置进行反向传播时存在缩放不一致的问题,导致梯度偏差。提出的解决方案将矩阵划分为二维方形块,确保缩放分配在正向和反向传播中保持一致,从而减轻了低精度计算中系统性错误的特定来源。
-
Qwen3.8 27B模型通过新的MXFP4优化达到280 tok/s
一位开发者通过在双R9700 GPU上实现MXFP4内核,显著提升了Qwen3.8 27B模型的性能。据报道,这项利用W4A8量化的优化已经超越了FP8的性能,并将硬件推向了极限。该开发者已开源其工作,促进了社区协作和该领域的进一步发展。
-
新的LLM压缩技术带来更小、更精确的模型
研究人员开发了新的方法来压缩大型语言模型(LLM),同时保持甚至提高其性能。一种方法是量化感知修复(QAH),它直接从原始未压缩模型中蒸馏出一个压缩的4位模型,从而得到一个更小、更精确、更高效的模型,在多个基准测试中优于其全精度对应模型。其他研究探索了激活加权种子残差编码(AWSRC)等技术来修复量化误差,以及一个名为“压缩三位一体”的统一框架,该框架联合应用稀疏性、量化和低秩近似来实现高效的LLM部署。此外,还创建了一个标准化的评估…
-
Kimi K3 的 2.8T 参数凸显了大型语言模型部署作为一项系统工程挑战
Kimi K3 模型拥有 2.8 万亿总参数,每个 token 约有 1040 亿活跃参数,其部署挑战远超其庞大的规模。其架构融合了混合专家(mixture-of-experts)设计和原生多模态支持,上下文窗口超过一百万个 token。至关重要的是,该模型使用低精度 MXFP4 权重和 MXFP8 激活进行训练,这意味着量化是其推理路径的内在组成部分,而非事后考虑。这需要能够高效执行这些原生格式的专用硬件,目前的 vLLM 指导建议…
-
DeepSeek V4 Flash 为 DwarfStar 推理引擎进行了量化
用户创建并分享了 DeepSeek V4 Flash 模型的量化版本,专门针对 DwarfStar (DS4) 推理引擎进行了优化。这些 GGUF 文件旨在提供比标准 llama.cpp 实现更快的性能,一位用户报告在 MacBook M5 Max 上速度超过 30 tokens/秒。创建者正在寻求用户的反馈,特别是拥有 CUDA 或 ROCm 硬件的用户,以帮助改进量化并可能提高性能和去审查等功能。
-
Moonshot AI 发布 Kimi K3,一款 2.8T 参数的开源 MoE 模型
Moonshot AI 发布了 Kimi K3,这是一款拥有 2.8 万亿参数的开源专家混合(MoE)模型。该模型采用了 Kimi Delta Attention 等架构创新,提高了扩展效率,并在长时程编码和代理工作流等复杂任务上表现出色。模型权重以 MXFP4 格式在 Hugging Face 上提供,并详细介绍了如何使用 Amazon SageMaker HyperPod 和 Amazon EKS 在 AWS 上进行部署,这需要 …
-
Unsloth 发布 Kimi K3 GGUF 模型,包括大型 MXFP4 版本
Unsloth 已开始发布 Kimi K3 的 GGUF 模型文件。首批发布包括 1.5 TB 的 MXFP4 模型和 mmproj 组件。这些文件可供用户下载和使用。
-
MXAttention 框架优化 MXFP4 注意力以用于视频生成
研究人员开发了 MXAttention,这是一个新颖的、无数据的训练后量化框架,旨在优化基于扩散的视频生成模型中的 MXFP4 注意力。该框架解决了数值问题,如裁剪-下溢权衡和归一化错误,这些问题通常会降低生成质量。MXAttention 结合了通用最优缩放 (UOS) 以实现独立于分布的缩放,以及预归一化量化 (PNQ) 以保持归一化精度。实验表明,MXAttention 显著缩小了 MXFP4 和 FP16 格式之间的质量差距,以…
-
Moonshot AI发布开放权重Kimi K3模型,挑战Fable 5和GPT-5.6 Sol
Moonshot AI发布了其Kimi K3模型的开放权重版本,采用MXFP4格式,能够处理1.56TB数据。此次发布使Kimi K3成为Fable 5和GPT-5.6 Sol等先进模型的竞争对手,提供了显著的性能能力。
-
Moonshot 发布 Kimi K3,一款拥有 2.8T 参数的多模态模型,支持 100 万上下文
Moonshot 发布了 Kimi K3,这是一款新的 2.8 万亿参数多模态模型,拥有 100 万 token 的上下文窗口和原生视觉能力。该模型在发布时展现出惊人的速度,达到每秒 460 token。Kimi K3 基于混合专家架构构建,并通过 Modal 平台提供,提供基于 token 的定价和专用容量选项。