MXFP4
PulseAugur coverage of MXFP4 — every cluster mentioning MXFP4 across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新的 QAH 方法可恢复压缩的 4 位 LLM 的性能
研究人员开发了一种名为“面向量化的修复”(QAH)的新方法,用于恢复已被压缩并量化为 4 位精度的 LLM 的性能。与传统的“面向量化的训练”(QAT)不同,QAH 直接从原始的、未压缩的模型中提炼出 4 位模型,从而实现更快的收敛和更高的稳定性。由此产生的 Hypernova-60B 模型源自 GPT-OSS 120B 模型,在大多数基准测试中,其性能与 bfloat16 源模型相当或更优,同时使用的内存和参数却大大减少。
-
Kimi K3 的 2.8T 参数凸显了大型语言模型部署作为一项系统工程挑战
Kimi K3 模型拥有 2.8 万亿总参数,每个 token 约有 1040 亿活跃参数,其部署挑战远超其庞大的规模。其架构融合了混合专家(mixture-of-experts)设计和原生多模态支持,上下文窗口超过一百万个 token。至关重要的是,该模型使用低精度 MXFP4 权重和 MXFP8 激活进行训练,这意味着量化是其推理路径的内在组成部分,而非事后考虑。这需要能够高效执行这些原生格式的专用硬件,目前的 vLLM 指导建议…
-
DeepSeek V4 Flash 为 DwarfStar 推理引擎进行了量化
用户创建并分享了 DeepSeek V4 Flash 模型的量化版本,专门针对 DwarfStar (DS4) 推理引擎进行了优化。这些 GGUF 文件旨在提供比标准 llama.cpp 实现更快的性能,一位用户报告在 MacBook M5 Max 上速度超过 30 tokens/秒。创建者正在寻求用户的反馈,特别是拥有 CUDA 或 ROCm 硬件的用户,以帮助改进量化并可能提高性能和去审查等功能。
-
Moonshot AI 发布 Kimi K3,一款 2.8T 参数的开源 MoE 模型
Moonshot AI 发布了 Kimi K3,这是一款拥有 2.8 万亿参数的开源专家混合(MoE)模型。该模型采用了 Kimi Delta Attention 等架构创新,提高了扩展效率,并在长时程编码和代理工作流等复杂任务上表现出色。模型权重以 MXFP4 格式在 Hugging Face 上提供,并详细介绍了如何使用 Amazon SageMaker HyperPod 和 Amazon EKS 在 AWS 上进行部署,这需要 …
-
Unsloth 发布 Kimi K3 GGUF 模型,包括大型 MXFP4 版本
Unsloth 已开始发布 Kimi K3 的 GGUF 模型文件。首批发布包括 1.5 TB 的 MXFP4 模型和 mmproj 组件。这些文件可供用户下载和使用。
-
MXAttention 框架优化 MXFP4 注意力以用于视频生成
研究人员开发了 MXAttention,这是一个新颖的、无数据的训练后量化框架,旨在优化基于扩散的视频生成模型中的 MXFP4 注意力。该框架解决了数值问题,如裁剪-下溢权衡和归一化错误,这些问题通常会降低生成质量。MXAttention 结合了通用最优缩放 (UOS) 以实现独立于分布的缩放,以及预归一化量化 (PNQ) 以保持归一化精度。实验表明,MXAttention 显著缩小了 MXFP4 和 FP16 格式之间的质量差距,以…
-
Moonshot AI发布开放权重Kimi K3模型,挑战Fable 5和GPT-5.6 Sol
Moonshot AI发布了其Kimi K3模型的开放权重版本,采用MXFP4格式,能够处理1.56TB数据。此次发布使Kimi K3成为Fable 5和GPT-5.6 Sol等先进模型的竞争对手,提供了显著的性能能力。
-
Moonshot 发布 Kimi K3,一款拥有 2.8T 参数的多模态模型,支持 100 万上下文
Moonshot 发布了 Kimi K3,这是一款新的 2.8 万亿参数多模态模型,拥有 100 万 token 的上下文窗口和原生视觉能力。该模型在发布时展现出惊人的速度,达到每秒 460 token。Kimi K3 基于混合专家架构构建,并通过 Modal 平台提供,提供基于 token 的定价和专用容量选项。
-
Kimi K3 的海量规模尽管经过优化,仍需要密集的网络连接 · 跟踪 8 个来源
SemiAnalysis 报道称,拥有 2.8 万亿参数的 Kimi K3 模型,尽管经过了 Kimi Delta Linear Attention (KDA) 等优化,仍需要显著的网络带宽。该模型的架构需要 WideEP 服务优化,将 896 个专家分布在许多 GPU 上,导致密集的网络使用。这种复杂性意味着,虽然 KDA 减少了 KV 缓存传输,但 Kimi K3 的整体网络需求仍然很大,可能会影响 AI 网络交换机市场。
-
DynamiQ框架通过优化的梯度同步加速LLM训练
研究人员开发了DynamiQ,一个旨在通过优化梯度同步来加速大型语言模型训练的新框架。该方法通过采用新颖的部分和表示技术以及用于高效执行的融合内核,解决了大规模模型训练中的网络瓶颈问题。DynamiQ已展示出显著的改进,与现有最先进的方法相比,速度提升高达34.2%,同时保持接近基线的准确性。
-
GLM5.2 部署在 AMD MI355X 上以实现更便宜的推理 · 已追踪 5 个来源
Wafer.ai 已成功将 GLM5.2 部署在 AMD MI355X 硬件上,实现了 2626 tokens/秒/节点 的吞吐量和 213 tokens/秒 的单流推理速度。此次部署具有成本优势,MI355X GPU 的成本大约比 NVIDIA 的 Blackwell B300 低 2.75 倍。优化工作包括使用 AMD Quark 将 GLM5.2 量化到 MXFP4,并采用 sglang 推理框架,同时对 ROCm 的投机解码进…
-
用户质疑 DeepSeek-V4 Flash 量化格式
一位 Reddit r/LocalLLaMA 版块的用户正在质疑 DeepSeek-V4 Flash 模型的量化格式。用户指出,K. E. Bartowski 在 Hugging Face 上的一个仓库将该模型列为 MXFP4,但该模型在 Hugging Face 上的原始页面并未显示此量化格式,仅列出了 BF16、I64、F32、F8_E8M0、F8_E4M3 和 I8 张量。用户正在寻求对此差异的澄清。
-
新的 W4A4 量化技术增强了 Wan2.2-I2V-A14B 模型的推理能力
研究人员为 Wan2.2-I2V-A14B 模型开发了一种新颖的 W4A4 量化技术,旨在提高低比特宽度硬件上的推理效率。他们的方法将激活值异常的混合精度与逐通道平滑和前馈层的块状打包相结合。该方法在 VBench I2V 指标上取得了接近 FP16 的 2-3.5% 的结果,优于原生的 HiFloat4 基线。
-
论文目录包含 84 种数值格式,以实现机器学习硬件一致性
一篇新论文介绍了一个包含 84 种机器学习硬件数值格式的综合目录,解决了在不同加速器之间移植模型时出现的静默差异问题。该目录包括针对 FP8、BF16 和 MXFP4 等各种格式的比特精确一致性包,作为供应商无关的参考。这项工作旨在为工程师提供一个共享标准,以诊断和解决差异,确保模型在不同硬件上具有更高的一致性。
-
TORQ框架通过MXFP4量化提升LLM准确性
研究人员开发了TORQ,一种使用MXFP4格式量化大型语言模型(LLM)的新框架。该方法通过分析和纠正激活量化中的不平衡来解决准确性下降问题。TORQ采用双层正交旋转策略来优化激活空间,显著提高了4位浮点量化下LLM的准确性。
-
本尼迪克特·埃文斯分析 AI 的未来;华为的 HiFloat4 格式展现出潜力
科技分析师本尼迪克特·埃文斯发布了他的 2026 年分析报告,探讨了 AI 对商业模式和技术的变革性影响。他对当前的 AI 炒作表示质疑,讨论了“平台衰败”和平台衰落等问题。另外,华为新的 HiFloat4 AI 训练格式在其昇腾芯片上的性能优于 MXFP4,可能影响硬件依赖的 AI 开发。
-
华为 HiFloat4 减少 AI 训练错误;CLI 工具获得关注
华为开发了一种名为 HiFloat4 的新 4 位数据格式,据报道,与 MXFP4 相比,在 Ascend NPU 上进行 AI 模型训练时,其错误率降低了 33%。这一进展被视为技术竞赛中的重要一步。此外,命令行界面 (CLI) 工具正作为比专用 MCP 服务器和复杂 ETL/搜索系统更灵活、更高效的 AI 代理集成替代方案而出现,挑战着当前的发展范式。
-
llama.cpp 和 ik_llama.cpp 为节省 VRAM 添加 FP4 推理支持
llama.cpp 和 ik_llama.cpp 项目均已集成对 FP4(4位浮点)推理的支持,这是模型量化的一项重大进展。llama.cpp 现在包含 NVFP4,一种 Nvidia 特定的格式,而 ik_llama.cpp 支持 MXFP4,遵循 MX 联盟标准。预计这些进展将大幅降低 VRAM 需求,一旦模型支持跟上,就能在消费级硬件上运行更大的模型。
-
华为HiFloat4格式提升AI训练效率;Anthropic实现安全研究自动化
华为研究人员开发了HiFloat4,一种新的4位精度格式,用于AI训练和推理,在华为Ascend芯片上性能优于MXFP4等现有格式。此举被视为对出口管制的应对,促使中国公司在家用硬件上实现效率最大化。与此同时,Anthropic研究人员在自动化AI安全研究方面取得了早期成功,利用AI代理提出、测试和迭代对齐想法,甚至在某些任务上超越了人类研究人员。