MXFP8
PulseAugur coverage of MXFP8 — every cluster mentioning MXFP8 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Motif Technologies 发布 314B 参数的 Motif 3 LLM
Motif Technologies 发布了 Motif 3,这是一款拥有 3140 亿总参数和每个 token 激活 132 亿参数的 decoder-only 混合专家(Mixture-of-Experts)语言模型。该模型采用了新颖的 Grouped Differential Latent Attention 架构,并在约 12.5 万亿个 token 上进行了训练。Motif 3 在与领先的开源模型相比时,表现出具有竞争力的性…
-
新的 FP4 训练方法可实现低精度下稳定的 LLM 训练
研究人员开发了一种新颖的方法,使用 4 位浮点精度 (FP4) 来训练大型语言模型 (LLM),这比标准的 bfloat16 或 FP8 有显著降低。该技术通过引入一种二维块量化方法,解决了之前在 FP4 训练中遇到的不稳定性问题,该方法即使在张量转置后也能确保前向和后向传播之间的一致缩放因子。该方法还结合了无截断缩放和随机舍入,以管理量化误差并保持无偏梯度。当应用于多达 70 亿参数的 LLM 和一个 300 亿参数的专家混合模型时…
-
Moonshot 发布 Kimi K3,一款拥有 2.8T 参数的多模态模型,支持 100 万上下文
Moonshot 发布了 Kimi K3,这是一款新的 2.8 万亿参数多模态模型,拥有 100 万 token 的上下文窗口和原生视觉能力。该模型在发布时展现出惊人的速度,达到每秒 460 token。Kimi K3 基于混合专家架构构建,并通过 Modal 平台提供,提供基于 token 的定价和专用容量选项。
-
Krea 2 Turbo 模型格式在 ComfyUI 中进行速度和质量基准测试
对 ComfyUI 中 Krea 2 Turbo 模型格式的基准测试显示,INT8 ConvRot 格式在速度和质量之间提供了最佳平衡,尤其是在更高分辨率下。虽然 BF16 提供了最高的保真度,但 INT8 ConvRot 是最接近的量化选项,并且速度明显更快。基准测试还强调,文件大小较小并不总是等同于更快的生成速度,一些较小的格式性能比较大的格式差。
-
Krea2 AI 模型性能:INT8 和 NVFP4 显示最快的生成时间
一位 Reddit 用户对 Krea2 AI 模型的各种数值格式进行了比较,评估了它们的性能和图像生成质量。测试包括 BF16、FP8、INT8、GGUF、MXFP8 和 NVFP4,结果表明 INT8_convrot 和 NVFP4 格式提供了最快的生成时间。另一位用户指出,与早期版本的类似模型相比,FP8 和 BF16 格式之间的差异现在似乎不那么明显了。
-
DynamiQ框架通过优化的梯度同步加速LLM训练
研究人员开发了DynamiQ,一个旨在通过优化梯度同步来加速大型语言模型训练的新框架。该方法通过采用新颖的部分和表示技术以及用于高效执行的融合内核,解决了大规模模型训练中的网络瓶颈问题。DynamiQ已展示出显著的改进,与现有最先进的方法相比,速度提升高达34.2%,同时保持接近基线的准确性。
-
新的LLM量化方法提升速度和准确性
两篇新的研究论文介绍了改进大型语言模型(LLM)效率的新型量化技术。FPTQuant专注于INT4量化的保持函数变换,实现了高达3.9倍的速度提升,且开销极小,准确性与较慢的方法相当。ARCQuant通过增强残差通道提升NVFP4量化,在保持最先进准确性的同时,使GPU上的速度比FP16提升高达3倍。
-
Krea 2 图像模型发布多个量化版本,拓宽GPU可访问性
Krea 2 图像生成模型已发布量化版本,包括 FP8、MXFP8、NVFP4 和 INT8 格式,使其能够被更广泛的GPU访问。该模型有两种变体:用于训练和微调的 Krea 2 Raw,以及用于更快推理的 Krea 2 Turbo。这些量化文件可在 HuggingFace 上免费获取,并为不同级别的GPU提供了具体建议。