PulseAugur
中
实时 20:01:35
实体 MXFP8

MXFP8

PulseAugur coverage of MXFP8 — every cluster mentioning MXFP8 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_237941 ·

    llama.cpp 中 MiniMax M3 LLM 性能调整

    一位用户正在 Mac 上使用 llama.cpp 框架对 MiniMax M3 大型语言模型进行实验。他们在使用该模型时偶尔会遇到轻微的幻觉和异常,并怀疑这可能与其 MiniMax Sparse Attention (MSA) 实现有关。通过禁用 Flash Attention(这会禁用 MSA),用户观察到生成速度显著下降。进一步的测试涉及将 MSA 与 Flash Attention 分离,这表明尽管可能存在性能权衡,但模型在没有…

  2. TOOL · CL_203388 ·

    Kimi K3 的 2.8T 参数凸显了大型语言模型部署作为一项系统工程挑战

    Kimi K3 模型拥有 2.8 万亿总参数,每个 token 约有 1040 亿活跃参数,其部署挑战远超其庞大的规模。其架构融合了混合专家(mixture-of-experts)设计和原生多模态支持,上下文窗口超过一百万个 token。至关重要的是,该模型使用低精度 MXFP4 权重和 MXFP8 激活进行训练,这意味着量化是其推理路径的内在组成部分,而非事后考虑。这需要能够高效执行这些原生格式的专用硬件,目前的 vLLM 指导建议…

  3. TOOL · CL_197617 ·

    Ollama v0.32.10-rc0 加速模型预填充性能

    Ollama 发布了 v0.32.10-rc0 版本,对双精度 NVFP4 模型进行了优化。此次更新将乘法和转换操作合并为单个内核,减少了独立即时操作的开销。在 M5 Max 上的基准测试显示,Qwen3.6-27B 和 muse-glimmer:30b 等模型的预填充操作性能提高了约 6.7% 至 7.9%,而推测解码性能则不受影响。

  4. FRONTIER RELEASE · CL_192292 ·

    Motif Technologies 发布 314B 参数的 Motif 3 LLM

    Motif Technologies 发布了 Motif 3,这是一款拥有 3140 亿总参数和每个 token 激活 132 亿参数的 decoder-only 混合专家(Mixture-of-Experts)语言模型。该模型采用了新颖的 Grouped Differential Latent Attention 架构,并在约 12.5 万亿个 token 上进行了训练。Motif 3 在与领先的开源模型相比时,表现出具有竞争力的性…

  5. TOOL · CL_169675 ·

    新的 FP4 训练方法可实现低精度下稳定的 LLM 训练

    研究人员开发了一种新颖的方法,使用 4 位浮点精度 (FP4) 来训练大型语言模型 (LLM),这比标准的 bfloat16 或 FP8 有显著降低。该技术通过引入一种二维块量化方法,解决了之前在 FP4 训练中遇到的不稳定性问题,该方法即使在张量转置后也能确保前向和后向传播之间的一致缩放因子。该方法还结合了无截断缩放和随机舍入,以管理量化误差并保持无偏梯度。当应用于多达 70 亿参数的 LLM 和一个 300 亿参数的专家混合模型时…

  6. SIGNIFICANT · CL_166043 ·

    Moonshot 发布 Kimi K3,一款拥有 2.8T 参数的多模态模型,支持 100 万上下文

    Moonshot 发布了 Kimi K3,这是一款新的 2.8 万亿参数多模态模型,拥有 100 万 token 的上下文窗口和原生视觉能力。该模型在发布时展现出惊人的速度,达到每秒 460 token。Kimi K3 基于混合专家架构构建,并通过 Modal 平台提供,提供基于 token 的定价和专用容量选项。

  7. RESEARCH · CL_138956 ·

    Krea 2 Turbo 模型格式在 ComfyUI 中进行速度和质量基准测试

    对 ComfyUI 中 Krea 2 Turbo 模型格式的基准测试显示,INT8 ConvRot 格式在速度和质量之间提供了最佳平衡,尤其是在更高分辨率下。虽然 BF16 提供了最高的保真度,但 INT8 ConvRot 是最接近的量化选项,并且速度明显更快。基准测试还强调,文件大小较小并不总是等同于更快的生成速度,一些较小的格式性能比较大的格式差。

  8. RESEARCH · CL_134165 ·

    Krea2 AI 模型性能:INT8 和 NVFP4 显示最快的生成时间

    一位 Reddit 用户对 Krea2 AI 模型的各种数值格式进行了比较,评估了它们的性能和图像生成质量。测试包括 BF16、FP8、INT8、GGUF、MXFP8 和 NVFP4,结果表明 INT8_convrot 和 NVFP4 格式提供了最快的生成时间。另一位用户指出,与早期版本的类似模型相比,FP8 和 BF16 格式之间的差异现在似乎不那么明显了。

  9. TOOL · CL_129305 ·

    DynamiQ框架通过优化的梯度同步加速LLM训练

    研究人员开发了DynamiQ,一个旨在通过优化梯度同步来加速大型语言模型训练的新框架。该方法通过采用新颖的部分和表示技术以及用于高效执行的融合内核,解决了大规模模型训练中的网络瓶颈问题。DynamiQ已展示出显著的改进,与现有最先进的方法相比,速度提升高达34.2%,同时保持接近基线的准确性。

  10. RESEARCH · CL_129035 ·

    新的LLM量化方法提升速度和准确性

    两篇新的研究论文介绍了改进大型语言模型(LLM)效率的新型量化技术。FPTQuant专注于INT4量化的保持函数变换,实现了高达3.9倍的速度提升,且开销极小,准确性与较慢的方法相当。ARCQuant通过增强残差通道提升NVFP4量化,在保持最先进准确性的同时,使GPU上的速度比FP16提升高达3倍。

  11. TOOL · CL_106864 ·

    Krea 2 图像模型发布多个量化版本,拓宽GPU可访问性

    Krea 2 图像生成模型已发布量化版本,包括 FP8、MXFP8、NVFP4 和 INT8 格式,使其能够被更广泛的GPU访问。该模型有两种变体:用于训练和微调的 Krea 2 Raw,以及用于更快推理的 Krea 2 Turbo。这些量化文件可在 HuggingFace 上免费获取,并为不同级别的GPU提供了具体建议。