PulseAugur
实时 08:09:12
English(EN) Running Qwen3 Through the ExecuTorch MLX Delegate: Up to 4.52x Faster on M1 Max

使用 ExecuTorch MLX 代理,Qwen3 LLM 在 Apple Silicon 上运行速度提升高达 4.52 倍

一项最近的技术探索展示了在使用 ExecuTorch 的实验性 MLX 代理在 Apple Silicon 上运行 Qwen3-0.6B 语言模型时,速度得到了显著提升。与 PyTorch 的 MPS 后端相比,利用 Apple 的 MLX 框架的 MLX 代理在使用 4 位量化 (INT4) 时,解码吞吐量速度最高提升了 4.52 倍。虽然这种量化方法极大地减小了文件大小并提高了速度,但观察到在少数测试用例中改变了模型的输出。 AI

影响 通过优化的运行时和量化,展示了在消费级硬件上显著加快 LLM 推理速度的途径。

排序理由 通过新的代理在特定硬件上优化 LLM 性能的技术探索。 [lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

使用 ExecuTorch MLX 代理,Qwen3 LLM 在 Apple Silicon 上运行速度提升高达 4.52 倍

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Nariaki Wada ·

    在 M1 Max 上运行 Qwen3 通过 ExecuTorch MLX Delegate:速度提升高达 4.52 倍

    <p>Hello, everyone.</p> <p>There are now many ways to run an LLM on a Mac, but exporting a PyTorch model for Apple Silicon and executing it in a lightweight runtime is still an evolving path. How much faster is it, and does 4-bit quantization change the output?</p> <p>Today, I am…