Perplexity 已开源 Lily,一个使用 Rust 和 Metal 构建的专用推理引擎,用于在 Apple Silicon 上运行 Qwen3.6-35B-A3B 模型。该引擎专为狭窄的硬件优化而设计,与 MLX-LM 等通用框架相比,解码速度提高了 1.35 倍,预填充速度提高了 1.23 倍。Lily 的架构绕过了 PyTorch 和 MLX 等传统框架,利用手工编写的 Metal 内核进行执行,并提供了一个与 OpenAI 兼容的 API。 AI
影响 像 Lily 这样的专用推理引擎可以通过超越通用框架的性能优化,加速在消费级硬件上的本地 AI 模型部署。
排序理由 Perplexity 开源了一个专用推理引擎 Lily,这是一个在特定硬件上运行特定模型的工具。
在 Mastodon — mastodon.social 阅读 →
- Apple Silicon
- Lily
- macOS
- Metal
- Mlx
- MLX-LM
- OpenAI
- Perplexity
- Perplexity Computer
- PyTorch
- Qwen3.6-35B-A3B
- Rust
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →