一种名为 WinterMix 的新量化方法已为 MLX 模型开发,专门针对 Qwen3.5-122B-A10B。该方法生成的 82 GiB 版本性能优于更大的 6 位版本,并且几乎与源 GGUF 模型相当。另有一个较小的 68 GiB 版本,针对在 Apple Silicon 硬件上同时运行多个智能体任务进行了优化。 AI
影响 提高了大型语言模型在 Apple Silicon 上的效率和性能,支持在本地进行更复杂的智能体工作流。
排序理由 发布了一种现有模型的新量化方法,并附有性能基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →