一款名为Kyojin的新引擎,基于ExLlamaV3并针对AMD的Strix Halo硬件进行了优化,已被开发用于运行大型混合专家(MoE)模型。该引擎允许两款300B级别的MoE模型,GLM-5.3-Flash和MiMo-V2.6-Flash,分别装入单台128GB的机器中。性能基准测试显示,GLM-5.3-Flash的预填充速度约为580 token/s,MiMo-V2.6-Flash的解码速度高达44 token/s,且与官方FP8版本相比,质量指标具有竞争力。 AI
影响 使得在更易获得的硬件上运行大型MoE模型成为可能,从而可能使先进的AI能力更加普及。
排序理由 发布了一款新的引擎和量化模型,用于在特定硬件上本地部署LLM。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →