一位用户已成功将最初为Gemma模型设计的TurboFieldfare引擎适配到支持Qwen 3.6 35B。由于其更小的专家模型和线性注意力机制的使用,此次移植使得Qwen模型所需的RAM更少,约为1.4 GB,而Gemma需要2.1 GB。虽然在用户的M5机器上,Qwen模型的每秒令牌数速度较慢,但这归因于其更大的专家模型文件需要更频繁的SSD读取。 AI
影响 通过现有的高效引擎,能够以更低的资源部署Qwen模型。
排序理由 用户将现有引擎移植到新模型。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →