流行的开源推理引擎 llama.cpp 已更新其默认行为,以自动加载多令牌预测 (MTP) 张量。此更改会影响内置 MTP 张量的模型,例如 GLM-5.2、hy_v3、qwen35moe 和 step35。以前,只有在明确启用推测解码时才会加载这些张量。现在,它们将默认加载,即使您不使用 MTP 功能,也可能会增加用户的 VRAM 和 RAM 使用量。 AI
影响 使用 MTP 启用模型的 llama.cpp 用户可能会因为默认加载 MTP 张量而看到 VRAM/RAM 使用量增加。
排序理由 这是开源推理引擎的默认行为更改,影响特定类型模型的资源使用。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →