llama.cpp 的多令牌预测 (MTP) 已被修改,以减少内存使用量,允许 Qwen 27B 等大型模型在显存有限(如 16GB)的系统上运行。这个新的“Compact Rollback MTP”功能允许用户指定模型在显存中保留多少回滚状态,从而以更低的上下文成本实现更高的令牌生成限制。该修改还包括自适应推测解码,它根据最近的草稿接受情况动态调整 MTP 草稿限制,进一步优化性能。 AI
影响 使得在消费级硬件上运行大型语言模型成为可能,从而可能增加人工智能应用程序的可访问性和用例。
排序理由 这是对现有工具 (llama.cpp) 的修改,旨在提高特定模型 (Qwen) 在有限硬件上的性能,而不是发布新模型或核心研究。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →