llama.cpp 的一项新拉取请求引入了自适应多令牌预测 (MTP) 模式,旨在动态调整 MTP 深度以获得最佳性能。虽然常规文本生成速度可能会略有下降,但在编码任务和回忆对话早期信息方面速度显著提高,最高可达 50%。建议使用特定的配置设置来启用自适应 MTP,以允许动态深度范围。另外,llama.cpp 已过渡到语义化版本控制,并发布了其首个正式版本 v0.1.0。 AI
影响 提高了本地 LLM 部署中编码和回忆任务的性能。
排序理由 该集群讨论了一个软件库的拉取请求和一个新版本发布,这些都是软件开发工具。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →