llama.cpp 的 --lazy-mode 默认行为已更改为 'auto',现在会将大型嵌入表保留在磁盘上,并在推理过程中按需映射。此更改在提交 b10726 中实现,可能导致显著的性能损失,一位用户报告称表处理速度降低了 50%,令牌生成速度降低了 15%。建议拥有足够 RAM 的用户显式将 --lazy-mode 设置为 'off',以恢复到将表加载到内存的先前行为。 AI
影响 llama.cpp 的此默认行为更改可能需要用户为了获得最佳性能而进行配置调整,特别是那些运行具有重要嵌入表的大型模型的用户。
排序理由 流行的开源推理引擎的默认行为发生变化,影响用户性能。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →