llama-server 的 RAM 提示缓存中的一个错误可能导致在使用不同缩放比例的 LoRA 适配器时生成不正确的文本。缓存存储了计算出的 KV 状态,但没有记录使用的具体 LoRA 适配器和缩放比例,导致服务器可能重用过时的 KV 状态。在 `llama.cpp` 的多个版本中都观察到了此问题,在测试中,当一个提示首先以一种 LoRA 缩放比例处理,然后在另一个请求占用处理槽后以不同的缩放比例重新处理时,失败率为 100%。禁用 RAM 缓存或为每个请求设置 `cache_prompt: false` 可以解决此问题。 AI
影响 此错误可能导致使用 `llama-server` 的 LoRA 适配器的用户产生不一致或无意义的输出,可能影响依赖于微调模型行为的应用程序。
排序理由 开源 LLM 服务工具特定功能的错误报告。
- Debian 13 LXC
- ggml-org/llama.cpp
- Hugging Face
- llama-server
- LoRA
- moe_shakespeare15M.gguf
- stories15M_MOE-F16.gguf
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →