vLLM 版本 0.30.0 中的一个错误导致其错误地缩放 LoRA 适配器,从而导致性能显著下降。该问题源于 vLLM 忽略了适配器配置文件中的 `rank_pattern` 和 `alpha_pattern` 设置,这些设置旨在允许适配器内的不同模块使用不同的缩放因子。相反,vLLM 应用了仅从基础 `r` 和 `lora_alpha` 值派生的单一、统一的缩放因子。事实证明,这种错误的缩放会在混合专家模型上将困惑度(perplexity)提高约 40%,并在较小的测试模型上导致比 PEFT 库大 70 倍的提示对数概率偏差。这个问题很微妙,可能会被忽视,因为 vLLM 仍然会加载适配器而不会发出警告,并且生成的文本不会立即显得不正确。 AI
影响 vLLM 中的此错误可能导致使用 LoRA 适配器的模型性能显著下降,从而可能影响推理质量和效率。
排序理由 错误报告,详细说明了推理服务框架中的不正确行为。
- adapter_config.json
- LoRA
- PEFT
- PyTorch
- Qwen3
- rank_pattern
- RTX 2070
- ubuntu
- vLLM
- Windows 11
- Windows Subsystem for Linux
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →