vLLM игнорирует rank_pattern и alpha_pattern в LoRA-адаптерах
В vLLM 0.30.0 при загрузке PEFT LoRA-адаптера читаются только r и lora_alpha, а rank_pattern и alpha_pattern отбрасываются без предупреждения, из-за чего модули с индивидуальным масштабом считаются неверно. На тесте с Qwen3 расхождение лог-вероятностей с PEFT выросло с 0,0003 до 0,0211; предложенный фикс #59801 пока не принят.
- vLLM 0.30.0 применяет lora_alpha/r ко всем модулям, игнорируя rank_pattern и alpha_pattern
- Средняя ошибка лог-вероятностей выросла с 0,0003 до 0,0211 при rank_pattern на q_proj
- На OLMoE-1B-7B perplexity в vLLM 11,28 против 10,06 в PEFT
- Обходной путь — вручную вписать поправку масштаба в lora_B и очистить паттерны
Читать дальше
ИИ