vLLM 0.30.0 отдаёт чужие веса при совпадении разметки тензоров
В vLLM 0.30.0 кэш весов (load_format="ipc_cache") сравнивает отпечатки чекпоинтов только по именам файлов и заголовкам safetensors — без значений тензоров. Поэтому базовая модель и её файнтюн с той же разметкой получают одинаковый ключ, и движок может обслуживаться весами другого чекпоинта без предупреждений.
- Отпечаток хеширует имена тензоров, формы, dtype и смещения, но не сами значения
- На RTX 2070 движок на копии Qwen3-0.6B с обнулённым model.norm.weight выдал ответ оригинальной модели
- При несовпадении разметки срабатывает откат на загрузку с диска с предупреждением WeightCacheKey mismatch
- Исправление предложено в PR #59648: хешировать выборочные байты тензоров, а не только заголовки
Читать дальше
ИИ