В llama-server кэш промптов переиспользует KV, посчитанный при другом масштабе LoRA
В llama.cpp b11514 RAM-кэш промптов llama-server (--cache-ram, включён по умолчанию) сохраняет KV слота без записи применённых LoRA-адаптеров и их масштабов. Проверка смены LoRA сравнивает запрос со слота, а не с восстановленной записью, поэтому ответ декодируется на KV, посчитанном при другом масштабе: 10 из 10 промптов дали неверный результат. Обход — --cache-ram 0 или cache_prompt: false.
- Кэш хранит только токены и чекпоинты, без данных о LoRA и масштабе
- На b11514 ошибка воспроизвелась на 10 из 10 промптов, на b10703 — так же
- С --cache-ram 0 или cache_prompt: false ответы корректны в 10 из 10 случаев
- При -np 4 каждый промпт держит свой слот, и ошибка не проявляется
Читать дальше
Софт