tehno24.ru
← Софт
Софт9 октября 2026, 08:54

В llama-server кэш промптов переиспользует KV, посчитанный при другом масштабе LoRA

В llama.cpp b11514 RAM-кэш промптов llama-server (--cache-ram, включён по умолчанию) сохраняет KV слота без записи применённых LoRA-адаптеров и их масштабов. Проверка смены LoRA сравнивает запрос со слота, а не с восстановленной записью, поэтому ответ декодируется на KV, посчитанном при другом масштабе: 10 из 10 промптов дали неверный результат. Обход — --cache-ram 0 или cache_prompt: false.

В llama-server кэш промптов переиспользует KV, посчитанный при другом масштабе LoRA
#Llama.cpp
Читать дальше
Софт

В llama-server logprobs становятся заглушками при спекулятивном декодировании

Софт

В llama-server нашли гонку: запрос перед засыпанием зависает или роняет сервер

Железо

Huawei представила OceanStor M900 — KV-кэш петабайтного масштаба для ИИ-агентов

ИИ

Google TurboQuant сжимает KV-кэш до 3 бит без потери точности