В llama-server logprobs становятся заглушками при спекулятивном декодировании
При включённом спекулятивном декодировании (draft-модель, MTP или n-gram) llama-server возвращает для всех токенов после первого logprob 0.0 и пустой top_logprobs. Средний logprob 64-токенных сэмплов при temperature 1 падает с -0.48 до -0.0011, при этом текст выглядит нормально. Проблема воспроизводится в релизе b11430 и более ранних сборках.
- Все токены после первого получают logprob 0.0 и пустой top_logprobs
- Средний logprob 64 токенов: -0.48 без спекуляции против -0.0011 с ней
- Проблема есть в b11430 и в b10703 до коммита #27694
- Обходной путь — отправлять запросы logprobs на инстанс без спекуляции
Читать дальше
Софт