MTP на RTX 3090 ускорил генерацию Qwen3.8-27B на 56%, но качество кода спорно
Эксперимент с Multi-Token Prediction на RTX 3090 поднял скорость генерации Qwen3.8-27B с 36,0 до 56,2 токенов/с (+56%). Успешные задачи завершались на 20–40% быстрее, но в одном тесте MTP-вариант выдал патч хуже: 26/80 проверок против 35/80 без MTP.
- Скорость генерации выросла с 36,0 до 56,2 токенов/с, то есть на 56%
- Успешные задачи завершались на 20,1% и 39,9% быстрее
- Проверки: 35/80 без MTP против 26/80 с MTP
- Разница в 9 проверок дала одна задача переноса на одном seed
Читать дальше
ИИ