Qwen3.8-27B на одной RTX 3090 против двух: +20% к декодированию
Тесты показали, что Qwen3.8-27B в квантовании W4A16 помещается на одну RTX 3090 и выдаёт 125–155 токенов/с. Разделение модели на две карты через tensor parallelism даёт около +20% к декодированию и +14% к холодному префиллу, а на закэшированных промптах — ускорение в 2–3 раза.
- Одна RTX 3090: 123–154 токена/с, две карты: 146–193 токена/с
- Холодный префилл: 1 100–1 220 токенов/с на одной карте против 1 230–1 360 на двух
- TTFT на промпте 8 600 токенов: 8,5 с на одной карте и 6,9 с на двух
- Ускорение в 2–3 раза на повторных промптах даёт кэш префиксов, а не карты
Читать дальше
ИИ