Qwen3.8-27B запустили на одной RTX 3090 через vLLM
Проект syv-ai выложил конфигурацию для запуска Qwen3.8-27B на одной потребительской GPU с 24 ГБ через vLLM с OpenAI-совместимым API. В batch-режиме при 64 параллельных запросах декодирование достигает ~1035 ток/с, в одиночном режиме с MTP-спекulation — 121 ток/с.
- Batch-режим: ~1035 ток/с при 64 запросах, 1222 ток/с с int8-слоями
- Одиночный режим: 121 ток/с с MTP, 127 ток/с с SPEC=dflash2
- DFLASH_TOKENS=15 даёт 382 ток/с при цитировании документа, но режет слоты с 8 до 4
- Первый запуск тянет 9,5 ГБ образ и ~20 ГБ модели, порт 18020
Читать дальше
ИИ