133-ГБ MoE-модель запустили на 8-ГБ GPU со стримингом экспертов с NVMe
Энтузиаст запустил Qwen3.8-Flash-Next в NVFP4 (133 ГБ) на RTX 5060 с 8 ГБ, стримя экспертов с NVMe: 9–12 токенов/с в Open WebUI. Движок на PyTorch + Triton написан с помощью Claude и Codex, точность совпала с эталоном transformers.
- Модель: 48 слоёв, 512 экспертов, top-10, ~1,27 ГБ экспертов на токен
- Резидентная часть в FP8 — 6,13 ГБ VRAM, 63 ГБ экспертов на диске
- Скорость выросла с 2,68 до 11,65 токенов/с после кэша и префетча
- Промпт на 2451 токен сократился с 71,6 до 23,3 с
Читать дальше
ИИ