tehno24.ru
← ИИ
ИИ3 октября 2026, 18:46

133-ГБ MoE-модель запустили на 8-ГБ GPU со стримингом экспертов с NVMe

Энтузиаст запустил Qwen3.8-Flash-Next в NVFP4 (133 ГБ) на RTX 5060 с 8 ГБ, стримя экспертов с NVMe: 9–12 токенов/с в Open WebUI. Движок на PyTorch + Triton написан с помощью Claude и Codex, точность совпала с эталоном transformers.

133-ГБ MoE-модель запустили на 8-ГБ GPU со стримингом экспертов с NVMe
#Nvidia#Qwen#OpenWebUI
Читать дальше
ИИ

OrcaSAQ-2 сжала 27B-модель Qwen 3.8 до 12,3 ГБ для локального запуска

ИИ

Bonsai 2 27B: тернарные веса сжали модель до 5,9 ГБ

Гаджеты

Обзор Mac Studio с M5 Ultra: до 256 ГБ памяти и 80 GPU-ядер

Гаджеты

HP ZBook Ultra G3a 16: до 192 ГБ памяти и 160 ГБ для GPU