Strata запускает 125-млрд LLM на игровом ПК с 12 ГБ VRAM
Проект Strata от разработчика Niko1221 позволяет запускать 125-миллиардную MoE-модель Qwen3.8 на обычном игровом ПК. VRAM используется как кэш для экспертов, полная модель хранится в системной RAM, а 29-ГБ таблица — на SSD. На RTX 5070 с 12 ГБ VRAM достигается 50–90 токенов в секунду.
- Модель Qwen3.8-Flash-Next содержит 24 576 экспертов, на каждый токен нужно 10
- Требуется минимум 32 ГБ RAM, 12 ГБ VRAM и около 80 ГБ на диске
- RTX 5070 выдаёт 50–90 токенов в секунду в зависимости от квантизации
- Локально доступны OpenAI- и Anthropic-совместимые API
Читать дальше
Гаджеты