OrcaSAQ-2 сжала 27B-модель Qwen 3.8 до 12,3 ГБ для локального запуска
OrcaSAQ-2 — квантованная версия 27-миллиардной модели Qwen 3.8, сжатая с 54 ГБ до 12,3 ГБ с сохранением 93,2% совпадения токенов по бенчмарку WikiText-2. Для работы нужен GPU с минимум 16 ГБ памяти, модель решает 70% задач S.S.S. swbench и набирает 58,4 балла в Terminal Bench 2.1.
- Сжатие с 54 ГБ до 12,3 ГБ через квантование с сохранением 93,2% токенов
- Требуется GPU минимум с 16 ГБ памяти, рекомендуется контекст 32 000 токенов
- 70% решённых задач в S.S.S. swbench и 58,4 балла в Terminal Bench 2.1
- Speculative decoding ускоряет задачи, но повышает расход памяти
Читать дальше
ИИ