tehno24.ru
← ИИ
ИИ3 октября 2026, 04:22

MTP на RTX 3090 ускорил генерацию Qwen3.8-27B на 56%, но качество кода спорно

Эксперимент с Multi-Token Prediction на RTX 3090 поднял скорость генерации Qwen3.8-27B с 36,0 до 56,2 токенов/с (+56%). Успешные задачи завершались на 20–40% быстрее, но в одном тесте MTP-вариант выдал патч хуже: 26/80 проверок против 35/80 без MTP.

MTP на RTX 3090 ускорил генерацию Qwen3.8-27B на 56%, но качество кода спорно
#Nvidia#Qwen#RTX3090#Llama.cpp
Читать дальше
ИИ

Qwen3.8-27B на одной RTX 3090 против двух: +20% к декодированию

ИИ

Swift 1.5 Qwen3.8-27B: GGUF-версия против «переразмышления»

Железо

Apple M3 Neural Engine ускорил генерацию токенов Llama 3.2 1B до 24,3 в секунду

ИИ

laya-compactor сокращает контекст RAG на 70% без потери качества ответов