tehno24.ru
← ИИ
ИИ23 сентября 2026, 10:27

Qwen3.8-27B на одной RTX 3090 против двух: +20% к декодированию

Тесты показали, что Qwen3.8-27B в квантовании W4A16 помещается на одну RTX 3090 и выдаёт 125–155 токенов/с. Разделение модели на две карты через tensor parallelism даёт около +20% к декодированию и +14% к холодному префиллу, а на закэшированных промптах — ускорение в 2–3 раза.

Qwen3.8-27B на одной RTX 3090 против двух: +20% к декодированию
#Qwen#Nvidia#RTX3090#VLLM
Читать дальше
ИИ

Экс-глава по безопасности Google призвал замедлить развитие ИИ ради детей

ИИ

Эксперты спорят о риске захвата интернета ИИ-агентами

ИИ

Breeze TTS 2 обошла ElevenLabs в рейтинге TTS, но запрещена для коммерции

ИИ

DeepSeek выпустила V4.1-Flash: уровень Claude Opus 5 в кодинге при цене в разы ниже