tehno24.ru
← ИИ
ИИ3 октября 2026, 01:07

Qwen3.8-27B запустили на одной RTX 3090 через vLLM

Проект syv-ai выложил конфигурацию для запуска Qwen3.8-27B на одной потребительской GPU с 24 ГБ через vLLM с OpenAI-совместимым API. В batch-режиме при 64 параллельных запросах декодирование достигает ~1035 ток/с, в одиночном режиме с MTP-спекulation — 121 ток/с.

Qwen3.8-27B запустили на одной RTX 3090 через vLLM
#Qwen#VLLM#Nvidia
Читать дальше
ИИ

Swift 1.5 Qwen3.8-27B: GGUF-версия против «переразмышления»

Железо

WiCi One превращает одну RTX 5090 в беспроводной GPU по Wi-Fi 7

ИИ

Перепакованная QAT Gemma 4 на одном TPU v5e: 12B выдаёт 675 токенов/с

ИИ

QAT-версия Gemma 4 26B-A4B на одном TPU v6e: KV-кэш больше в 15,6 раза, пропускная способность — в 1,9 раза