DFlash-2 от Z-Lab ускоряет генерацию LLM через диффузионный драфтинг
Z-Lab и inco.ai выпустили DFlash-2 — улучшение техники предсказания токенов DFlash на основе диффузионной модели. Добавлены Lightweight Path Selector для проверки порядка токенов и Local Convolution против падения точности к концу блока. Поддержка пока у Qwen3.8-27B и Muse-Glimmer-30B, в llama.cpp — через PR #27342.
- DFlash-2 добавляет Path Selector и Local Convolution к диффузионному драфтингу DFlash
- Доступны модели Qwen3.8-27B-DFlash2 и Muse-Glimmer-30B-DFlash2 с GGUF для llama.cpp
- Поддержка в llama.cpp пока только через PR #27342, не в master
- Рекомендуемые параметры: --spec-draft-n-max 4, --temp 1.0, --top-p 0.95
Читать дальше
ИИ