UC Berkeley и FuriosaAI: HBF ускоряет обслуживание LLM на 36–87%
Исследователи UC Berkeley и FuriosaAI опубликовали работу о применении high-bandwidth flash (HBF) для обслуживания LLM. Система HBM-HBF-host с кэш-осознанным планированием сокращает время выполнения на 36,1–87,0% и экономит до 55,8% энергии, а срок службы HBF по записи растёт с 4,77 до 14,82 года.
- HBF-системы быстрее HBM-only на 36,1–87,0% по времени выполнения
- Экономия энергии достигает 55,8%, но на лёгких нагрузках HBF расходует больше
- Кэш-осознанное планирование продлевает срок записи HBF с 4,77 до 14,82 года
- Работа опубликована в arXiv под номером 2609.39131 в сентябре 2026 года
Читать дальше
ИИ