TokenRouter: маршрутизация LLM на уровне токенов экономит 18% и ускоряет вывод
Представлена TokenRouter — первая публичная система, выбирающая модель для генерации каждого отдельного токена, а не всего запроса. По данным бенчмарков, медианная задержка на токен падает на 31–32%, а стоимость инференса — на 18–21% без потери качества.
- Медианная задержка на токен снижается с 3,4 до 2,3 мс на A100-40 ГБ
- Стоимость GPU-секунд на 1 млн токенов падает с 1,02 до 0,84 с (-21%)
- Около 68% токенов уходят дешёвой 7B-модели, 70B обрабатывает лишь 32%
- ROUGE-L для суммаризации вырос на 0,3%, BLEU для перевода — на 0,1%
Читать дальше
ИИ