Учёные: байтовые модели обходят токенизированные на длинной дистанции
Статья Университета Вашингтона и Meta FAIR показывает: токенизированные модели быстрее учатся на старте, но выходят на плато, а байтовые продолжают расти. Дистилляция 1B байтовой модели из Llama 3-8B через конвертер End-of-Token даёт +4% на асимптотике при 1/6 данных и 1/5 хранилища логитов.
- Байтовые модели обходят дистиллированные токенизированные на 4% на асимптотике
- End-of-Token точнее Marginalize-It на 1,9% за счёт биективного отображения
- Байтовой модели нужно в 6 раз меньше данных для того же результата
- Словарь из 257 байтовых символов сокращает хранение логитов учителя в 5 раз
Читать дальше
Наука