Учёные: ИИ-модели лучше понимают буквы при посимвольной токенизации
Исследование показало, что разбиение текста на подслова (subword tokenization) мешает LLM видеть отдельные буквы: ChatGPT делит «LMU München» на «LM», «U» и «München». Переход к посимвольному представлению улучшает задачи вроде написания слов задом наперёд.
- Subword-токенизация ускоряет LLM, но скрывает отдельные буквы
- Пример: «LMU München» делится на три чанка «LM», «U», «München»
- Посимвольные модели лучше справляются с задачами на уровне символов
Читать дальше
ИИ