Токенизация — процесс разбиения текста на элементы (токены), которые могут быть словами, частями слов или символами, перед подачей в языковую модель. Алгоритмы типа BPE и WordPiece определяют, как именно текст разбивается на токены. Неправильная токенизация может привести к ошибкам при обработке текста или потере смысла.
Пример
Перед обработкой фразы 'chatbots are cool' модель GPT разбивает её на токены, используя BPE.