Токен — минимальная единица текста, с которой работает модель: целое частое слово, часть длинного слова, знак препинания или пробел. Частые слова кодируются одним токеном, редкие — несколькими; числа часто разбиваются (число 12345 может быть 2–3 токенами). Для английского текста ~4 символа = 1 токен, для русского — ~2–3 символа, поэтому кириллица «дороже» в токенах. 1000 токенов ≈ 700–750 слов, то есть токен — это не слово и не символ, а фрагмент, выбранный алгоритмом BPE.