Токенизация и не-английские языки
Словари токенизаторов исторически формировались на корпусах с преобладанием англоязычного текста. На практике это приводит к тому, что кириллица и ряд других письменностей при том же смысловом объёме разбиваются на большее число токенов, чем эквивалентный английский текст.
Рост словаря у более новых токенизаторов (от 50 257 у GPT-3 до примерно 200 000 у o200k_base) — один из факторов, сокращающих эту разницу, хотя точная зависимость определяется составом обучающих данных конкретного токенизатора.
Для разработчиков, работающих с API с тарификацией по токенам, разница ощутима: текст на русском языке занимает больше контекстного окна и обходится дороже, чем эквивалентный английский.





