Сколтех и Yandex Research 7 мая выложили на arXiv препринт с методологией построения BPE-токенизатора, учитывающего морфологию русского языка. Авторы утверждают снижение средней длины токенизированной последовательности на 14–18% по сравнению со стандартным tiktoken cl100k от OpenAI — при сохранении сопоставимого качества на downstream-задачах.

За этой технической деталью скрывается прямой экономический смысл. Стоимость инференса пропорциональна числу токенов. Если русский текст той же длины занимает на 18% меньше токенов, значит при фиксированном бюджете на обработку можно обработать на 18% больше контента — или потратить на 18% меньше денег на тот же объём. При промышленных нагрузках это существенно.

Почему стандартные токенизаторы неэффективны для русского

Большинство LLM используют BPE-токенизаторы, обученные на смешанных мультиязычных корпусах. Для языков с богатой морфологией — таких как русский, финский или турецкий — это создаёт структурную проблему: одно слово может разбиваться на 3–5 токенов из-за множественных окончаний, приставок и суффиксов.

BPE (Byte Pair Encoding) работает по жадному принципу: берёт самые частотные пары символов и последовательно сливает их в единицы. На английском это работает хорошо — морфологически бедный язык, слова короткие. На русском к одному корню прибавляются падежные окончания, видовые суффиксы, приставки — и алгоритм разбивает их на множество мелких кусков, потому что каждая конкретная форма встречается значительно реже, чем соответствующая английская форма.

В стандартном cl100k слово «исследование» разбивается на 4 токена. В предложенном токенизаторе — на 2. Типичные деепричастные обороты, обычные для русской деловой и научной прозы, сокращаются в 1,5–2 раза. Эффект накапливается: чем длиннее текст, тем заметнее разрыв.

Как устроена методология

Построение токенизатора происходит в три этапа. На первом из корпуса извлекаются морфологически значимые единицы — корни, аффиксы, частые сочетания — с учётом грамматической структуры русского языка. На втором применяется модифицированный BPE-алгоритм, который при выборе кандидатов для слияния отдаёт предпочтение последовательностям, совпадающим с морфологическими границами. На третьем токенизатор итеративно проверяется на размеченных корпусах.

Принципиальное отличие от стандартного BPE — в весовой функции при слиянии. Обычный BPE выбирает пару просто по частоте. Модифицированный добавляет морфологический вес: если предлагаемое слияние разрывает корневую или аффиксальную границу, оно получает штраф. Это мягкое ограничение, а не жёсткое правило — алгоритм может его преодолеть при достаточно высокой частоте. Но в большинстве случаев предпочтение морфологически корректных слияний выравнивает словарь по лингвистическим единицам.

Авторы проверили влияние нового токенизатора на трёх downstream-задачах: question answering на SberQuAD, named entity recognition на Russian-NER и summarization на корпусе новостей. Статистически значимого ухудшения качества не зафиксировано ни на одной из задач при тренировке моделей сопоставимого размера на одинаковых корпусах.

Дополнительный эффект — снижение числа шагов обучения для достижения целевого качества. При морфологически согласованном токенизаторе модель быстрее усваивает русскую морфологию. Авторы оценивают экономию тренировочного compute в 8–12% — меньше, чем выигрыш на инференсе, но всё равно значимо при масштабах обучения frontier-моделей.

Где это уже применяется

Yandex GPT 5 Pro, вышедший в мае, использует переработанный токенизатор — компания упомянула об этом в анонсе модели. Это первое публичное подтверждение того, что методология перешла из препринта в production-систему. GigaChat от Сбера, вероятно, движется в том же направлении, хотя официальных подтверждений пока нет.

Экономический аргумент для Яндекса очевиден: компания обрабатывает миллиарды русскоязычных запросов через свои LLM-продукты. 18% экономии токенов на таком масштабе — это конкретные миллиарды рублей экономии в год на инфраструктуре инференса. Академическая работа здесь напрямую закрывает производственную потребность.

Применимость к другим языкам

Код и обученные токенизаторы авторы обещают опубликовать под лицензией Apache 2.0 летом. Это даст возможность независимым командам применять методологию к другим языкам с богатой морфологией — финно-угорским, тюркским, балтийским. Принцип тот же: там, где BPE на смешанном корпусе плохо обрабатывает морфологические единицы, морфологически согласованный вариант даст выигрыш.

Для турецкого и финского ожидаемый эффект может быть даже выше, чем для русского: эти языки ещё более агглютинативны, то есть ещё больше грамматической информации кодируется аффиксами. Одно слово в финском может соответствовать целому предложению в английском — и стандартный BPE разбивает его на десятки мелких кусков. Морфологически согласованный токенизатор потенциально сжимает это в 3–5 токенов.

Ограничения и компромиссы

Главное ограничение — языковая специфичность. Токенизатор, оптимизированный под русский, неэффективен для английского. Для мультиязычных моделей это создаёт реальный компромисс: либо общий BPE с потерей эффективности на отдельных языках, либо набор языковых сабтокенайзеров с увеличением сложности всей обвязки. Общий словарь хорошо работает для transfer learning между языками — специализированный его ограничивает.

Кроме того, методология требует наличия морфологического анализатора для конкретного языка — готового, надёжного, достаточно покрывающего живой язык. Для русского эта инфраструктура давно есть. Для большинства языков с богатой морфологией она либо слабее, либо требует отдельной работы перед применением подхода. Не каждый язык может воспроизвести этот результат без предварительной лингвистической разработки.

Работа вписывается в более широкий тренд: за последние 18 месяцев российские исследовательские команды заметно активизировались в публикационной активности по LLM-тематике в международных журналах. Локальная экспертиза в фундаментальных компонентах стека — токенизаторы, методики оптимизации, evaluation-инструменты — это не только академический результат, но и практическая основа. Для команд, которые строят русскоязычные продукты на LLM, публикация под Apache 2.0 осенью — конкретный ориентир для тестирования на собственной нагрузке.