Контекстное окно — это максимальный объём текста, который языковая модель способна принять на вход и использовать при формировании ответа за один вызов API. Всё, что выходит за этот предел, модель не читает: у неё нет доступа к «предыдущим страницам» — только к тому, что уместилось в окно прямо сейчас. Размер окна измеряется в токенах, а не в словах или символах, и это различие принципиально важно для понимания реальных ограничений систем.
Что такое токен и почему русский текст «тяжелее» английского
Токен — минимальная единица, которой оперирует языковая модель. Большинство современных моделей используют алгоритм BPE (Byte Pair Encoding) или его вариации: часто встречающиеся последовательности символов объединяются в один токен, редкие остаются разбитыми на буквы или байты. Для английского текста один токен в среднем соответствует четырём символам или примерно 0,75 слова. Для русского языка картина иная: кириллица в большинстве токенизаторов кодируется менее эффективно — один токен покрывает около двух-трёх символов. На практике это означает, что один и тот же текст, переведённый с английского на русский, занимает в 1,5–2,5 раза больше токенов.
Простой ориентир: страница текста объёмом 1800 знаков с пробелами потребует примерно 600–900 токенов на русском языке. Документ на 50 страниц — от 30 000 до 45 000 токенов. Это означает, что контекстное окно в 128 000 токенов вмещает около 150–200 страниц русского текста, а не 300, как можно было бы ожидать, исходя из английских ориентиров. Разработчики, переносящие англоязычные сценарии использования на русскоязычные задачи, регулярно сталкиваются с тем, что реальная вместимость окна оказывается заметно ниже ожидаемой.
Размеры окон у актуальных моделей
За последние два года контекстные окна выросли на порядок. Ниже приведены актуальные значения для ключевых моделей:
- GPT-4o: 128 000 токенов — стандарт для большинства задач с длинными документами.
- Claude 3.5 Sonnet / Claude Opus 4: 200 000 токенов — позволяет загрузить целую небольшую книгу.
- Gemini 1.5 Pro / 2.5 Pro: до 2 000 000 токенов — рекордное значение среди коммерческих моделей на середину 2026 года; обработка полного кода крупного проекта или нескольких часов транскриптов становится технически возможной.
- Llama 3.1 (Meta): 128 000 токенов для публичных весов; MoE-версии поддерживают расширенные окна при дообучении.
- Mistral Large 2: 128 000 токенов с улучшенной обработкой длинных зависимостей.
Рост контекстных окон обусловлен несколькими факторами одновременно: архитектурными улучшениями механизма внимания (sliding window attention, flash attention), увеличением доступной видеопамяти GPU и специализированными методами дообучения на длинных последовательностях. Наращивание окна само по себе не бесплатно: квадратичная сложность стандартного self-attention по длине последовательности требует либо приближений, либо существенных инженерных усилий для удержания задержки в разумных пределах.
Эффект «потери в середине»: почему большое окно не равно хорошей памяти
Наличие большого контекстного окна не гарантирует, что модель одинаково хорошо использует всю информацию внутри него. Исследование «Lost in the Middle», опубликованное в 2023 году, зафиксировало систематический паттерн: модели значительно лучше извлекают информацию, расположенную в начале и в конце контекста, чем в его середине. Чем длиннее контекст, тем сильнее этот эффект.
Механически это объясняется структурой обучения: большинство обучающих последовательностей относительно коротки, а ключевые факты чаще располагаются в начале или конце документа. Модель адаптируется к этому распределению и переносит его на длинные контексты. Результат — деградация качества ответов при запросах, требующих извлечения информации из середины большого документа.
Практическое следствие: при работе с длинными документами важные факты и инструкции лучше помещать ближе к началу или концу промпта, а не в середину. Модели, прошедшие специализированное обучение на длинных контекстах — в частности, серия Claude Opus и Gemini 2.5 Pro — демонстрируют меньшую деградацию, однако полностью избавиться от эффекта пока не удалось ни одному разработчику.
Отдельно следует разграничить контекстное окно и долговременную память. Контекстное окно — это оперативная память одного вызова: оно сбрасывается после завершения запроса, если приложение явно не сохраняет историю и не передаёт её в следующем обращении. Долговременная память, которую реализуют некоторые фреймворки — например, Assistants API OpenAI или сторонние векторные хранилища, — представляет собой отдельный механизм поверх базовой архитектуры модели и к размеру контекстного окна прямого отношения не имеет.
Как размер контекстного окна влияет на реальные задачи
Для разработчиков контекстное окно определяет, сколько кода можно передать модели за один раз. Репозиторий среднего размера — около 100 000 строк — занимает от 500 000 до 1 000 000 токенов; даже Gemini 2.5 Pro с его 2M-окном не вместит его целиком. Поэтому инструменты типа RAG (retrieval-augmented generation) по-прежнему актуальны: они отбирают из репозитория только релевантные фрагменты и передают их в контекст без избыточного балласта.
Для аналитических задач с документами ситуация иная. Полный текст стандартного договора (15–30 страниц), квартального отчёта или научной статьи укладывается в 128K-окно с запасом. Модели с окном 200K способны одновременно анализировать несколько связанных документов — например, историю переписки за полгода или все публичные отчёты компании за год.
В задачах с агентами и многоходовыми диалогами контекстное окно расходуется особенно быстро: каждый шаг агента добавляет в контекст результаты инструментов, промежуточные рассуждения и историю предыдущих обменов. При 128K-окне сложный агентный цикл из 20–30 шагов способен заполнить его целиком, что вынуждает разработчиков реализовывать сжатие истории или переключаться на модели с большим окном.
Стоимость вызова API у большинства провайдеров линейно зависит от числа входных токенов. Запрос на 100 000 токенов обходится примерно в 10–50 раз дороже запроса на 2 000 токенов при одинаковой модели. Это делает бездумную передачу всего доступного контекста экономически нецелесообразной даже тогда, когда окно это технически позволяет. Грамотное управление контекстом — отбор, сжатие, чанкинг — остаётся ключевым инженерным навыком при работе с LLM-приложениями.
Направление развития прослеживается отчётливо: модели с окном в 1–2 миллиона токенов перестают быть экзотикой. Одновременно растёт исследовательский интерес к тому, как сделать использование длинного контекста не только возможным, но и надёжным. Пока «потеря в середине» остаётся нерешённой задачей, размер окна и качество работы с ним — разные характеристики, и вторая на практике важнее первой. Модель с 128K-окном, которая равномерно обрабатывает весь контекст, превосходит модель с 2M-окном, деградирующую уже на 200K. Этот разрыв — главная ось, по которой в ближайшие годы будут конкурировать ведущие лаборатории.