21 мая Google DeepMind опубликовала результаты Gemini 2.5 Pro на бенчмарке RULER-2M: 71,8% по агрегированной метрике. Это лучший результат среди публично оценённых языковых моделей. Claude Opus 4.7 набрал 62,4%, GPT-5o — 58,1%. Разрыв в 9 пунктов с ближайшим конкурентом нетипично велик для рынка, где большинство моделей верхнего эшелона группируется в пределах 3–5 пунктов.

RULER-2M — расширение оригинального бенчмарка RULER 2024 года, адаптированное под входы от 500K до 2M токенов. Авторы добавили семь задач: трассировка кореференций через сотни тысяч слов, многоступенчатые логические выводы по фрагментированным фактам, реконструкция структуры документа с намеренно перемешанными секциями. Подробное описание методологии и текущий leaderboard опубликованы в препринте на arXiv.

Почему существующие модели проваливаются на 1M+ токенах

Стандартный механизм self-attention имеет квадратичную сложность относительно длины последовательности: удвоение контекста требует учетверения объёма вычислений. На входах до 128K токенов это терпимо — современные GPU справляются. На 1M токенах и выше квадратичный рост делает вычисление full attention физически нереализуемым за разумное время.

Большинство моделей решают эту проблему через упрощения: sliding window attention (модель видит только ближайший контекст), разреженное внимание со случайной выборкой, или через позиционные кодировки, которые деградируют на длинах, превышающих тренировочные. Результат один и тот же: модель формально «поддерживает» длинный контекст, но качество рассуждений на удалённых фрагментах резко падает.

Задачи RULER-2M спроектированы так, что именно это и проверяется. Найти конкретную фразу в 2M-токенном документе — тривиально для любой современной модели. Найти связь между утверждением в первой трети документа и его опровержением в последней — принципиально сложнее, и здесь большинство моделей теряют точность.

Три причины отрыва Gemini

Команда DeepMind объясняет результат комбинацией архитектурного решения, состава корпуса и специализированного RLHF — ни один из этих факторов по отдельности не даёт такого эффекта.

Архитектурно Gemini 2.5 Pro использует сегментацию внимания: локальные блоки по 8K токенов обрабатываются с полным вниманием, тогда как между блоками работает разреженное глобальное представление. Это снижает квадратичную стоимость на очень длинных входах без потери способности связывать удалённые фрагменты. Задачи RULER-2M требуют связывания частей, разделённых сотнями тысяч токенов, — именно здесь этот подход даёт преимущество.

Второй фактор — около 12% претрейн-токенов составляют документы длиной свыше 200K токенов, специально отобранные и аугментированные для тренировки long-range reasoning. Это контрастирует с исторической практикой OpenAI и Anthropic, где длинный контекст рассматривался скорее как следствие общего масштабирования, без целевого дообучения на длинных документах.

Третий — RLHF-стадия с reward-моделью, обученной именно на ошибках длинного контекста. Когда модель «забывала» ограничение или предположение, заявленное за 800K токенов до конца документа, операторы фиксировали явный отрицательный сигнал. Техника напоминает Process Reward Models, которые Anthropic публиковала в апреле, но применяется к специфической проблематике long-context.

Что бенчмарк не охватывает

RULER-2M — синтетический тест. Авторы сами оговаривают это в методологии: реальные длинные документы — кодовые базы, нормативные акты, исследовательские отчёты — имеют структуру, которую генератор задач воспроизвести не может. Нарративная связность реального текста, ссылки на внешние документы, неявные допущения — всё это синтетический бенчмарк игнорирует.

RULER-2M также не измеряет стоимость. По ориентировочным данным, один запрос к Gemini 2.5 Pro с контекстом в 2M токенов обходится в десятки раз дороже, чем запрос с 128K. Для большинства продакшен-сценариев вопрос экономики релевантнее вопроса бенчмарка. Команда, которая обрабатывает тысячи документов в день, сначала считает стоимость запроса, и только потом смотрит на accuracy.

Задачи типа «найди иголку в стоге сена», которые два года назад были основным способом проверки long-context-моделей, текущие топовые модели решают с точностью выше 99%. RULER-2M специально сконструирован так, чтобы простой attention к нужному фрагменту не давал правильного ответа — нужно связать несколько распределённых частей. Это более реалистичная модель реальной задачи — когда юрист работает с 300-страничным договором, он ищет не отдельное слово, а отслеживает логические зависимости между разделами.

Что это меняет для команд прямо сейчас

Для задач с большим контекстом — анализ длинных переписок, корпоративной документации, агрегация исследовательских материалов — Gemini 2.5 Pro сегодня является выбором с наилучшим публичным benchmark-результатом. Стоимость за миллион токенов у Google ниже, чем у Anthropic, что усиливает аргумент. Перед внедрением обязательна собственная валидация на репрезентативных документах из реального рабочего процесса — синтетический бенчмарк даёт ориентир, не гарантию.

Anthropic уже анонсировала, что следующий Claude Opus 5 будет включать пересмотренную архитектуру для длинного контекста. Публикация ожидается в третьем квартале. До тех пор Gemini сохраняет техническое лидерство в этой нише — по крайней мере, в части, которую можно измерить публичным бенчмарком. Темп, с которым разрыв накапливался за последние полгода, говорит о том, что Google инвестировала в long-context-инфраструктуру целенаправленно, а не получила её как побочный эффект масштабирования.

По мотивам: Google DeepMind blog