ContextWindow
Тег

#deepmind

Исследования

RULER-2M: бенчмарк длинного контекста до двух миллионов токенов

Исследователи из NVIDIA, Princeton и DeepMind расширили методологию RULER до контекстов в 2 млн токенов и получили неприятный результат: даже модели с формально поддерживаемым окном 1M+ проваливаются на задачах, где нужно связать факты, разнесённые на 500K–1M токенов. Первый бенчмарк, проверяющий именно reasoning на длинных дистанциях, а не банальный поиск «иголки в стоге».

Модели

Gemini 2.5 Pro занял первое место на RULER-2M с результатом 71,8%

21 мая Google DeepMind опубликовала результаты Gemini 2.5 Pro на бенчмарке длинного контекста RULER-2M: 71,8% по агрегированной метрике — против 62,4% у Claude Opus 4.7 и 58,1% у GPT-5o. Отрыв объясняется специализированным дообучением, а не только размером окна контекста.