Исследования
Новые препринты ставят под сомнение ключевое допущение о reasoning-моделях: видимая цепочка рассуждений может не отражать реальные вычисления, а лишь имитировать их — что подрывает мониторинг агентных систем как метод контроля.
7 июня
5 мин
Исследования
Исследователи из NVIDIA, Princeton и DeepMind расширили методологию RULER до контекстов в 2 млн токенов и получили неприятный результат: даже модели с формально поддерживаемым окном 1M+ проваливаются на задачах, где нужно связать факты, разнесённые на 500K–1M токенов. Первый бенчмарк, проверяющий именно reasoning на длинных дистанциях, а не банальный поиск «иголки в стоге».
24 мая
5 мин
Модели
21 мая Google DeepMind опубликовала результаты Gemini 2.5 Pro на бенчмарке длинного контекста RULER-2M: 71,8% по агрегированной метрике — против 62,4% у Claude Opus 4.7 и 58,1% у GPT-5o. Отрыв объясняется специализированным дообучением, а не только размером окна контекста.
21 мая
4 мин
Исследования
За шесть месяцев Process Reward Models перешли из исследовательской ниши в обязательный компонент post-training у всех frontier-команд. Суть сдвига: вместо оценки финального ответа модель получает сигнал на каждом шаге рассуждения, и это кардинально меняет качество и предсказуемость обучения.
16 мая
5 мин
Исследования
Reasoning-режимы у o1, Claude и Gemini подняли качество за счёт compute на инференсе, а не на тренировке. Зависимость оказалась log-linear: удвоение thinking-токенов даёт 8–15 пунктов на математических задачах. Но за это платят в 5–15 раз большей стоимостью запроса.
9 мая
5 мин