ContextWindow
Тег

#reasoning

Исследования

Верность цепочек рассуждений: когда chain-of-thought не объясняет ответ модели

Новые препринты ставят под сомнение ключевое допущение о reasoning-моделях: видимая цепочка рассуждений может не отражать реальные вычисления, а лишь имитировать их — что подрывает мониторинг агентных систем как метод контроля.

Исследования

RULER-2M: бенчмарк длинного контекста до двух миллионов токенов

Исследователи из NVIDIA, Princeton и DeepMind расширили методологию RULER до контекстов в 2 млн токенов и получили неприятный результат: даже модели с формально поддерживаемым окном 1M+ проваливаются на задачах, где нужно связать факты, разнесённые на 500K–1M токенов. Первый бенчмарк, проверяющий именно reasoning на длинных дистанциях, а не банальный поиск «иголки в стоге».

Модели

Gemini 2.5 Pro занял первое место на RULER-2M с результатом 71,8%

21 мая Google DeepMind опубликовала результаты Gemini 2.5 Pro на бенчмарке длинного контекста RULER-2M: 71,8% по агрегированной метрике — против 62,4% у Claude Opus 4.7 и 58,1% у GPT-5o. Отрыв объясняется специализированным дообучением, а не только размером окна контекста.

Исследования

Process Reward Models: пошаговые награды как новый стандарт RLHF

За шесть месяцев Process Reward Models перешли из исследовательской ниши в обязательный компонент post-training у всех frontier-команд. Суть сдвига: вместо оценки финального ответа модель получает сигнал на каждом шаге рассуждения, и это кардинально меняет качество и предсказуемость обучения.

Исследования

Inference-time scaling: кривые reasoning-моделей и реальная стоимость вычислений

Reasoning-режимы у o1, Claude и Gemini подняли качество за счёт compute на инференсе, а не на тренировке. Зависимость оказалась log-linear: удвоение thinking-токенов даёт 8–15 пунктов на математических задачах. Но за это платят в 5–15 раз большей стоимостью запроса.