В мае сразу несколько публикаций — от OpenAI, Anthropic, DeepMind и Skoltech — зафиксировали одно и то же: Process Reward Models стали новой нормой для обучения reasoning-моделей. Метод оценивает каждый шаг chain-of-thought, а не только итоговый ответ, и это решает проблему, с которой классический RLHF бился несколько лет подряд.

Почему outcome rewards недостаточны

Классический RLHF работает через Outcome Reward Models: человек или вспомогательная модель оценивает готовый ответ, сигнал идёт в алгоритм PPO или аналогичный. Подход работает, но страдает от проблемы credit assignment — непонятно, на каком именно шаге рассуждения модель ошиблась. Если из десяти шагов три были неверными, а ответ всё равно верный (или наоборот), ORM даёт паразитный сигнал.

Это приводит к тому, что модели учатся «угадывать» правильные ответы через некорректные рассуждения. Они оптимизируют внешний результат, а не внутреннюю логику. В production это проявляется как неожиданные провалы: на похожих задачах результат нестабилен, потому что обученная «стратегия» поверхностная.

Process Reward Models ставят оценку на каждом шаге. Десять шагов — десять сигналов. Это резко увеличивает плотность обучающего сигнала и позволяет точечно корректировать конкретные ошибки в рассуждении, не затрагивая то, что работает правильно. Проблема credit assignment исчезает: система точно знает, какой шаг привёл к отклонению.

Ещё один практический эффект — снижение нестабильности обучения. При ORM модель нередко «осциллирует»: оптимизирует под конкретные паттерны ответов, не усваивая общие принципы. PRM стабилизирует траекторию, потому что сигнал поступает раньше и точнее. Это особенно заметно на задачах с большим пространством решений, где одна и та же цель достигается множеством разных путей.

Четыре направления развития метода

Майские публикации разошлись по разным архитектурным векторам. Anthropic представил Tree-PRM: вместо линейной цепочки шагов строится дерево возможных траекторий рассуждения, и PRM оценивает ветви целиком. Это существенно стабилизирует обучение на задачах с большим пространством решений — математика, доказательства теорем, сложное программирование. Линейная PRM наказывает за каждый «неоптимальный» шаг, даже если он вёл к правильному решению через нестандартный путь. Tree-PRM смотрит на ветвь целиком и оценивает её результат, а не промежуточный выбор.

DeepMind предложил Self-supervised PRM: вспомогательная модель-оценщик обучается без ручной разметки шагов, опираясь только на сравнение с известным правильным финальным ответом. Это снижает зависимость от дорогостоящей аннотации, которая при PRM становится в разы затратнее, чем при классическом RLHF. Идея в том, что если известен правильный конечный результат, можно методом обратного распространения ошибки по цепочке шагов восстановить, какие из них привели к верному исходу, а какие отклонили от него.

Skoltech опубликовал Multi-domain PRM: единая модель-оценщик, обученная одновременно на математике, программировании и юридических задачах, показывает положительный transfer effect — навыки из одного домена переносятся в другой. Это неочевидный результат: было бы логично ожидать, что разные домены требуют разных оценщиков. По-видимому, рассуждение как таковое имеет достаточно универсальную структуру на уровне шагов, чтобы совместное обучение оказалось выгодным.

OpenAI, в свою очередь, обновил методологию из исходной работы «Let’s Verify Step by Step» 2023 года, которая до недавнего времени оставалась главным референсом по PRM. Новая версия добавляет механизм работы с ошибками типа «верные шаги, неверный вывод» — случай, который старая версия обрабатывала плохо. Проблема в том, что технически корректная цепочка рассуждений может завершиться неверным ответом из-за одного некорректного перехода в самом конце. Новая методология умеет правильно атрибутировать такой «поздний сбой».

Где PRM уже работает в продакшене

Claude Opus 4.7, GPT-5o reasoning mode, Gemini 2.5 Pro thinking — все три используют тот или иной вариант PRM в своём post-training. Это объясняет качественный скачок reasoning-способностей между поколениями: разница между текущими моделями и версиями годичной давности на одинаковом объёме параметров во многом обусловлена именно сменой методики обучения, а не только ростом параметров.

Косвенное подтверждение — характер ошибок. Модели с PRM-обученным reasoning-режимом делают качественно другие ошибки, чем модели без него. Вместо «уверенного неправильного ответа» они чаще выдают частично верное рассуждение с явным местом отклонения — что значительно упрощает диагностику и дообучение. Это само по себе ценно для итеративного улучшения системы.

На open-weight стороне ситуация сложнее. DeepSeek-R1 раскрыл часть деталей своего подхода, что позволило независимым командам воспроизводить отдельные элементы. Но полные PRM-пайплайны от ведущих лабораторий закрыты. Это один из главных векторов, по которому разрыв между frontier и open-weight остаётся значимым — и закрыть его без собственных объёмов аннотированных данных по шагам рассуждения практически невозможно.

Данные — новое узкое место

Переход на PRM меняет требования к данным кардинально. Для классического RLHF достаточно human preference pairs: два варианта ответа, отметка, который лучше. Для PRM нужны пошаговые цепочки рассуждений с оценкой каждого шага — это в 5–10 раз дороже в производстве и требует аннотаторов с профильными знаниями. Нельзя попросить не-математика оценивать шаги доказательства.

Именно поэтому self-supervised варианты PRM, такие как предложенный DeepMind, вызывают такой интерес. Если можно обойтись без пошаговой разметки — масштабировать метод на новые домены становится принципиально проще. Остаётся открытым вопрос, насколько self-supervised оценщик стабилен на граничных случаях, где финальный ответ неоднозначен. Это направление активно исследуется.

Параллельный эффект: PRM стимулирует стандартизацию reasoning-форматов. Модели с видимыми токенами рассуждения, которые выглядели экспериментом в 2024 году, к 2026-му стали нормой для сложных сценариев. Оценивать теперь нужно не только финальный ответ, но и траекторию к нему — и это переопределяет само понятие качества модели. То, что раньше было внутренним делом inference, превращается в явный, измеримый и оптимизируемый объект.

Что меняется в практике оценки моделей

Широкое внедрение PRM ставит вопрос: как теперь оценивать reasoning-модели внешним наблюдателям? Классические бенчмарки типа MATH, GSM8K или GPQA Diamond измеряли итоговую точность. Они остаются полезны, но перестают быть достаточными. Если модель получает оценку на каждом шаге, логично и оценивать её по качеству шагов, а не только по финальному ответу.

Появляются специализированные наборы данных с пошаговой разметкой — ProcessBench, PRM800K — которые позволяют сравнивать модели по тому, насколько их внутренние рассуждения соответствуют «правильным» траекториям. Это пока не мейнстрим в оценке публичных моделей, но направление очевидное: по мере роста значимости reasoning-режимов оценка внутренней логики модели станет таким же стандартным компонентом, как измерение точности ответа.