ContextWindow
Тег

#post-training

Исследования

Process Reward Models: пошаговые награды как новый стандарт RLHF

За шесть месяцев Process Reward Models перешли из исследовательской ниши в обязательный компонент post-training у всех frontier-команд. Суть сдвига: вместо оценки финального ответа модель получает сигнал на каждом шаге рассуждения, и это кардинально меняет качество и предсказуемость обучения.