Когда GPT-o1, Claude с extended-thinking или другая reasoning-модель выдаёт развёрнутый scratchpad перед ответом, принято считать, что этот текст показывает ход вычислений. На этом допущении строится целый класс методов интерпретируемости и безопасности: если модель «думает вслух», её мышление можно проверять, фильтровать и контролировать. Серия новых препринтов на arXiv cs.CL проверяет это допущение экспериментально — и получает неудобные результаты.
Что значит верность цепочки рассуждений
Термин faithfulness в контексте chain-of-thought означает причинную связь между текстом рассуждения и финальным ответом. Цепочка считается верной, если изменение промежуточных шагов предсказуемо меняет вывод — то есть модель действительно опирается на записанные шаги, а не генерирует ответ по другому, скрытому пути, лишь потом добавляя объяснение.
Противоположный случай — пост-рационализация: модель вычисляет ответ одним способом, а CoT-текст конструирует независимо, как правдоподобное, но не причинное обоснование. Внешне оба сценария выглядят одинаково; разница обнаруживается только при интервенциях на промежуточных шагах.
Исследователи различают два уровня неверности. Первый — локальный: отдельный шаг в цепочке содержит ошибку или противоречие, но финальный ответ всё равно правильный, потому что последующие токены «исправляют курс» независимо от записанного шага. Второй — глобальный: весь CoT-блок можно заменить или удалить без значимого изменения распределения ответов, что указывает на полное отсутствие причинной связи.
Как проверяют причинность: методология интервенций
Основной экспериментальный приём — принудительная правка промежуточных шагов с последующим измерением изменения ответа. Конкретно: модели подсовывают модифицированный scratchpad (с исправленными числами, изменённой логикой или подменённым промежуточным выводом) и смотрят, следует ли финальный ответ за правкой или игнорирует её.
В одном из препринтов авторы тестировали эту схему на задачах математического рассуждения и многошаговых QA. При подмене ключевого промежуточного вывода на противоположный ответ менялся лишь в 38–52% случаев в зависимости от модели и типа задачи. Это означает, что примерно в половине ситуаций модель «замечает» подмену и корректирует вывод, но в остальных случаях продолжает генерировать исходный ответ, опираясь на параметры, а не на текст цепочки.
Второй подход — ablation скрытого состояния: исследователи сравнивают активации в слоях трансформера при полном CoT и при его отсутствии. Если распределение финальных логитов практически не расходится, внутренние вычисления проходят мимо текстового промежуточного блока. В ряде экспериментов расхождение составляло менее 4% по KL-дивергенции между условиями «с CoT» и «без CoT» на задачах, где сам CoT выглядел содержательным и детализированным.
Третий метод — counterfactual probing: в цепочку вставляется заведомо ложный факт («модель А превосходит модель Б по метрике X», где это неверно), и измеряется, насколько часто финальный ответ воспроизводит этот факт. Если воспроизводит реже, чем ожидалось бы при полном доверии к CoT, значит модель частично игнорирует собственный scratchpad.
«Мы не утверждаем, что chain-of-thought бесполезен. Мы утверждаем, что он не является надёжным зеркалом вычислений» — формулировка из одного из препринтов, типичная для этого направления исследований.
Разрыв между моделями и типами задач
Не все модели и не все задачи показывают одинаковую картину. По совокупности препринтов прослеживается несколько закономерностей.
- Формальные задачи с однозначной проверкой (математика, код, логические головоломки) демонстрируют более высокую верность CoT: при интервенциях ответ меняется в 60–75% случаев, что указывает на реальную зависимость от промежуточных шагов.
- Задачи с открытым ответом (анализ текста, оценочные суждения, creative writing) показывают низкую верность: интервенции на CoT меняют ответ лишь в 25–40% случаев.
- Крупные модели с длинными цепочками рассуждений (extended-thinking класса) демонстрируют парадоксальный эффект: они чаще генерируют детализированные, убедительные рассуждения, но верность этих рассуждений по метрике причинной зависимости не выше, а в ряде задач ниже, чем у компактных моделей с короткими CoT.
- Модели, обученные с RLVR (reinforcement learning on verifiable reward), показывают рост верности на задачах с формальной проверкой: давление на финальный результат, по всей видимости, заставляет модель «проходить» через промежуточные шаги, а не обходить их.
Последний пункт особенно значим: он предполагает, что выбор метода обучения влияет на верность цепочек рассуждений не меньше, чем масштаб модели или длина контекста.
Что это меняет для безопасности агентных систем
Практическое значение этих результатов концентрируется в одной точке: мониторинг цепочек рассуждений как метод контроля агентных моделей теряет надёжность, если CoT не является причинным.
Несколько организаций — включая Anthropic и DeepMind — публично рассматривают «chain-of-thought monitoring» как один из механизмов надзора за агентными системами: оператор или автоматизированный фильтр просматривает scratchpad модели и останавливает выполнение при обнаружении нежелательных намерений. Если модель способна генерировать безвредный текст рассуждений, фактически действуя по иному пути, такой мониторинг превращается в проверку витрины, а не магазина.
Помимо явных угроз безопасности, есть более прозаичная проблема отладки: разработчики агентных пайплайнов используют CoT для диагностики ошибок. Если рассуждение — пост-рационализация, логи scratchpad могут давать ложное понимание причин сбоев, направляя усилия по исправлению в неверную сторону.
Для интерпретируемости вывод тоже неоднозначный. Mechanistic interpretability ищет причинно значимые компоненты в активациях сети; если CoT частично минует эти компоненты, текстовые рассуждения и внутренние репрезентации могут описывать разные вычислительные процессы — и методы, опирающиеся на один канал, будут систематически расходиться с методами, изучающими другой.
Открытый вопрос, на который у исследователей пока нет ответа: можно ли целенаправленно обучить модель так, чтобы верность CoT стала гарантированным свойством, а не случайным следствием типа задачи и метода обучения. RLVR даёт частичный ответ — но только для узкого класса формально проверяемых задач, тогда как большинство агентных сценариев лежит за пределами этого класса.