Inference-time scaling: кривые reasoning-моделей и реальная стоимость вычислений
Reasoning-режимы у o1, Claude и Gemini подняли качество за счёт compute на инференсе, а не на тренировке. Зависимость оказалась log-linear: удвоение thinking-токенов даёт 8–15 пунктов на математических задачах. Но за это платят в 5–15 раз большей стоимостью запроса.