ContextWindow
Тег

#compute

Исследования

Inference-time scaling: кривые reasoning-моделей и реальная стоимость вычислений

Reasoning-режимы у o1, Claude и Gemini подняли качество за счёт compute на инференсе, а не на тренировке. Зависимость оказалась log-linear: удвоение thinking-токенов даёт 8–15 пунктов на математических задачах. Но за это платят в 5–15 раз большей стоимостью запроса.